{"as_of":"2026-08-06T03:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fefe19e0c7b23b87f91eb20cf449e0b5b588846c5d5cfe1f0a26c54186ba26cc","coverage":[{"denominator":118,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-18T08:12:01.798459Z","state":"measured"},{"denominator":130,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":130,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":30,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":30,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T14:43:02.786626Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":1,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"cited_work":{"arxiv_id":"2409.10516","doi":"10.48550/arxiv.2409.10516","metadata_source":"pith","pith_arxiv_id":"2409.10516","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","venue":"cs.LG","work_id":"96e08aaa-a828-4d47-8eb6-182994c0f8f2","year":2024},"citing_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-17T11:16:31.904921Z"},"links":{"cited_paper":"/paper/2409.10516","citing_paper":"/paper/2407.11550"},"observation_digest":"sha256:64f62ee2b975e6be0abbff645872a3a889a780a9226d4269655b6f1e995cc96a","observation_id":"0e5c3793-50d4-462e-903e-5c8340166dfe","resolution":{"observed_at":"2026-05-18T08:12:02.395521Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"cited_work":{"arxiv_id":"2409.10516","doi":"10.48550/arxiv.2409.10516","metadata_source":"pith","pith_arxiv_id":"2409.10516","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","venue":"cs.LG","work_id":"96e08aaa-a828-4d47-8eb6-182994c0f8f2","year":2024},"citing_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-05-16T06:15:46.085555Z"},"links":{"cited_paper":"/paper/2409.10516","citing_paper":"/paper/2502.13189"},"observation_digest":"sha256:ce7d9c2802c771e287f43348c4c9dce5342546007e00664431d96cc4c54aae74","observation_id":"3e10dd34-8e53-4d49-97a5-93813fe8839a","resolution":{"observed_at":"2026-05-18T08:12:02.395521Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"cited_work":{"arxiv_id":"2409.10516","doi":"10.48550/arxiv.2409.10516","metadata_source":"pith","pith_arxiv_id":"2409.10516","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","venue":"cs.LG","work_id":"96e08aaa-a828-4d47-8eb6-182994c0f8f2","year":2024},"citing_paper":{"arxiv_id":"2505.02922","last_updated":"2026-04-27T10:13:35Z","snapshot_observed_at":"2026-08-02T06:23:14.961990Z","submitted_at":"2025-05-05T18:01:17Z","title":"RetroInfer: A Vector Storage Engine for Scalable Long-Context LLM Inference","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-22T15:59:04.724780Z"},"links":{"cited_paper":"/paper/2409.10516","citing_paper":"/paper/2505.02922"},"observation_digest":"sha256:13f3b19cd065822a5bb538688a1dcb419289c4715268b8c8ea7eb54bf22b0f3a","observation_id":"37d8729d-fb77-4706-967c-f7347e2aa8e0","resolution":{"observed_at":"2026-05-18T08:12:02.395521Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"cited_work":{"arxiv_id":"2409.10516","doi":"10.48550/arxiv.2409.10516","metadata_source":"pith","pith_arxiv_id":"2409.10516","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","venue":"cs.LG","work_id":"96e08aaa-a828-4d47-8eb6-182994c0f8f2","year":2024},"citing_paper":{"arxiv_id":"2505.24187","last_updated":"2026-05-06T02:36:34Z","snapshot_observed_at":"2026-07-12T01:50:56.587663Z","submitted_at":"2025-05-30T03:57:31Z","title":"Beyond Exponential Decay: Rethinking Error Accumulation in Large Language Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-19T14:07:42.408261Z"},"links":{"cited_paper":"/paper/2409.10516","citing_paper":"/paper/2505.24187"},"observation_digest":"sha256:f103bb20779a854a9607b8f023224b0129926a8071166edff04af61fda60b9b5","observation_id":"93e26f7a-290d-4965-92bd-5f69f6d8c844","resolution":{"observed_at":"2026-05-19T14:12:23.982580Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"cited_work":{"arxiv_id":"2409.10516","doi":"10.48550/arxiv.2409.10516","metadata_source":"pith","pith_arxiv_id":"2409.10516","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","venue":"cs.LG","work_id":"96e08aaa-a828-4d47-8eb6-182994c0f8f2","year":2024},"citing_paper":{"arxiv_id":"2507.03724","last_updated":"2025-12-03T03:19:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-04T17:21:46Z","title":"MemOS: A Memory OS for AI System","version":4},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-15T08:20:22.658329Z"},"links":{"cited_paper":"/paper/2409.10516","citing_paper":"/paper/2507.03724"},"observation_digest":"sha256:e92a680997d94be6a2ff7d9a371d12614f651f37972058bbdb430ba23ffd387c","observation_id":"577dc9ca-44fd-4f3e-ba4d-8fc50e49423a","resolution":{"observed_at":"2026-05-18T08:12:02.395521Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.10516","snapshot_observed_at":"2026-08-04T14:43:02.786626Z","title":"Retrievalattention: Accelerating long-context llm inference via vector retrieval","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.02361","last_updated":"2026-05-25T07:51:15Z","snapshot_observed_at":"2026-08-04T14:42:55.586487Z","submitted_at":"2025-09-28T11:04:00Z","title":"ChunkLLM: A Lightweight Pluggable Framework for Accelerating LLMs Inference","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:02.786626Z"},"links":{"cited_paper":"/paper/2409.10516","citing_paper":"/paper/2510.02361"},"observation_digest":"sha256:4dd8c2b0783c5c7930c583a3cf30868b303c4d3ad831164e1e7207fc4d96d8ad","observation_id":"0f3ad922-f04f-4d20-8792-028b5c857272","resolution":{"observed_at":"2026-08-04T14:43:02.786626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"cited_work":{"arxiv_id":"2409.10516","doi":"10.48550/arxiv.2409.10516","metadata_source":"pith","pith_arxiv_id":"2409.10516","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","venue":"cs.LG","work_id":"96e08aaa-a828-4d47-8eb6-182994c0f8f2","year":2024},"citing_paper":{"arxiv_id":"2510.09883","last_updated":"2026-05-02T01:10:22Z","snapshot_observed_at":"2026-08-02T19:55:25.209109Z","submitted_at":"2025-10-10T21:37:49Z","title":"DELTA: Dynamic Layer-Aware Token Attention for Efficient Long-Context Reasoning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-18T07:25:56.953876Z"},"links":{"cited_paper":"/paper/2409.10516","citing_paper":"/paper/2510.09883"},"observation_digest":"sha256:def4c897908ab93b41d9007b485521e8a34b2a697a9d158bffa88099cab2ac2d","observation_id":"d9d74b36-10be-4808-90a4-be9ddf1aa955","resolution":{"observed_at":"2026-05-18T08:12:02.395521Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.10516","snapshot_observed_at":"2026-08-03T13:51:32.105366Z","title":"Retrievalattention: Accelerating long-context llm inference via vector retrieval.arXiv preprint arXiv:2409.10516, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.22838","last_updated":"2026-07-07T09:01:40Z","snapshot_observed_at":"2026-08-03T13:51:30.167172Z","submitted_at":"2025-12-28T08:42:38Z","title":"OrchANN: Hierarchical Orchestration for Skewed Out-of-Core Vector Search","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T13:51:32.105366Z"},"links":{"cited_paper":"/paper/2409.10516","citing_paper":"/paper/2512.22838"},"observation_digest":"sha256:c95fed82a65a8070963e57f1ccb4a67ea2385d9f9ebbcbc0f0a849bb5faf947f","observation_id":"8a3df2a8-96b4-4863-b7cf-3b9461b02289","resolution":{"observed_at":"2026-08-03T13:51:32.105366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.10516","snapshot_observed_at":"2026-08-03T03:37:50.127301Z","title":"Re- trievalattention: Accelerating long-context llm inference via vector retrieval.arXiv preprint arXiv:2409.10516, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.07721","last_updated":"2026-05-28T23:34:23Z","snapshot_observed_at":"2026-08-03T03:37:48.402653Z","submitted_at":"2026-02-07T22:26:45Z","title":"ParisKV: Fast and Drift-Robust KV-Cache Retrieval for Long-Context LLMs","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T03:37:50.127301Z"},"links":{"cited_paper":"/paper/2409.10516","citing_paper":"/paper/2602.07721"},"observation_digest":"sha256:faf3fb08927a451aecffa4d1c322fea7175029ad11d2c51e9145b438084c8150","observation_id":"fb654b63-897c-4477-b8b9-d47133cae295","resolution":{"observed_at":"2026-08-03T03:37:50.127301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"cited_work":{"arxiv_id":"2409.10516","doi":"10.48550/arxiv.2409.10516","metadata_source":"pith","pith_arxiv_id":"2409.10516","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","venue":"cs.LG","work_id":"96e08aaa-a828-4d47-8eb6-182994c0f8f2","year":2024},"citing_paper":{"arxiv_id":"2604.07659","last_updated":"2026-04-08T23:56:05Z","snapshot_observed_at":"2026-07-06T22:55:50.808914Z","submitted_at":"2026-04-08T23:56:05Z","title":"Efficient and Effective Internal Memory Retrieval for LLM-Based Healthcare Prediction","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T17:11:51.802541Z"},"links":{"cited_paper":"/paper/2409.10516","citing_paper":"/paper/2604.07659"},"observation_digest":"sha256:6a585b0e47f05d3247bf776fb0906344ec3918a5965cb8626b19a772705424aa","observation_id":"ce26225d-95d8-40f2-983f-db61e57bddef","resolution":{"observed_at":"2026-05-18T08:12:02.395521Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"cited_work":{"arxiv_id":"2409.10516","doi":"10.48550/arxiv.2409.10516","metadata_source":"pith","pith_arxiv_id":"2409.10516","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","venue":"cs.LG","work_id":"96e08aaa-a828-4d47-8eb6-182994c0f8f2","year":2024},"citing_paper":{"arxiv_id":"2604.08426","last_updated":"2026-05-15T16:23:48Z","snapshot_observed_at":"2026-08-03T00:42:33.853267Z","submitted_at":"2026-04-09T16:30:44Z","title":"KV Cache Offloading for Context-Intensive Tasks","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-10T16:49:13.353700Z"},"links":{"cited_paper":"/paper/2409.10516","citing_paper":"/paper/2604.08426"},"observation_digest":"sha256:931a11e94f27e8ce321bb557fe1cc160a7498ec1978095707b6cc72e7d8c43bd","observation_id":"615c7603-3175-419f-b001-790380685650","resolution":{"observed_at":"2026-05-18T08:12:02.395521Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"cited_work":{"arxiv_id":"2409.10516","doi":"10.48550/arxiv.2409.10516","metadata_source":"pith","pith_arxiv_id":"2409.10516","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","venue":"cs.LG","work_id":"96e08aaa-a828-4d47-8eb6-182994c0f8f2","year":2024},"citing_paper":{"arxiv_id":"2604.08426","last_updated":"2026-05-15T16:23:48Z","snapshot_observed_at":"2026-08-03T00:42:33.853267Z","submitted_at":"2026-04-09T16:30:44Z","title":"KV Cache Offloading for Context-Intensive Tasks","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-11T01:48:21.341462Z"},"links":{"cited_paper":"/paper/2409.10516","citing_paper":"/paper/2604.08426"},"observation_digest":"sha256:5458b1ccf795f7dfbf287a9ced9d3e634f0ced62146e8b8d8c7ba24ef44ed608","observation_id":"04a85071-d8c1-455e-bb55-4a0c42a01ec2","resolution":{"observed_at":"2026-05-18T08:12:02.395521Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"cited_work":{"arxiv_id":"2409.10516","doi":"10.48550/arxiv.2409.10516","metadata_source":"pith","pith_arxiv_id":"2409.10516","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","venue":"cs.LG","work_id":"96e08aaa-a828-4d47-8eb6-182994c0f8f2","year":2024},"citing_paper":{"arxiv_id":"2604.08426","last_updated":"2026-05-15T16:23:48Z","snapshot_observed_at":"2026-08-03T00:42:33.853267Z","submitted_at":"2026-04-09T16:30:44Z","title":"KV Cache Offloading for Context-Intensive Tasks","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-13T07:35:30.155592Z"},"links":{"cited_paper":"/paper/2409.10516","citing_paper":"/paper/2604.08426"},"observation_digest":"sha256:35fd0b8234d2ab203cb5b9bbdb630c980ff01854d5a55c3ddae2791cbaaff871","observation_id":"88ec4cfa-dc85-417e-8ec1-ab606d2aa155","resolution":{"observed_at":"2026-05-18T08:12:02.395521Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"cited_work":{"arxiv_id":"2409.10516","doi":"10.48550/arxiv.2409.10516","metadata_source":"pith","pith_arxiv_id":"2409.10516","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","venue":"cs.LG","work_id":"96e08aaa-a828-4d47-8eb6-182994c0f8f2","year":2024},"citing_paper":{"arxiv_id":"2604.08426","last_updated":"2026-05-15T16:23:48Z","snapshot_observed_at":"2026-08-03T00:42:33.853267Z","submitted_at":"2026-04-09T16:30:44Z","title":"KV Cache Offloading for Context-Intensive Tasks","version":4},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-19T16:41:30.021302Z"},"links":{"cited_paper":"/paper/2409.10516","citing_paper":"/paper/2604.08426"},"observation_digest":"sha256:4ad52a752aeabfc336d7fa1009b195363b3e799a653b16e7d649b19627ca2b0c","observation_id":"db1b1c4b-5f40-4c74-adc8-2abde36d6272","resolution":{"observed_at":"2026-05-19T16:42:39.684879Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"cited_work":{"arxiv_id":"2409.10516","doi":"10.48550/arxiv.2409.10516","metadata_source":"pith","pith_arxiv_id":"2409.10516","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","venue":"cs.LG","work_id":"96e08aaa-a828-4d47-8eb6-182994c0f8f2","year":2024},"citing_paper":{"arxiv_id":"2604.08584","last_updated":"2026-03-30T01:42:29Z","snapshot_observed_at":"2026-07-06T22:57:40.773778Z","submitted_at":"2026-03-30T01:42:29Z","title":"CSAttention: Centroid-Scoring Attention for Accelerating LLM Inference","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-14T21:52:25.148104Z"},"links":{"cited_paper":"/paper/2409.10516","citing_paper":"/paper/2604.08584"},"observation_digest":"sha256:b3a301abed2416d4f317dbc9a6931089c63ef927e82f06edc90f63e119a6ec17","observation_id":"3376f755-de3f-43f0-968d-d4a73ec6ca4e","resolution":{"observed_at":"2026-05-18T08:12:02.395521Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"cited_work":{"arxiv_id":"2409.10516","doi":"10.48550/arxiv.2409.10516","metadata_source":"pith","pith_arxiv_id":"2409.10516","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","venue":"cs.LG","work_id":"96e08aaa-a828-4d47-8eb6-182994c0f8f2","year":2024},"citing_paper":{"arxiv_id":"2604.15583","last_updated":"2026-04-24T15:54:27Z","snapshot_observed_at":"2026-07-06T23:03:07.228701Z","submitted_at":"2026-04-16T23:34:51Z","title":"SAGE: Selective Attention-Guided Extraction for Token-Efficient Document Indexing","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T08:32:02.222528Z"},"links":{"cited_paper":"/paper/2409.10516","citing_paper":"/paper/2604.15583"},"observation_digest":"sha256:40a5da342d10041a9ecec1e461d5d51854a3be1ddcae2fdc1bcee406530d6b22","observation_id":"9730729a-f235-4635-b290-f8efbcd46da0","resolution":{"observed_at":"2026-05-18T08:12:02.395521Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"cited_work":{"arxiv_id":"2409.10516","doi":"10.48550/arxiv.2409.10516","metadata_source":"pith","pith_arxiv_id":"2409.10516","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","venue":"cs.LG","work_id":"96e08aaa-a828-4d47-8eb6-182994c0f8f2","year":2024},"citing_paper":{"arxiv_id":"2604.16983","last_updated":"2026-04-18T12:55:28Z","snapshot_observed_at":"2026-07-06T23:04:10.324443Z","submitted_at":"2026-04-18T12:55:28Z","title":"Graph-Guided Adaptive Channel Elimination for KV Cache Compression","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T07:06:08.786535Z"},"links":{"cited_paper":"/paper/2409.10516","citing_paper":"/paper/2604.16983"},"observation_digest":"sha256:d753246c95799434fde0b56e7514ccacd163781f22908046f68ad818cd76cc49","observation_id":"22d5ceab-e1c3-4032-a1f2-3eea0fa57b3d","resolution":{"observed_at":"2026-05-18T08:12:02.395521Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"cited_work":{"arxiv_id":"2409.10516","doi":"10.48550/arxiv.2409.10516","metadata_source":"pith","pith_arxiv_id":"2409.10516","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","venue":"cs.LG","work_id":"96e08aaa-a828-4d47-8eb6-182994c0f8f2","year":2024},"citing_paper":{"arxiv_id":"2604.18137","last_updated":"2026-04-20T12:04:51Z","snapshot_observed_at":"2026-07-06T23:05:04.279268Z","submitted_at":"2026-04-20T12:04:51Z","title":"AQPIM: Breaking the PIM Capacity Wall for LLMs with In-Memory Activation Quantization","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-10T04:09:11.684432Z"},"links":{"cited_paper":"/paper/2409.10516","citing_paper":"/paper/2604.18137"},"observation_digest":"sha256:6054ae5bce88c85e27dec7f9961144b1f675759da3c1f979ba2256a74256bcb6","observation_id":"d641adb8-941b-42eb-b79b-f44fa5960f3d","resolution":{"observed_at":"2026-05-18T08:12:02.395521Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"cited_work":{"arxiv_id":"2409.10516","doi":"10.48550/arxiv.2409.10516","metadata_source":"pith","pith_arxiv_id":"2409.10516","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","venue":"cs.LG","work_id":"96e08aaa-a828-4d47-8eb6-182994c0f8f2","year":2024},"citing_paper":{"arxiv_id":"2604.24647","last_updated":"2026-04-27T16:15:37Z","snapshot_observed_at":"2026-07-06T23:10:38.548416Z","submitted_at":"2026-04-27T16:15:37Z","title":"DepthKV: Layer-Dependent KV Cache Pruning for Long-Context LLM Inference","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-08T03:49:01.267556Z"},"links":{"cited_paper":"/paper/2409.10516","citing_paper":"/paper/2604.24647"},"observation_digest":"sha256:123fadefa63f680a792b1437a016385da0d1c12f0f819d7f2217e2810ebf4191","observation_id":"22025de9-d6e1-4a7e-bbc1-35ea733ab356","resolution":{"observed_at":"2026-05-18T08:12:02.395521Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"cited_work":{"arxiv_id":"2409.10516","doi":"10.48550/arxiv.2409.10516","metadata_source":"pith","pith_arxiv_id":"2409.10516","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","venue":"cs.LG","work_id":"96e08aaa-a828-4d47-8eb6-182994c0f8f2","year":2024},"citing_paper":{"arxiv_id":"2604.26837","last_updated":"2026-04-29T16:02:00Z","snapshot_observed_at":"2026-07-06T23:12:24.456023Z","submitted_at":"2026-04-29T16:02:00Z","title":"Unifying Sparse Attention with Hierarchical Memory for Scalable Long-Context LLM Serving","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-07T13:15:21.201950Z"},"links":{"cited_paper":"/paper/2409.10516","citing_paper":"/paper/2604.26837"},"observation_digest":"sha256:da458e3ea24225576e542e6756ae8645e0a0e3e30aa84b7ee9df1cb3920ede15","observation_id":"47b902b8-c3e2-475c-85fd-c076c35d01a7","resolution":{"observed_at":"2026-05-18T08:12:02.395521Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"cited_work":{"arxiv_id":"2409.10516","doi":"10.48550/arxiv.2409.10516","metadata_source":"pith","pith_arxiv_id":"2409.10516","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","venue":"cs.LG","work_id":"96e08aaa-a828-4d47-8eb6-182994c0f8f2","year":2024},"citing_paper":{"arxiv_id":"2605.06763","last_updated":"2026-05-11T02:30:41Z","snapshot_observed_at":"2026-07-06T23:19:10.574595Z","submitted_at":"2026-05-07T17:37:56Z","title":"Sparse Attention as a Range Searching Problem: Towards an Inference-Efficient Index for KV Cache","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-11T01:15:35.871863Z"},"links":{"cited_paper":"/paper/2409.10516","citing_paper":"/paper/2605.06763"},"observation_digest":"sha256:cc08f70ba7a4b5b775ba0053054b89e4f983cfdcb558702513ade2556049d71a","observation_id":"fb27999c-de98-4a89-9908-8c25500d99a3","resolution":{"observed_at":"2026-05-18T08:12:02.395521Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"cited_work":{"arxiv_id":"2409.10516","doi":"10.48550/arxiv.2409.10516","metadata_source":"pith","pith_arxiv_id":"2409.10516","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","venue":"cs.LG","work_id":"96e08aaa-a828-4d47-8eb6-182994c0f8f2","year":2024},"citing_paper":{"arxiv_id":"2605.09649","last_updated":"2026-05-10T16:47:50Z","snapshot_observed_at":"2026-07-06T23:21:44.900680Z","submitted_at":"2026-05-10T16:47:50Z","title":"Make Each Token Count: Towards Improving Long-Context Performance with KV Cache Eviction","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-12T05:02:25.513351Z"},"links":{"cited_paper":"/paper/2409.10516","citing_paper":"/paper/2605.09649"},"observation_digest":"sha256:83d6950970e6526c71c4865578f01de27cf3e865075f6f64fbaaeed1b7e125a8","observation_id":"85741ffd-ef11-49db-9dd8-571b56e02b91","resolution":{"observed_at":"2026-05-18T08:12:02.395521Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"cited_work":{"arxiv_id":"2409.10516","doi":"10.48550/arxiv.2409.10516","metadata_source":"pith","pith_arxiv_id":"2409.10516","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","venue":"cs.LG","work_id":"96e08aaa-a828-4d47-8eb6-182994c0f8f2","year":2024},"citing_paper":{"arxiv_id":"2605.10135","last_updated":"2026-05-11T07:46:07Z","snapshot_observed_at":"2026-07-06T23:22:08.560919Z","submitted_at":"2026-05-11T07:46:07Z","title":"ScaleGANN: Accelerate Large-Scale ANN Indexing by Cost-effective Cloud GPUs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-12T04:53:42.872514Z"},"links":{"cited_paper":"/paper/2409.10516","citing_paper":"/paper/2605.10135"},"observation_digest":"sha256:bcf742453d88cc566292c03782d23d75efd08b9597a7e8d91670add7b6421606","observation_id":"838dcba2-0b94-4b78-930c-748859302263","resolution":{"observed_at":"2026-05-18T08:12:02.395521Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"cited_work":{"arxiv_id":"2409.10516","doi":"10.48550/arxiv.2409.10516","metadata_source":"pith","pith_arxiv_id":"2409.10516","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","venue":"cs.LG","work_id":"96e08aaa-a828-4d47-8eb6-182994c0f8f2","year":2024},"citing_paper":{"arxiv_id":"2605.12110","last_updated":"2026-05-12T13:23:55Z","snapshot_observed_at":"2026-07-06T23:23:48.960874Z","submitted_at":"2026-05-12T13:23:55Z","title":"AB-Sparse: Sparse Attention with Adaptive Block Size for Accurate and Efficient Long-Context Inference","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-13T04:42:26.433689Z"},"links":{"cited_paper":"/paper/2409.10516","citing_paper":"/paper/2605.12110"},"observation_digest":"sha256:710b114c1fc3cd2b9a63f379150833fe44a29586783da31220ac17188fb735ab","observation_id":"80d8bbe1-747c-453d-8ee9-b1940ddeceba","resolution":{"observed_at":"2026-05-18T08:12:02.395521Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"cited_work":{"arxiv_id":"2409.10516","doi":"10.48550/arxiv.2409.10516","metadata_source":"pith","pith_arxiv_id":"2409.10516","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","venue":"cs.LG","work_id":"96e08aaa-a828-4d47-8eb6-182994c0f8f2","year":2024},"citing_paper":{"arxiv_id":"2605.18071","last_updated":"2026-05-18T08:54:16Z","snapshot_observed_at":"2026-08-02T15:32:20.092680Z","submitted_at":"2026-05-18T08:54:16Z","title":"KVDrive: A Holistic Multi-Tier KV Cache Management System for Long-Context LLM Inference","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-20T11:13:46.098095Z"},"links":{"cited_paper":"/paper/2409.10516","citing_paper":"/paper/2605.18071"},"observation_digest":"sha256:3d2a377a4159d38ca92f4c9f00acc081032e2b9d17b3eba54313ab3a727e5f3a","observation_id":"085003e4-696a-4ef7-87b3-c39a1326c600","resolution":{"observed_at":"2026-05-20T11:18:13.967617Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"cited_work":{"arxiv_id":"2409.10516","doi":"10.48550/arxiv.2409.10516","metadata_source":"pith","pith_arxiv_id":"2409.10516","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","venue":"cs.LG","work_id":"96e08aaa-a828-4d47-8eb6-182994c0f8f2","year":2024},"citing_paper":{"arxiv_id":"2606.11470","last_updated":"2026-06-09T21:59:37Z","snapshot_observed_at":"2026-07-06T23:50:35.052764Z","submitted_at":"2026-06-09T21:59:37Z","title":"The Periodic Table of LLM Reasoning: A Structured Survey of Reasoning Paradigms, Methods, and Failure Modes","version":1},"reference_index":150,"source":"arxiv_source","source_observed_at":"2026-06-27T12:59:51.091008Z"},"links":{"cited_paper":"/paper/2409.10516","citing_paper":"/paper/2606.11470"},"observation_digest":"sha256:976771cb2f1f619747e3e30d449858a5faa98410fbb351e2c240419e3d26cc16","observation_id":"73ce100b-1fae-45ab-ab40-02bf7e9a5f2a","resolution":{"observed_at":"2026-07-03T05:57:41.184943Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"cited_work":{"arxiv_id":"2409.10516","doi":"10.48550/arxiv.2409.10516","metadata_source":"pith","pith_arxiv_id":"2409.10516","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","venue":"cs.LG","work_id":"96e08aaa-a828-4d47-8eb6-182994c0f8f2","year":2024},"citing_paper":{"arxiv_id":"2606.31519","last_updated":"2026-06-30T11:32:14Z","snapshot_observed_at":"2026-08-03T23:10:23.282240Z","submitted_at":"2026-06-30T11:32:14Z","title":"RaBitQCache: Rotated Binary Quantization for KVCache in Long Context LLM Inference","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-07-01T06:34:15.790154Z"},"links":{"cited_paper":"/paper/2409.10516","citing_paper":"/paper/2606.31519"},"observation_digest":"sha256:7bbb5bc1dc4f4326f7297b846d420f11fcc6fbb4134e93057cadb80607074c21","observation_id":"f3400f28-bfc0-4fdb-a459-eddd582044c8","resolution":{"observed_at":"2026-07-01T06:35:29.439088Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.10516","snapshot_observed_at":"2026-08-01T15:06:54.254928Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26475","last_updated":"2026-07-29T05:01:42Z","snapshot_observed_at":"2026-08-05T14:33:09.805926Z","submitted_at":"2026-07-29T05:01:42Z","title":"DualDecoder: Accelerate Long Context LLM Inference by Predictive Prefetch","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T15:06:54.254928Z"},"links":{"cited_paper":"/paper/2409.10516","citing_paper":"/paper/2607.26475"},"observation_digest":"sha256:9f7dda542fdfc203a6050d0861d4d3713bac34e29e1823a762de4efd7f7b8fea","observation_id":"792b288a-5629-4875-a7a3-0eadd081c27c","resolution":{"observed_at":"2026-08-01T15:06:54.254928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.10516","snapshot_observed_at":"2026-08-03T04:01:06.893261Z","title":"URL https://arxiv.org/ abs/2409.10516","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29591","last_updated":"2026-07-31T16:16:45Z","snapshot_observed_at":"2026-08-05T23:15:56.574410Z","submitted_at":"2026-07-31T16:16:45Z","title":"ResKV: Reconstructing Omitted Attention Contributions for Fixed-Budget KV Cache Compression","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T04:01:06.893261Z"},"links":{"cited_paper":"/paper/2409.10516","citing_paper":"/paper/2607.29591"},"observation_digest":"sha256:72e4f091325ac35a4d7c02d6f6281c7e7f75919ecf51474b69b149c7c9e94c0f","observation_id":"5b8ca242-c574-4053-a4fd-bab8a61c873c","resolution":{"observed_at":"2026-08-03T04:01:06.893261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.10516","snapshot_observed_at":"2026-08-04T13:43:55.807123Z","title":"arXiv preprint arXiv:2409.10516 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02150","last_updated":"2026-08-05T06:57:37Z","snapshot_observed_at":"2026-08-06T02:40:09.676336Z","submitted_at":"2026-08-03T12:34:31Z","title":"PhyCheck: Fine-Grained Evidence-Grounded Dataset for Physical Law Understanding in Video-LLMs","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-04T13:43:55.807123Z"},"links":{"cited_paper":"/paper/2409.10516","citing_paper":"/paper/2608.02150"},"observation_digest":"sha256:ffe09ced8b7b894fcb21f1f1c7c803048e13b31ee95188be2dbfccba79faa7e3","observation_id":"ace33b7f-be03-468b-b58c-17cc2a456267","resolution":{"observed_at":"2026-08-04T13:43:55.807123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2409.10516/citation-record","integrity":"/paper/2409.10516/integrity","json":"/paper/2409.10516/citation-record.json","paper":"/paper/2409.10516"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T13:07:05.804778Z","title":"Scaling Learning Algorithms Towards","venue":null,"work_id":"bb2761cc-98d0-411b-92f6-803773d64460","year":null},"citing_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-05-18T08:12:01.798459Z"},"links":{"citing_paper":"/paper/2409.10516"},"observation_digest":"sha256:ec10fdff034ac29e532f60e8780a963e31f74375f5bfa90cfb9e60d81ac5907a","observation_id":"73377b4f-3a13-438c-a642-8cbd085b289c","resolution":{"observed_at":"2026-05-18T08:12:02.302095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T13:07:05.766846Z","title":"and Osindero, Simon and Teh, Yee Whye , journal =","venue":null,"work_id":"0a5921e3-ac4e-46f1-85ae-866119a87be0","year":null},"citing_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-05-18T08:12:01.798459Z"},"links":{"citing_paper":"/paper/2409.10516"},"observation_digest":"sha256:210c75dd6b6d71dd31167b9efd522be032bb695bb3b9b8738fb3df168db12c3c","observation_id":"1a089186-eab7-4b7b-92f1-5729d0385891","resolution":{"observed_at":"2026-05-18T08:12:02.311323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T21:57:45.913036Z","title":"2016 , publisher=","venue":null,"work_id":"cf0899e0-53ee-4591-aae4-f38fa5ac12ad","year":2016},"citing_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-18T08:12:01.798459Z"},"links":{"citing_paper":"/paper/2409.10516"},"observation_digest":"sha256:d4449c75d09770752c27c5bf105fcfcc56353b26ea600e3762a71663b95c8196","observation_id":"a5a5c367-551b-4164-bb4a-d682582842c0","resolution":{"observed_at":"2026-05-18T08:12:02.315146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"IEEE Transactions on Computers , volume=","venue":null,"work_id":"4ac530da-dbef-449e-b295-22c7fb0c09fc","year":1979},"citing_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-18T08:12:01.798459Z"},"links":{"citing_paper":"/paper/2409.10516"},"observation_digest":"sha256:90bbe7f96373095a0641130fb78408f9264bacb665ba7507e2448f0cd9d1e8ff","observation_id":"4770016a-b290-44c3-ac4f-3bf5ed777ecc","resolution":{"observed_at":"2026-05-18T08:12:02.318420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"IEEE Transactions on Big Data , volume=","venue":null,"work_id":"8ed12345-c3b3-4305-8795-6b590df21d35","year":2019},"citing_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-18T08:12:01.798459Z"},"links":{"citing_paper":"/paper/2409.10516"},"observation_digest":"sha256:a121c959b3bb309ca676525fba47d0cc0118cb08b27c8ff65c4a151cb9fb9938","observation_id":"1eb601b0-52b1-4549-be1d-bd86d0ea179c","resolution":{"observed_at":"2026-05-18T08:12:02.321872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08608","last_updated":"2024-07-12T22:15:02Z","snapshot_observed_at":"2026-07-06T18:44:53.587276Z","submitted_at":"2024-07-11T15:44:48Z","title":"FlashAttention-3: Fast and Accurate Attention with Asynchrony and Low-precision","version":2},"cited_work":{"arxiv_id":"2407.08608","doi":"10.48550/arxiv.2407.08608","metadata_source":"pith","pith_arxiv_id":"2407.08608","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FlashAttention-3: Fast and Accurate Attention with Asynchrony and Low-precision","venue":"cs.LG","work_id":"12a0982c-8c36-42c7-88e1-4a8bfb2aa44d","year":2024},"citing_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-18T08:12:01.798459Z"},"links":{"cited_paper":"/paper/2407.08608","citing_paper":"/paper/2409.10516"},"observation_digest":"sha256:29c3a94a2feb4e9bf1e7767768967254aadb8c8bdaeeea7606b3173ad0828745","observation_id":"fb833c48-76a8-4886-b567-fd6b592e4807","resolution":{"observed_at":"2026-05-20T19:45:36.571697Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"OOD-DiskANN: Efficient and Scalable Graph","venue":null,"work_id":"fdcec2c9-6a6b-4e7d-8312-1e1459f9c265","year":null},"citing_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-05-18T08:12:01.798459Z"},"links":{"citing_paper":"/paper/2409.10516"},"observation_digest":"sha256:cdd761f3ae9362d3eb6d8783517ba25f802357641e804759d2f789c5007453b0","observation_id":"8b466e0c-38b5-4a88-ae52-218beb04d046","resolution":{"observed_at":"2026-05-18T08:12:02.327034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"CoRR , volume =","venue":null,"work_id":"b43f0b59-e238-4e9c-a72a-a121a14a6917","year":null},"citing_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-18T08:12:01.798459Z"},"links":{"citing_paper":"/paper/2409.10516"},"observation_digest":"sha256:d9c7f38d39a0af3f52542a33a0fbbd57290a8c2f5c83a781ab9ea26b10fc5aff","observation_id":"6c4bf14a-0a2f-4ae7-81df-42c4df7d4c1c","resolution":{"observed_at":"2026-05-18T08:12:02.330821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gomez and Lukasz Kaiser and Illia Polosukhin , bibsource =","venue":null,"work_id":"c6bd0e88-e0a3-4665-920e-d03b14d90afb","year":2017},"citing_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-18T08:12:01.798459Z"},"links":{"citing_paper":"/paper/2409.10516"},"observation_digest":"sha256:b654fae2f2d09c28388a5a8ed603beb36b0d9b44fb8ae7743376e247fcfc8866","observation_id":"feae6a00-4d95-46ab-b168-e16390f6b7c5","resolution":{"observed_at":"2026-05-18T08:12:02.334994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A weighted nearest neighbor algorithm for learning with symbolic features , volume =","venue":null,"work_id":"d1a7b605-7e1f-4527-9ed1-3cc6972ce655","year":null},"citing_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-18T08:12:01.798459Z"},"links":{"citing_paper":"/paper/2409.10516"},"observation_digest":"sha256:1e6ebc6ba287117495e59d8685cf17763cc40bd6110dcd94d583a0e9bfdf38a2","observation_id":"a3d8e2c6-0682-49a6-ad39-3f9f9f04647a","resolution":{"observed_at":"2026-05-18T08:12:02.338991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"seed , volume=","venue":null,"work_id":"dc9f0801-2031-4207-ad23-e1417950cf55","year":null},"citing_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-18T08:12:01.798459Z"},"links":{"citing_paper":"/paper/2409.10516"},"observation_digest":"sha256:e90372394b9846fba679a0ae7d0472809e0d54f6020462da09819b63582e5ccd","observation_id":"68bef60b-9c91-4749-b434-cda636492075","resolution":{"observed_at":"2026-05-18T08:12:02.342638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Query by image and video content: The QBIC system , volume =","venue":null,"work_id":"6babfc0a-e0f2-4e59-bece-e00c3da659b6","year":null},"citing_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-18T08:12:01.798459Z"},"links":{"citing_paper":"/paper/2409.10516"},"observation_digest":"sha256:35f723621d4274178596d199cc7f062a8388bcd2b28db2fe8cfd0d522ec8abe4","observation_id":"eaabb11d-b223-4045-a11b-876d5acb14a1","resolution":{"observed_at":"2026-05-18T08:12:02.346430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"PQCache: Product Quantization-based KVCache for Long Context LLM Inference , url =","venue":null,"work_id":"7c3e5cb8-a976-4697-8267-21afb7bc0227","year":null},"citing_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-18T08:12:01.798459Z"},"links":{"citing_paper":"/paper/2409.10516"},"observation_digest":"sha256:e2a8859a7067ad8851a5b61a9f1db342f4fada104f1dd2277e7645b7efbcd172","observation_id":"52c5614c-469d-4713-9da8-b377c1b7e5c2","resolution":{"observed_at":"2026-05-18T08:12:02.350936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"aace6f83-5b03-45bd-b646-db7578dfefc8","year":null},"citing_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-18T08:12:01.798459Z"},"links":{"citing_paper":"/paper/2409.10516"},"observation_digest":"sha256:1a7fb3bdde40e1b5a1bd4f7d0571ed152c6caf6a3d3e2cb87687ca5ed3930ba3","observation_id":"681e026c-d1d3-4d37-8881-d80bf084cafb","resolution":{"observed_at":"2026-05-18T08:12:02.354825Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"d9010a46-d230-46d3-866a-944f79f56519","year":null},"citing_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-18T08:12:01.798459Z"},"links":{"citing_paper":"/paper/2409.10516"},"observation_digest":"sha256:94a97943a68bf683d18f10be4e63a685a92da6b942dd2ab782f5b9960904c1b0","observation_id":"98d952c5-9c26-47bb-b2e8-1ae74c794f5f","resolution":{"observed_at":"2026-05-18T08:12:02.358099Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":"2403.05530","doi":"10.48550/arxiv.2403.05530","metadata_source":"pith","pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","venue":"cs.CL","work_id":"80e3e977-f1bb-4c83-8d0c-1ab0a0c5c3f1","year":2024},"citing_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-18T08:12:01.798459Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2409.10516"},"observation_digest":"sha256:f8a3a496fb7410819837ba566d5e8c2d215cfdba3d683f41e2b869e4f546e59a","observation_id":"480d7388-ff99-4d8f-b3f9-5249d13b4eb5","resolution":{"observed_at":"2026-05-18T08:12:01.998159Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-02T03:08:14.426583+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-02T03:08:14.426583+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The Twelfth International Conference on Learning Representations","venue":null,"work_id":"c2661d59-0dda-4647-9120-949c7773f8ea","year":2024},"citing_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-18T08:12:01.798459Z"},"links":{"citing_paper":"/paper/2409.10516"},"observation_digest":"sha256:67ffcc79ce85550e9a996b4b9b20311c27bfd57c6065025f442a04dc9d141839","observation_id":"fc65432e-90ea-4a2b-a055-9665cb4d7c1b","resolution":{"observed_at":"2026-05-18T08:12:02.361802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.07055","last_updated":"2024-08-13T17:46:12Z","snapshot_observed_at":"2026-07-06T19:00:17.992934Z","submitted_at":"2024-08-13T17:46:12Z","title":"LongWriter: Unleashing 10,000+ Word Generation from Long Context LLMs","version":1},"cited_work":{"arxiv_id":"2408.07055","doi":"10.48550/arxiv.2408.07055","metadata_source":"arxiv_reference","pith_arxiv_id":"2408.07055","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2408.07055 , year=","venue":"arXiv (Cornell University)","work_id":"7b17f534-444c-40c9-8c05-ead22c892088","year":2024},"citing_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-18T08:12:01.798459Z"},"links":{"cited_paper":"/paper/2408.07055","citing_paper":"/paper/2409.10516"},"observation_digest":"sha256:6fc8dd949d8421885371f3408b40c00b264bf2a03248a4f5024840ba53be88eb","observation_id":"fc2b2041-fb93-4cef-bb14-1326f0f33abd","resolution":{"observed_at":"2026-05-18T08:12:01.900718Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sean , doi =","venue":null,"work_id":"54f34b63-b2a3-492f-b838-fe5c7abe71bc","year":null},"citing_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-18T08:12:01.798459Z"},"links":{"citing_paper":"/paper/2409.10516"},"observation_digest":"sha256:c3b235e4887665f06461f71ebe72b66370fdb752218dd901777db0dbbb782d77","observation_id":"0c948570-1561-4632-8e8f-813da7fdd902","resolution":{"observed_at":"2026-05-18T08:12:02.365074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reformer: The Efficient Transformer , url =","venue":null,"work_id":"78db9baa-57f4-4109-a103-e2e61c4867f1","year":null},"citing_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-05-18T08:12:01.798459Z"},"links":{"citing_paper":"/paper/2409.10516"},"observation_digest":"sha256:67c7d21ccd3c0964739ea0b33f38992f6645de7da8af618c872c2d541be1ab53","observation_id":"8136a523-356d-4264-8f3b-2d40edc397da","resolution":{"observed_at":"2026-05-18T08:12:02.368907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"5de990a4-74a0-4864-b7e6-f3759a60ad5a","year":null},"citing_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-18T08:12:01.798459Z"},"links":{"citing_paper":"/paper/2409.10516"},"observation_digest":"sha256:2cd4de19657c2f9c46b26ecf4a5be5f70812910615e25f730cdb173e973b66ac","observation_id":"532345c6-e323-439d-a52c-6b6404c76e8d","resolution":{"observed_at":"2026-05-18T08:12:02.372011Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"072e0b85-170e-43b0-8bbd-4ff4b9247163","year":null},"citing_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-18T08:12:01.798459Z"},"links":{"citing_paper":"/paper/2409.10516"},"observation_digest":"sha256:d2dd6be2f8adbfa697f8262450939b88facb6153dc5675a0c01a2ef46159d153","observation_id":"05401a3e-f480-4eeb-8c23-f3bc50dc22a1","resolution":{"observed_at":"2026-05-18T08:12:02.374988Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"FlexGen: high-throughput generative inference of large language models with a single GPU , year =","venue":null,"work_id":"54cf92b7-9f09-420a-8bc5-94e15ba6001d","year":null},"citing_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-18T08:12:01.798459Z"},"links":{"citing_paper":"/paper/2409.10516"},"observation_digest":"sha256:1392b2859167fae21374e1d4d822396ba4bf5ac0ecf2cd5886df1e03201293e1","observation_id":"5f4d7360-0853-4764-bd73-9e654bfeb271","resolution":{"observed_at":"2026-05-18T08:12:02.380262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Model Tells You What to Discard: Adaptive","venue":null,"work_id":"6acf4548-97ab-474d-9202-49c8cc7ed1dd","year":null},"citing_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-18T08:12:01.798459Z"},"links":{"citing_paper":"/paper/2409.10516"},"observation_digest":"sha256:1d97e507b0a665e6e9b39814f437300b39b70037f94b991d248bb288de063dd7","observation_id":"2f5e2b5c-0adf-4a7a-bbc6-8c324166bae3","resolution":{"observed_at":"2026-05-18T08:12:02.383476Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"RingAttention with Blockwise Transformers for Near-Infinite Context , url =","venue":null,"work_id":"3fbb7d7a-5f40-43c9-b096-c9bb645204b5","year":null},"citing_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-18T08:12:01.798459Z"},"links":{"citing_paper":"/paper/2409.10516"},"observation_digest":"sha256:9ee8196284b7e9f5b948f5d84055646b97633a3c85708bc4970f609abb9c8098","observation_id":"a5cc8c76-d3a5-444a-a66a-316f6e25d7cf","resolution":{"observed_at":"2026-05-18T08:12:02.387295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"and Ermon, Stefano and Rudra, Atri and R","venue":null,"work_id":"88faa9c0-7ab8-43e4-a711-2c2b776deba9","year":null},"citing_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-18T08:12:01.798459Z"},"links":{"citing_paper":"/paper/2409.10516"},"observation_digest":"sha256:91e1e082c3f9ce91d2ac00087a00396ebf21a401881eed34483c3c6feb736fc4","observation_id":"10213dac-214f-4e5d-a057-f7a61a86d039","resolution":{"observed_at":"2026-05-18T08:12:02.391085Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"eadd7212-f408-4670-9989-fa93c41091dd","year":null},"citing_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-05-18T08:12:01.798459Z"},"links":{"citing_paper":"/paper/2409.10516"},"observation_digest":"sha256:9b5c67a80c814b74831efd9576399dc3488f2cba391741cbb8fc5b90c5fe49e3","observation_id":"b945c80e-9091-46e9-abf7-51f6f0641b8d","resolution":{"observed_at":"2026-05-18T08:12:02.394285Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Splitwise: Efficient generative llm inference using phase splitting , year =","venue":null,"work_id":"cad37ee1-8bf8-4983-bd40-38a6e86b12cc","year":2024},"citing_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-05-18T08:12:01.798459Z"},"links":{"citing_paper":"/paper/2409.10516"},"observation_digest":"sha256:5b7e8f83230f80994cc36587848105171ae7e7d00852dced1d9a3c3002f9293f","observation_id":"eff34419-a984-4160-ba45-8e5537f4592b","resolution":{"observed_at":"2026-05-18T08:12:02.022609Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Efficient Streaming Language Models with Attention Sinks , year =","venue":null,"work_id":"385b5507-512c-4fa3-af10-f166a7b1d7f0","year":null},"citing_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-18T08:12:01.798459Z"},"links":{"citing_paper":"/paper/2409.10516"},"observation_digest":"sha256:e11cb9c43d1872cf8a9a00bfaa796ce1fa2855abfb1fb0a1288cfefd04c10ddb","observation_id":"46767789-bc80-4e7b-a090-066f3c90e449","resolution":{"observed_at":"2026-05-18T08:12:02.027529Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"d07e5e7d-e0b7-40f0-a82c-17355af4a56f","year":2023},"citing_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-18T08:12:01.798459Z"},"links":{"citing_paper":"/paper/2409.10516"},"observation_digest":"sha256:7ea7bc8083a21fb6da389743475767e670d3fe907e88068add1af03c657b36fd","observation_id":"3d72fdbf-9b5a-45ee-9715-17f6b33d85c2","resolution":{"observed_at":"2026-05-18T08:12:02.031968Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Snapkv: Llm knows what you are looking for before generation , url =","venue":null,"work_id":"31eb48ef-d488-44d7-a63e-d02c1933991d","year":null},"citing_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-18T08:12:01.798459Z"},"links":{"citing_paper":"/paper/2409.10516"},"observation_digest":"sha256:fe50a588e9f0422cc9055e87d2967282420ed78e905971959d713f66081f57fa","observation_id":"d0f3b649-679c-47af-89a5-3bc5c3d58726","resolution":{"observed_at":"2026-05-18T08:12:02.036543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"MagicPiG: sParse Inference enGine for LLM , year =","venue":null,"work_id":"3e9a5289-447d-4488-8e3e-abc71d41566c","year":null},"citing_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-05-18T08:12:01.798459Z"},"links":{"citing_paper":"/paper/2409.10516"},"observation_digest":"sha256:bc5f1065763bb939f5d0fc751fd66dae6bf90e2a9e74fb3a401248742e018d26","observation_id":"f4e29f8d-0352-48bb-aae7-583e9f7f56d2","resolution":{"observed_at":"2026-05-18T08:12:02.041571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Longformer: The long-document transformer , url =","venue":null,"work_id":"beb4080e-8a2b-404e-8855-3fdbc7fd5f05","year":null},"citing_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-05-18T08:12:01.798459Z"},"links":{"citing_paper":"/paper/2409.10516"},"observation_digest":"sha256:661b02f273b96c1b27e00281c6d8593de928d685a253f20b3f8ca031a0484a96","observation_id":"2541b9f8-7978-4b7d-88f8-70bd248259d1","resolution":{"observed_at":"2026-05-18T08:12:02.046074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"InfLLM: Unveiling the Intrinsic Capacity of LLMs for Understanding Extremely Long Sequences with Training-Free Memory , url =","venue":null,"work_id":"a79dc26d-cc4a-406b-9c73-6ed88593de7d","year":null},"citing_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-05-18T08:12:01.798459Z"},"links":{"citing_paper":"/paper/2409.10516"},"observation_digest":"sha256:ae67e2e07b1d045d677fa45c464e602fa0006ce0f7196309bd826c6ca5877c85","observation_id":"3d4ef521-4f59-4f76-8295-7fede33ec93c","resolution":{"observed_at":"2026-05-18T08:12:02.050719Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08281","last_updated":"2025-10-23T09:36:08Z","snapshot_observed_at":"2026-07-31T05:45:37.385210Z","submitted_at":"2024-01-16T11:12:36Z","title":"The Faiss library","version":4},"cited_work":{"arxiv_id":"2401.08281","doi":"10.48550/arxiv.2401.08281","metadata_source":"pith","pith_arxiv_id":"2401.08281","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The Faiss library","venue":"cs.LG","work_id":"41b4c732-3a63-4106-9e7c-50d61cfb2126","year":2024},"citing_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-05-18T08:12:01.798459Z"},"links":{"cited_paper":"/paper/2401.08281","citing_paper":"/paper/2409.10516"},"observation_digest":"sha256:01fab85cce0fc9e36a822165e76ffc0087e4740fa9a176f5776c99c19f5b2f2a","observation_id":"34979964-5b4d-44eb-91cc-e8261a15978a","resolution":{"observed_at":"2026-05-18T08:12:01.914175Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T08:23:03.866957+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T08:23:03.866957+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models? , url =","venue":null,"work_id":"ba99a5cc-9c18-417c-8dad-6cf9cde8afde","year":null},"citing_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-05-18T08:12:01.798459Z"},"links":{"citing_paper":"/paper/2409.10516"},"observation_digest":"sha256:72647b9093ced3a754c26f3853cc72b2aa6983abcbde3ebad85841c2c477924b","observation_id":"af1fe93a-08a6-4f1d-af80-459512bb79db","resolution":{"observed_at":"2026-05-18T08:12:02.054769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On the generalized distance in statistics , volume =","venue":null,"work_id":"44f41e3a-fdb9-4bf8-a9f3-f910a53c5b62","year":null},"citing_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-18T08:12:01.798459Z"},"links":{"citing_paper":"/paper/2409.10516"},"observation_digest":"sha256:cb7b5091d8c9660f2a8a4ca03c4566b582b3bc94e8a7f90e0432c9cfb893717c","observation_id":"f6c9a0c0-0791-4577-801e-6aa7211577db","resolution":{"observed_at":"2026-05-18T08:12:02.058693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Efficient and robust approximate nearest neighbor search using hierarchical navigable small world graphs , volume =","venue":null,"work_id":"56f0e9e2-e940-4227-a809-f836a42527a2","year":null},"citing_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-05-18T08:12:01.798459Z"},"links":{"citing_paper":"/paper/2409.10516"},"observation_digest":"sha256:a859a4ff9da5d0ed20fe118868cbfdf4862cf2ab771c743e4c38c9ce02110fed","observation_id":"d8b22e7f-c204-4990-966b-43cc39219d44","resolution":{"observed_at":"2026-05-18T08:12:02.062929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1109/cvpr.2016.226","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Lempitsky , bibsource =","venue":null,"work_id":"f8b8c99b-8e36-4fb3-b892-12e22f91da1a","year":2016},"citing_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-05-18T08:12:01.798459Z"},"links":{"citing_paper":"/paper/2409.10516"},"observation_digest":"sha256:56aa5e21d3b789834e73b5f01288a56878551ce59e93058442fd0420a2538a5c","observation_id":"e442ee8b-7adc-43dd-b6d9-5e75a661b96a","resolution":{"observed_at":"2026-05-18T08:12:01.882999Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"98b0eb96-aaa3-44fb-b3d2-9335e50a8290","year":null},"citing_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-05-18T08:12:01.798459Z"},"links":{"citing_paper":"/paper/2409.10516"},"observation_digest":"sha256:66ff76059b74dafa60ae203520bd249ef37de504da3337bd5aff410f9be64fc8","observation_id":"4542df4b-a164-4c93-bb25-1d81b096be6b","resolution":{"observed_at":"2026-05-18T08:12:02.067251Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video Google: A text retrieval approach to object matching in videos , year =","venue":null,"work_id":"fb76d7da-d15f-4591-b5a0-bd68481f3391","year":null},"citing_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-05-18T08:12:01.798459Z"},"links":{"citing_paper":"/paper/2409.10516"},"observation_digest":"sha256:e5f7b956196d9e1327f649bac5791d708b6074c9ca0937d5f20fb0ba69620d50","observation_id":"8f98e092-96f5-438c-acad-8377aa688dba","resolution":{"observed_at":"2026-05-18T08:12:02.072624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Big Bird: Transformers for Longer Sequences , url =","venue":null,"work_id":"7278c7fe-ea97-465f-a012-c106d7939c91","year":2020},"citing_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-05-18T08:12:01.798459Z"},"links":{"citing_paper":"/paper/2409.10516"},"observation_digest":"sha256:aea7d6ece2ec98d59fdb907d71430c2503bafa58c2fd9e198382a0c8a3cf54b7","observation_id":"2509cfc0-0aeb-419b-aeef-a78995630b96","resolution":{"observed_at":"2026-05-18T08:12:02.077857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"IceFormer: Accelerated Inference with Long-Sequence Transformers on","venue":null,"work_id":"7390cf65-f97d-4ec1-b943-0ebf950d4ff4","year":null},"citing_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-05-18T08:12:01.798459Z"},"links":{"citing_paper":"/paper/2409.10516"},"observation_digest":"sha256:60d83bd8856750311b528b80464d54b9cd02518977063bcdee73c5ab6d7226f6","observation_id":"745738cb-b938-4ec7-af03-a2080abd3512","resolution":{"observed_at":"2026-05-18T08:12:02.082232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Generating long sequences with sparse transformers , url =","venue":null,"work_id":"3e1d596a-af28-4100-afa4-02f981dcd46b","year":null},"citing_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-05-18T08:12:01.798459Z"},"links":{"citing_paper":"/paper/2409.10516"},"observation_digest":"sha256:7d13b002669b43f1726e7fbcace45a9fb48730f46988da494b7093aa16028461","observation_id":"a98d3c41-c6fc-4b55-b114-5464cee32fc1","resolution":{"observed_at":"2026-05-18T08:12:02.085989Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Keyformer: Kv cache reduction through key tokens selection for efficient generative inference , volume =","venue":null,"work_id":"2a1f7f89-82e3-4e64-a50b-2be178ca858b","year":null},"citing_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-05-18T08:12:01.798459Z"},"links":{"citing_paper":"/paper/2409.10516"},"observation_digest":"sha256:888fbc9c6095ec7a7acca5d8ed9035a5d898c8e0e8697cc84dd25a3fca3217cf","observation_id":"0ba553ff-7eda-4e11-88f4-d91db2f74560","resolution":{"observed_at":"2026-05-18T08:12:02.089866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Unlimiformer: Long-range transformers with unlimited length input , volume =","venue":null,"work_id":"c4b44794-787f-40d3-b239-8453a9f1f383","year":null},"citing_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-05-18T08:12:01.798459Z"},"links":{"citing_paper":"/paper/2409.10516"},"observation_digest":"sha256:993e7ed23ed646cc9189678fe5b47d93a6cecc56ac7850cdfd7e629b815b3446","observation_id":"fa01a263-ffba-4f9f-8243-f901132f938a","resolution":{"observed_at":"2026-05-18T08:12:02.094013Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"6f3fb13b-e3bd-4b4a-adf3-2a2bb47c8583","year":null},"citing_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-05-18T08:12:01.798459Z"},"links":{"citing_paper":"/paper/2409.10516"},"observation_digest":"sha256:d347255f00f8b9dac8a31edc7f1103171aa2f3f08503be4121a7d0475398df62","observation_id":"5cb10304-9f9b-475e-90b5-8ff054b7368a","resolution":{"observed_at":"2026-05-18T08:12:02.097620Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"SparQ Attention: Bandwidth-Efficient LLM Inference , url =","venue":null,"work_id":"dff87ec2-9e07-413a-b422-df7ec6d7b40b","year":null},"citing_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-05-18T08:12:01.798459Z"},"links":{"citing_paper":"/paper/2409.10516"},"observation_digest":"sha256:9eae8f28c3bef7e6a5e84bec1466548d849dfa516ec7d64cd947206d258b9873","observation_id":"53eeda90-c923-431e-855b-5c321770818f","resolution":{"observed_at":"2026-05-18T08:12:02.101599Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Efficient and Economic Large Language Model Inference with Attention Offloading , url =","venue":null,"work_id":"84be1008-3f31-4b75-b0eb-a30107956ac0","year":null},"citing_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-05-18T08:12:01.798459Z"},"links":{"citing_paper":"/paper/2409.10516"},"observation_digest":"sha256:e2c83cea1589fa8512755308f5d2364e5867484e11b14b8c51186cb4ff0ade71","observation_id":"5f9c2d87-0097-4d12-8e4b-5a18769ed53b","resolution":{"observed_at":"2026-05-18T08:12:02.105381Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scissorhands: Exploiting the persistence of importance hypothesis for llm kv cache compression at test time , volume =","venue":null,"work_id":"0bdde562-e721-4548-9a46-e5c84740a5cd","year":null},"citing_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-05-18T08:12:01.798459Z"},"links":{"citing_paper":"/paper/2409.10516"},"observation_digest":"sha256:f935ff69d2ee3eb5596bb56daca7f8cc6f91ef662e30a94a842e6d2322f8e899","observation_id":"f8139999-860e-43fa-a8b6-40f31b3d778b","resolution":{"observed_at":"2026-05-18T08:12:02.109400Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"fd3ffc2f-7237-48c2-a245-9abd33fbe933","year":null},"citing_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-05-18T08:12:01.798459Z"},"links":{"citing_paper":"/paper/2409.10516"},"observation_digest":"sha256:59cb05da1b609fa61852496a453257363f81c7a55ff502106e96de6d1763e3fa","observation_id":"65b1e0f9-32a7-4501-9ed6-ada258b8ce49","resolution":{"observed_at":"2026-05-18T08:12:02.113611Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"fb0f83b9-10ed-47e6-b355-08349a0f2c19","year":null},"citing_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-05-18T08:12:01.798459Z"},"links":{"citing_paper":"/paper/2409.10516"},"observation_digest":"sha256:ae8d55c69e835558849e180f835d15960ad545c244f5de0c9df23ad790d6ad0c","observation_id":"96a4dd63-b7d4-401b-9466-4e707bd9b154","resolution":{"observed_at":"2026-05-18T08:12:02.117249Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Loki: Low-Rank Keys for Efficient Sparse Attention , url =","venue":null,"work_id":"c09d6eb1-b917-479f-af89-ff60c460856a","year":null},"citing_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-05-18T08:12:01.798459Z"},"links":{"citing_paper":"/paper/2409.10516"},"observation_digest":"sha256:47e01e02ca1e1ec6f23abb14d99eeae6542a29b7908fce066b0511bb3b08c06e","observation_id":"cef76df7-22ed-4f78-8e8f-0895d280d610","resolution":{"observed_at":"2026-05-18T08:12:02.121470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"MInference 1.0: Accelerating Pre-filling for Long-Context LLMs via Dynamic Sparse Attention , url =","venue":null,"work_id":"f1a06664-43ce-4567-acb3-8805148c4ebe","year":null},"citing_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-05-18T08:12:01.798459Z"},"links":{"citing_paper":"/paper/2409.10516"},"observation_digest":"sha256:8e0ea437d26a325ded8e59f73873dbd2977fcd01adcd3ecfebfebde5e9af65cd","observation_id":"ff46e5bd-3022-455a-abb6-3b5e9875e97d","resolution":{"observed_at":"2026-05-18T08:12:02.125463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mooncake: Kimi's KVCache-centric Architecture for LLM Serving , url =","venue":null,"work_id":"2268fc70-bff1-4f7b-9a06-ffb7f70a6114","year":null},"citing_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-05-18T08:12:01.798459Z"},"links":{"citing_paper":"/paper/2409.10516"},"observation_digest":"sha256:bbf159fce91db6f418da0b7d4700950b8bd698f09fea2ec6606db9d72f53e105","observation_id":"a2eed4ae-aa10-49a8-8db0-b7c86e4baa44","resolution":{"observed_at":"2026-05-18T08:12:02.129485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"70cd92bb-f963-412e-b248-7f50829fd5ca","year":null},"citing_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-05-18T08:12:01.798459Z"},"links":{"citing_paper":"/paper/2409.10516"},"observation_digest":"sha256:18ffd125ba0387b9c87a8ade96f160323a13cac193e3a0a04bf033eff5188aec","observation_id":"06e5669a-1cc8-4592-bce8-a156da499688","resolution":{"observed_at":"2026-05-18T08:12:02.132961Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deepspeed ulysses: System optimizations for enabling training of extreme long sequence transformer models , url =","venue":null,"work_id":"510f44f6-e157-4af3-ae70-c1a9aa799d41","year":null},"citing_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-05-18T08:12:01.798459Z"},"links":{"citing_paper":"/paper/2409.10516"},"observation_digest":"sha256:3ed204a89313464cf3608902c783b47858eacc96791729e73e26b7eb0237f57a","observation_id":"3061713c-b5fe-4490-842c-3b0d7b0bb4ba","resolution":{"observed_at":"2026-05-18T08:12:02.136812Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints , year =","venue":null,"work_id":"3aec925b-0542-4035-a692-50f6611ce28e","year":null},"citing_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-05-18T08:12:01.798459Z"},"links":{"citing_paper":"/paper/2409.10516"},"observation_digest":"sha256:7ff08b3de965a0891b8c95923b8d010c3ce265c7b06126bbcd51bbfc6c42e384","observation_id":"74eb02e0-e6c8-4780-be1b-fa0dccefba6c","resolution":{"observed_at":"2026-05-18T08:12:02.140417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gonzalez and Hao Zhang and Ion Stoica , booktitle =","venue":null,"work_id":"cb2912b8-41d2-4e8d-845a-5545c9e5f1ec","year":null},"citing_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-05-18T08:12:01.798459Z"},"links":{"citing_paper":"/paper/2409.10516"},"observation_digest":"sha256:007df6dde69c9be9df24ac24451d3ad87e70db43312c5c027a03f64bcbfab31d","observation_id":"3fd397b5-19b7-4cc1-944b-d153fd9e773b","resolution":{"observed_at":"2026-05-18T08:12:02.144420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02690","last_updated":"2025-02-12T14:32:46Z","snapshot_observed_at":"2026-07-06T17:55:03.561275Z","submitted_at":"2024-04-03T12:37:34Z","title":"How Sparse Attention Approximates Exact Attention? Your Attention is Naturally $n^C$-Sparse","version":2},"cited_work":{"arxiv_id":"2404.02690","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.02690","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"How sparse attention approximates exact atten- tion? your attention is naturallyn c-sparse","venue":null,"work_id":"732649a0-e1f2-44bb-bfe4-e9f9f4c41935","year":2025},"citing_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-05-18T08:12:01.798459Z"},"links":{"cited_paper":"/paper/2404.02690","citing_paper":"/paper/2409.10516"},"observation_digest":"sha256:773ecdd0b4310c9914eb6eb3d5cf8dfaa3229613cbc8bae777335e3fceb4bca6","observation_id":"6b5812cf-0fcc-4015-8a02-991f2e04b931","resolution":{"observed_at":"2026-05-18T08:12:02.011756Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Approximate Nearest Neighbor Negative Contrastive Learning for Dense Text Retrieval , url =","venue":null,"work_id":"4edf7810-37b7-4a69-abd5-9aefd8367f0c","year":null},"citing_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-05-18T08:12:01.798459Z"},"links":{"citing_paper":"/paper/2409.10516"},"observation_digest":"sha256:864b68b01b100b8ed9fad929794debfef653c84fb7713b132a27e61754e6ce31","observation_id":"b8722174-dc9e-49be-8b6f-32734276e539","resolution":{"observed_at":"2026-05-18T08:12:02.147790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"PinnerSage: Multi-Modal User Embedding Framework for Recommendations at Pinterest , url =","venue":null,"work_id":"3df8c1d6-5490-4640-b889-1988eaf14d12","year":null},"citing_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-05-18T08:12:01.798459Z"},"links":{"citing_paper":"/paper/2409.10516"},"observation_digest":"sha256:28e21623c1bd9ff6ada935f75bd681622f5f103ca948ad269d310e4437d36393","observation_id":"faafad50-c5be-410f-bc14-5a3bd69c8c8e","resolution":{"observed_at":"2026-05-18T08:12:02.151330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Non-metric Similarity Graphs for Maximum Inner Product Search , url =","venue":null,"work_id":"222d6258-0bf2-4118-9e7f-6fff046e5db1","year":2018},"citing_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-05-18T08:12:01.798459Z"},"links":{"citing_paper":"/paper/2409.10516"},"observation_digest":"sha256:fdb243ecdf343b3ca105642783f019b48cbbdf30a10533b1fef74554af289c51","observation_id":"21bb8f70-62f2-4ce7-a1d2-0004b35dd5e3","resolution":{"observed_at":"2026-05-18T08:12:02.155121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.14508","last_updated":"2024-06-19T04:00:32Z","snapshot_observed_at":"2026-08-02T11:20:36.216220Z","submitted_at":"2023-08-28T11:53:40Z","title":"LongBench: A Bilingual, Multitask Benchmark for Long Context Understanding","version":2},"cited_work":{"arxiv_id":"2308.14508","doi":"10.48550/arxiv.2308.14508","metadata_source":"pith","pith_arxiv_id":"2308.14508","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LongBench: A Bilingual, Multitask Benchmark for Long Context Understanding","venue":"cs.CL","work_id":"ba7831c4-9427-4e0e-a5c1-4e98511f4b53","year":2023},"citing_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-05-18T08:12:01.798459Z"},"links":{"cited_paper":"/paper/2308.14508","citing_paper":"/paper/2409.10516"},"observation_digest":"sha256:c53639883799a3cc8beeb7ca7c2ca04b2580ff8539a3b4945778bb46ea7e1f9e","observation_id":"df2a457f-61c3-4c4e-b1da-17a74a43d217","resolution":{"observed_at":"2026-05-18T08:12:01.991620Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Yi-6b-200k","venue":null,"work_id":"83d2f84f-c832-4c9e-a4e6-a8c550227310","year":2024},"citing_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-05-18T08:12:01.798459Z"},"links":{"citing_paper":"/paper/2409.10516"},"observation_digest":"sha256:500ad2b1ae90b525c6a5dd761fd09e7d270e65fccec79f907177d61757fdadf5","observation_id":"42e456ea-3863-4379-8c0d-3eb35e249275","resolution":{"observed_at":"2026-05-18T08:12:02.158801Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Yi-9b-200k","venue":null,"work_id":"5c757490-0ac6-494d-9537-426be568408d","year":2024},"citing_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-05-18T08:12:01.798459Z"},"links":{"citing_paper":"/paper/2409.10516"},"observation_digest":"sha256:7dae2971e17c6654dc2996128c6441e920b831fb7276893ad1eb0a114a3fa4f8","observation_id":"cace07c2-64ad-4600-b846-d56752dbe1ec","resolution":{"observed_at":"2026-05-18T08:12:02.162548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2020.emnlp-main.19","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ETC : Encoding long and structured inputs in transformers","venue":null,"work_id":"551aaf95-6f50-4a35-b53a-f814fa9b0e30","year":2020},"citing_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-05-18T08:12:01.798459Z"},"links":{"citing_paper":"/paper/2409.10516"},"observation_digest":"sha256:e8992d1f441661c237664436c922f8318ef57734e46b68643faa8a6c1133c00f","observation_id":"fce6e1f4-0909-44ef-b5de-d21713e24e2a","resolution":{"observed_at":"2026-05-18T08:12:01.868323Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gqa: Training generalized multi-query transformer models from multi-head checkpoints","venue":null,"work_id":"add2652a-af2a-475c-893f-be29ee3555db","year":2023},"citing_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-05-18T08:12:01.798459Z"},"links":{"citing_paper":"/paper/2409.10516"},"observation_digest":"sha256:c336569314a04cc92e9b17417bbae5a6e302cb798f33272186bebcd63a1b9978","observation_id":"c001afe8-7762-4f13-88e9-592d3789f9d8","resolution":{"observed_at":"2026-05-18T08:12:02.166476Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":"2004.05150","doi":"10.48550/arxiv.2004.05150","metadata_source":"pith","pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Longformer: The Long-Document Transformer","venue":"cs.CL","work_id":"abea7a44-6668-4de7-aab6-f53a6e5aa088","year":2020},"citing_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-05-18T08:12:01.798459Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2409.10516"},"observation_digest":"sha256:c49a10417b50e430d453d530014680d4b5ad197ab81458ae47818b327bb5ac02","observation_id":"4fb1939a-6070-4b4f-b8ac-a5d3627aacba","resolution":{"observed_at":"2026-05-18T08:12:02.017700Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-12T21:49:59.161233+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T21:49:59.161233+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Unlimiformer: Long-range transformers with unlimited length input","venue":null,"work_id":"956cec2c-0882-444f-adc2-7c7ee8e6c957","year":2024},"citing_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-05-18T08:12:01.798459Z"},"links":{"citing_paper":"/paper/2409.10516"},"observation_digest":"sha256:dce10b38779a33ce5a41779513f3fcd45a4eea8f925ad36ccefc22a958d1b5a0","observation_id":"e70b4920-e52a-4c13-b629-1af851b36e94","resolution":{"observed_at":"2026-05-18T08:12:02.171029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02069","last_updated":"2025-05-15T17:18:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T07:51:30Z","title":"PyramidKV: Dynamic KV Cache Compression based on Pyramidal Information Funneling","version":4},"cited_work":{"arxiv_id":"2406.02069","doi":"10.48550/arxiv.2406.02069","metadata_source":"pith","pith_arxiv_id":"2406.02069","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PyramidKV: Dynamic KV Cache Compression based on Pyramidal Information Funneling","venue":"cs.CL","work_id":"6317700d-f903-4ce1-8f53-b43cb146d48b","year":2024},"citing_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-05-18T08:12:01.798459Z"},"links":{"cited_paper":"/paper/2406.02069","citing_paper":"/paper/2409.10516"},"observation_digest":"sha256:2c373c28462af8923c8d178bfb56c19933478762af47dd2bba42a3a587537455","observation_id":"666adf94-9fe6-462a-817f-4cb202cab9d2","resolution":{"observed_at":"2026-05-18T08:12:01.920496Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T13:53:26.042348+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T13:53:26.042348+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1954.368195","doi":"10.14778/3681954.3681959","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Sean Wang","venue":"Proceedings of the VLDB Endowment","work_id":"0b9f827b-b99c-4f7d-8731-eafe701230b5","year":2024},"citing_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-05-18T08:12:01.798459Z"},"links":{"citing_paper":"/paper/2409.10516"},"observation_digest":"sha256:8fa131e9742b85f39cce9ab9b33010a435b1610d387c7f061956da1a26600f45","observation_id":"e74fcdfc-ccbf-486d-a42a-fc3c4817577a","resolution":{"observed_at":"2026-05-18T08:12:01.860771Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01814","last_updated":"2025-04-10T14:56:01Z","snapshot_observed_at":"2026-07-06T18:09:08.963593Z","submitted_at":"2024-05-03T02:15:15Z","title":"Efficient Heterogeneous Large Language Model Decoding with Model-Attention Disaggregation","version":2},"cited_work":{"arxiv_id":"2405.01814","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.01814","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Efficient and economic large language model inference with attention offloading","venue":null,"work_id":"26e03e8d-fe20-4657-abac-4bd3a3265497","year":2024},"citing_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-05-18T08:12:01.798459Z"},"links":{"cited_paper":"/paper/2405.01814","citing_paper":"/paper/2409.10516"},"observation_digest":"sha256:b60c1e2232f070202f0ed1c8876e8ec4b4b4d1e646f0f3137f936ad558380705","observation_id":"d42c4ab1-d012-438b-b604-2a493f39504a","resolution":{"observed_at":"2026-05-18T08:12:01.961981Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Magicpig: sparse inference engine for llm","venue":null,"work_id":"c6300313-fafd-4b9a-aee0-ec85b3492e5b","year":2024},"citing_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-05-18T08:12:01.798459Z"},"links":{"citing_paper":"/paper/2409.10516"},"observation_digest":"sha256:c70172afea89551c8b9ef7a85b729490fa6ae929202e8c298937b01c255a4769","observation_id":"53a10c02-1a5f-4b5a-bc19-15d08887af1b","resolution":{"observed_at":"2026-05-18T08:12:02.174975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.10509","last_updated":"2019-04-23T19:29:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-04-23T19:29:47Z","title":"Generating Long Sequences with Sparse Transformers","version":1},"cited_work":{"arxiv_id":"1904.10509","doi":"10.48550/arxiv.1904.10509","metadata_source":"pith","pith_arxiv_id":"1904.10509","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Generating Long Sequences with Sparse Transformers","venue":"cs.LG","work_id":"c5b81688-45ee-4a9a-b095-e6290f45cb6c","year":2019},"citing_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-05-18T08:12:01.798459Z"},"links":{"cited_paper":"/paper/1904.10509","citing_paper":"/paper/2409.10516"},"observation_digest":"sha256:fde7e8a4f764d140f7c9e58bdfce0aa0ed3c0e2df08a43b51bccc7cc4bb35e19","observation_id":"64ba7080-2156-4d36-ab98-a3ae8415651a","resolution":{"observed_at":"2026-05-18T08:12:01.985977Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-12T21:49:59.71041+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T21:49:59.71041+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A weighted nearest neighbor algorithm for learning with symbolic features","venue":null,"work_id":"75575ced-e159-4f52-8c3c-bb5defa47f1b","year":1993},"citing_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-05-18T08:12:01.798459Z"},"links":{"citing_paper":"/paper/2409.10516"},"observation_digest":"sha256:c34a7bcb73d889f94ffde1d4504566ed1284c7a0f5f6ad0e58a43ce002613412","observation_id":"737ecc75-17e6-40af-8023-27c62719721f","resolution":{"observed_at":"2026-05-18T08:12:02.178971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"9100.295919","doi":"10.1145/2959100.2959190","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"URL https://doi.org/10.1145/ 2959100.2959190","venue":null,"work_id":"8a9bd35c-501b-4836-904a-8d4141b5a939","year":2016},"citing_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-05-18T08:12:01.798459Z"},"links":{"citing_paper":"/paper/2409.10516"},"observation_digest":"sha256:c5a0b0fd0e2b63cc9d627cd93a24efcf9a0e8a354f8673dd890e37d90357e124","observation_id":"419ac5d1-8298-41ff-85a9-a111fcc09f28","resolution":{"observed_at":"2026-05-18T08:12:01.877928Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-16T19:51:29.017711+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-16T19:51:29.017711+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T18:24:01.210279Z","title":"Fu, Stefano Ermon, Atri Rudra, and Christopher R \\'e","venue":null,"work_id":"b7c95fa2-0ee8-4a45-9b26-e6f825786a34","year":2022},"citing_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-05-18T08:12:01.798459Z"},"links":{"citing_paper":"/paper/2409.10516"},"observation_digest":"sha256:9f661f288062edf1b5e70d7500c2e1da605b3e2a3d03b20c815d5e82e0dec9a3","observation_id":"a9b44847-da35-4ee5-a6bb-3af273dba721","resolution":{"observed_at":"2026-05-18T08:12:02.183183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Attention is naturally sparse with gaussian distributed input","venue":null,"work_id":"57bf03fa-9097-40b6-9965-f56318f5efcf","year":2024},"citing_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-05-18T08:12:01.798459Z"},"links":{"citing_paper":"/paper/2409.10516"},"observation_digest":"sha256:44fbcbf676c5cbdb6c46ea106b4b160be9071c5197aada9e6efd6ed4edd46335","observation_id":"9a160637-9dac-40f9-b228-861aed039381","resolution":{"observed_at":"2026-05-18T08:12:02.187389Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The faiss library","venue":null,"work_id":"f15a457a-0340-49c6-9964-e4e7dea16d7f","year":2024},"citing_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-05-18T08:12:01.798459Z"},"links":{"citing_paper":"/paper/2409.10516"},"observation_digest":"sha256:acaaa9c6f93057494e49d7406b5c3ff1eda785387db9e471daa5a6c5f8233fb6","observation_id":"48ff9088-b825-41c4-9571-c07356e69a1b","resolution":{"observed_at":"2026-05-18T08:12:02.191335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Model tells you what to discard: Adaptive KV cache compression for LLM s","venue":null,"work_id":"f1336977-d9d4-4386-a05e-f01269f04fd2","year":2024},"citing_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-05-18T08:12:01.798459Z"},"links":{"citing_paper":"/paper/2409.10516"},"observation_digest":"sha256:91cabcbb5c0d4454c3758f0da34388ca7cc6fe7b8fc820d5c141a57b80ee9909","observation_id":"296f2418-3c36-41d6-93fc-44a00447feab","resolution":{"observed_at":"2026-05-18T08:12:02.195099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Context caching overview","venue":null,"work_id":"1505d42f-89b9-4975-a26a-146a54b7769a","year":2024},"citing_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-05-18T08:12:01.798459Z"},"links":{"citing_paper":"/paper/2409.10516"},"observation_digest":"sha256:dd04dbad31107539c8580fbb75b069c6f71792103cabde71793d7be87e59a79b","observation_id":"17bf77dc-5406-4196-afcc-c97f412ec7a8","resolution":{"observed_at":"2026-05-18T08:12:02.199201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llama-3-8b-instruct-262k","venue":null,"work_id":"04bdd4c6-961b-452f-bc7e-00f9adfbe807","year":2024},"citing_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-05-18T08:12:01.798459Z"},"links":{"citing_paper":"/paper/2409.10516"},"observation_digest":"sha256:8e03ac0207a066621a2929f91eb54f5c08e0b53e612e140024e84421b0646d5a","observation_id":"cd52da36-d1e3-439e-b933-908c14493742","resolution":{"observed_at":"2026-05-18T08:12:02.202739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Needle in a haystack - pressure testing llms","venue":null,"work_id":"6ccbeb16-59f7-4a14-b873-a15ee4acfcb2","year":2023},"citing_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-05-18T08:12:01.798459Z"},"links":{"citing_paper":"/paper/2409.10516"},"observation_digest":"sha256:cb7d092f8eeb1114809e9f1265c128ddab68c7083098d8df2cf514875aa23d37","observation_id":"02f35180-7252-4d75-9912-41a821d4638b","resolution":{"observed_at":"2026-05-18T08:12:02.206494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"LM -infinite: Zero-shot extreme length generalization for large language models","venue":null,"work_id":"9b06acb8-393a-4670-a57b-94923582e983","year":2024},"citing_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-05-18T08:12:01.798459Z"},"links":{"citing_paper":"/paper/2409.10516"},"observation_digest":"sha256:ef9535baf4d218ed5de3cdc90a902b5e4adddcda1da9ed15a55b355ccb67dc01","observation_id":"b97d136b-87e2-4af4-b22b-08576488198a","resolution":{"observed_at":"2026-05-18T08:12:02.210121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":"2404.06654","doi":"10.48550/arxiv.2404.06654","metadata_source":"pith","pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","venue":"cs.CL","work_id":"c0bc4689-3ce8-4e3d-9442-bd74869445bb","year":2024},"citing_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-05-18T08:12:01.798459Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2409.10516"},"observation_digest":"sha256:9bd1a6c5c8f84b43c4b2228690ea723e0a6ab05f389619158f318af159822ff7","observation_id":"668d82fd-a21c-4c5d-a307-c768301643ee","resolution":{"observed_at":"2026-05-18T08:12:01.927648Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14509","last_updated":"2023-10-04T16:51:13Z","snapshot_observed_at":"2026-08-04T19:27:31.715261Z","submitted_at":"2023-09-25T20:15:57Z","title":"DeepSpeed Ulysses: System Optimizations for Enabling Training of Extreme Long Sequence Transformer Models","version":2},"cited_work":{"arxiv_id":"2309.14509","doi":"10.48550/arxiv.2309.14509","metadata_source":"pith","pith_arxiv_id":"2309.14509","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSpeed Ulysses: System Optimizations for Enabling Training of Extreme Long Sequence Transformer Models","venue":"cs.LG","work_id":"bb119d0b-c7f0-412a-a426-f74bd6949a51","year":2023},"citing_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-05-18T08:12:01.798459Z"},"links":{"cited_paper":"/paper/2309.14509","citing_paper":"/paper/2409.10516"},"observation_digest":"sha256:cadb319354ee3208e8bab35f30077f250c1ae05290581cb7007ececaa5ab9467","observation_id":"ded72ace-d1a3-4e3e-bf3b-f6b0156cd3d8","resolution":{"observed_at":"2026-05-18T08:12:01.934048Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.12850","last_updated":"2022-11-30T11:14:07Z","snapshot_observed_at":"2026-07-31T18:00:43.513660Z","submitted_at":"2022-10-22T21:22:50Z","title":"OOD-DiskANN: Efficient and Scalable Graph ANNS for Out-of-Distribution Queries","version":2},"cited_work":{"arxiv_id":"2211.12850","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2211.12850","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ood-diskann: Efficient and scalable graph anns for out-of-distribution queries","venue":null,"work_id":"6a344d11-6cf7-46aa-b105-fbf2329eda75","year":2022},"citing_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-05-18T08:12:01.798459Z"},"links":{"cited_paper":"/paper/2211.12850","citing_paper":"/paper/2409.10516"},"observation_digest":"sha256:7a0d7869338231c0f1bafaccc313c5199dfad664d14bba6a9da939b047e35dd4","observation_id":"c074ab33-5a65-427e-b9fc-8b5844b8a4da","resolution":{"observed_at":"2026-05-18T08:12:01.941972Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02490","last_updated":"2024-10-30T14:53:22Z","snapshot_observed_at":"2026-07-06T18:40:27.299063Z","submitted_at":"2024-07-02T17:59:56Z","title":"MInference 1.0: Accelerating Pre-filling for Long-Context LLMs via Dynamic Sparse Attention","version":2},"cited_work":{"arxiv_id":"2407.02490","doi":"10.48550/arxiv.2407.02490","metadata_source":"pith","pith_arxiv_id":"2407.02490","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Abdi, Dongsheng Li, Chin-Yew Lin, Yuqing Yang, and Lili Qiu","venue":"cs.CL","work_id":"ead3d842-61e6-4c52-8e2a-ea9a3986a1af","year":2024},"citing_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-05-18T08:12:01.798459Z"},"links":{"cited_paper":"/paper/2407.02490","citing_paper":"/paper/2409.10516"},"observation_digest":"sha256:60f0a3ab24bb21f8b8920a3aa58eedbf5241424fceb3c926d881d308b5a71d1c","observation_id":"8e637f98-6e48-42a6-8a2c-3a55a8834366","resolution":{"observed_at":"2026-05-18T08:12:01.955613Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reformer: The efficient transformer","venue":null,"work_id":"d7812cd6-53a5-43fc-b6d5-53daeb7bd7bc","year":2020},"citing_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-05-18T08:12:01.798459Z"},"links":{"citing_paper":"/paper/2409.10516"},"observation_digest":"sha256:e76a29abcfcd884eb9aa731233d077c091811c840056459e97fbad6a1c0a06a0","observation_id":"1a24bd02-ad16-4266-b011-9c8c2f9f01c6","resolution":{"observed_at":"2026-05-18T08:12:02.213887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":"52a458b7-066f-4f6a-87b2-1bfa236cde69","year":2023},"citing_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-05-18T08:12:01.798459Z"},"links":{"citing_paper":"/paper/2409.10516"},"observation_digest":"sha256:1f89153a223f73b5889f663aca054ad580ca6a95d47dac2227d99c43bed93830","observation_id":"7b9b8996-e134-4302-be8b-32698285da64","resolution":{"observed_at":"2026-05-18T08:12:02.217934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"InfiniGen : Efficient generative inference of large language models with dynamic KV cache management","venue":null,"work_id":"a25461ce-9f06-4152-9206-aeb36ad344d6","year":2024},"citing_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-05-18T08:12:01.798459Z"},"links":{"citing_paper":"/paper/2409.10516"},"observation_digest":"sha256:b26f9e4b32bd0c8a584605ab3211d82505e1787a7493ac2f0c5aba6b39838455","observation_id":"a974e6a3-8eab-4934-a3af-bf4b671125a5","resolution":{"observed_at":"2026-05-18T08:12:02.221681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14469","last_updated":"2024-06-17T03:01:58Z","snapshot_observed_at":"2026-07-06T18:03:55.981890Z","submitted_at":"2024-04-22T17:42:58Z","title":"SnapKV: LLM Knows What You are Looking for Before Generation","version":2},"cited_work":{"arxiv_id":"2404.14469","doi":"10.48550/arxiv.2404.14469","metadata_source":"pith","pith_arxiv_id":"2404.14469","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SnapKV: LLM Knows What You are Looking for Before Generation","venue":"cs.CL","work_id":"4afe6cb0-dba4-42b6-b553-e685e5730d61","year":2024},"citing_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-05-18T08:12:01.798459Z"},"links":{"cited_paper":"/paper/2404.14469","citing_paper":"/paper/2409.10516"},"observation_digest":"sha256:25bfb93fd6607d6ac5b766b62966274dbf9c317ab2d45f2e59756eb1e062c30e","observation_id":"fb2b0e7e-821b-4fc9-8a70-7f0911754172","resolution":{"observed_at":"2026-05-18T08:12:01.980850Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T13:53:27.134462+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T13:53:27.134462+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ringattention with blockwise transformers for near-infinite context","venue":null,"work_id":"31e2badd-ea5c-41d0-b351-c189456b05c1","year":2024},"citing_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-05-18T08:12:01.798459Z"},"links":{"citing_paper":"/paper/2409.10516"},"observation_digest":"sha256:3f1b357c8c6557bc258742a55d4219f6b0164f35806041dfc29ae6ff0d6f254b","observation_id":"c38cf58e-3af7-4ed0-9327-6a5c5f0463d4","resolution":{"observed_at":"2026-05-18T08:12:02.225348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scissorhands: Exploiting the persistence of importance hypothesis for llm kv cache compression at test time","venue":null,"work_id":"0b44ffed-945e-4f13-b42c-5db72638051b","year":2024},"citing_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-05-18T08:12:01.798459Z"},"links":{"citing_paper":"/paper/2409.10516"},"observation_digest":"sha256:544311505c3a79acb3df310380c8dfa7505e54b434affe25f6491a142ba84ac0","observation_id":"f7e558ee-4788-417e-81fc-d064ec1f40cd","resolution":{"observed_at":"2026-05-18T08:12:02.229807Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On the generalized distance in statistics","venue":null,"work_id":"0a82e686-b37b-4605-b5b3-a6418de94125","year":2008},"citing_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-05-18T08:12:01.798459Z"},"links":{"citing_paper":"/paper/2409.10516"},"observation_digest":"sha256:6ebf2beebc6d518303bf1c520eaf77eb4f107aa5c77835c64593bde543b224fe","observation_id":"1e8f0203-f860-4066-bf27-fec2c4dc8e00","resolution":{"observed_at":"2026-05-18T08:12:02.233775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Efficient and robust approximate nearest neighbor search using hierarchical navigable small world graphs","venue":null,"work_id":"81be06b1-5569-42c3-9232-8b944ed7a972","year":2018},"citing_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-05-18T08:12:01.798459Z"},"links":{"citing_paper":"/paper/2409.10516"},"observation_digest":"sha256:844064368d07e44009d681306773ddc70d8a8a6449c1bbbc7a707ce0c3df3a94","observation_id":"23807758-2930-4f62-a3a4-1f5d639109af","resolution":{"observed_at":"2026-05-18T08:12:02.237499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Iceformer: Accelerated inference with long-sequence transformers on CPU s","venue":null,"work_id":"8cee1ff5-fb0d-4809-9c1a-e98e9f283d66","year":2024},"citing_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"reference_index":101,"source":"arxiv_source","source_observed_at":"2026-05-18T08:12:01.798459Z"},"links":{"citing_paper":"/paper/2409.10516"},"observation_digest":"sha256:9ead61022ce61edda6276b61b2494517cdfbfcab4d68c3154cef382fa1d917d4","observation_id":"96cc7b0e-03d9-4440-b84d-56afb6ce0902","resolution":{"observed_at":"2026-05-18T08:12:02.241129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Non-metric similarity graphs for maximum inner product search","venue":null,"work_id":"e18eb5c9-9f6c-4585-ba7c-9d6a3b0ad796","year":2018},"citing_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"reference_index":102,"source":"arxiv_source","source_observed_at":"2026-05-18T08:12:01.798459Z"},"links":{"citing_paper":"/paper/2409.10516"},"observation_digest":"sha256:358acb7bcfc6143c8b23c54ff98739c6e280f4c6f39a815da22e2b567e856dd2","observation_id":"6294af34-9e02-4a4e-bd99-1c238b2cab26","resolution":{"observed_at":"2026-05-18T08:12:02.244905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"4486.340328","doi":"10.1145/3394486.3403280","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ghosh, N","venue":null,"work_id":"a366ff93-1df6-4a96-ab07-48f79b4232c6","year":2020},"citing_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"reference_index":103,"source":"arxiv_source","source_observed_at":"2026-05-18T08:12:01.798459Z"},"links":{"citing_paper":"/paper/2409.10516"},"observation_digest":"sha256:c896a493abb471d5aed9a22cac89f4aa20a62d0026277bd8d8cd599840d51987","observation_id":"8064e1cc-636f-403f-a912-a0e42e407449","resolution":{"observed_at":"2026-05-18T08:12:01.892660Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":8,"parse_uncertain":0,"unresolved":11,"verified_exact":12,"verified_fuzzy":69},"total_outbound_references":118},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 100 of 118 outbound references and 30 inbound Pith citation observations for arXiv:2409.10516."}