{"as_of":"2026-08-08T18:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3bc0837ff96c5c5d4e762346a400d43bf8dcebb068531cdf0c3b2b3aa6d8c25e","coverage":[{"denominator":75,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":75,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:00:11.244159Z","state":"measured"},{"denominator":77,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":77,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-26T12:19:30.666750Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T07:59:40.383102Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.20187","last_updated":"2025-07-02T05:12:29Z","snapshot_observed_at":"2026-08-07T20:42:38.846597Z","submitted_at":"2025-06-25T07:26:42Z","title":"Breaking the Boundaries of Long-Context LLM Inference: Adaptive KV Management on a Single Commodity GPU","version":2},"cited_work":{"arxiv_id":"2506.20187","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.20187","snapshot_observed_at":"2026-07-04T07:59:40.383102Z","title":"Breaking the boundaries of long- context llm inference: Adaptive kv management on a single commodity gpu","venue":null,"work_id":"9e433d53-4c8a-4793-abe1-a84014993974","year":2025},"citing_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-08-08T13:32:33.116151Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-17T11:16:31.904921Z"},"links":{"cited_paper":"/paper/2506.20187","citing_paper":"/paper/2407.11550"},"observation_digest":"sha256:009efeebaf3f0c6962b248129afa2e0876971c5e00cf69eb774b89c8e4c9485a","observation_id":"9933c708-0a8d-4273-8971-2369de29cb48","resolution":{"observed_at":"2026-05-17T11:16:32.022030Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20187","last_updated":"2025-07-02T05:12:29Z","snapshot_observed_at":"2026-08-07T20:42:38.846597Z","submitted_at":"2025-06-25T07:26:42Z","title":"Breaking the Boundaries of Long-Context LLM Inference: Adaptive KV Management on a Single Commodity GPU","version":2},"cited_work":{"arxiv_id":"2506.20187","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.20187","snapshot_observed_at":"2026-07-04T07:59:40.383102Z","title":"Breaking the boundaries of long- context llm inference: Adaptive kv management on a single commodity gpu","venue":null,"work_id":"9e433d53-4c8a-4793-abe1-a84014993974","year":2025},"citing_paper":{"arxiv_id":"2606.21842","last_updated":"2026-06-20T02:28:28Z","snapshot_observed_at":"2026-07-06T23:56:45.447705Z","submitted_at":"2026-06-20T02:28:28Z","title":"Agent-Assisted Side-Channel Attacks on Non-Prefix KV Cache in RAG","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-26T12:19:30.666750Z"},"links":{"cited_paper":"/paper/2506.20187","citing_paper":"/paper/2606.21842"},"observation_digest":"sha256:d7e2023521ac9fcd91133b7cebf8b60ec9eebd866d8366436deb6fbe6e7660cb","observation_id":"85e550da-29fd-484b-a18a-8015daf27092","resolution":{"observed_at":"2026-07-04T07:59:40.384450Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.20187/citation-record","integrity":"/paper/2506.20187/integrity","json":"/paper/2506.20187/citation-record.json","paper":"/paper/2506.20187"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:00:11.017359Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20187","last_updated":"2025-07-02T05:12:29Z","snapshot_observed_at":"2026-08-07T20:42:38.846597Z","submitted_at":"2025-06-25T07:26:42Z","title":"Breaking the Boundaries of Long-Context LLM Inference: Adaptive KV Management on a Single Commodity GPU","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T23:00:11.017359Z"},"links":{"citing_paper":"/paper/2506.20187"},"observation_digest":"sha256:3be9c9f2b1dbcba61b88094b2f98336975412a87bd18d832d21f21c7ecc2b74d","observation_id":"785965b3-dc4b-4588-8dce-98c0739f74e5","resolution":{"observed_at":"2026-08-06T23:00:11.017359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:00:11.022454Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20187","last_updated":"2025-07-02T05:12:29Z","snapshot_observed_at":"2026-08-07T20:42:38.846597Z","submitted_at":"2025-06-25T07:26:42Z","title":"Breaking the Boundaries of Long-Context LLM Inference: Adaptive KV Management on a Single Commodity GPU","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T23:00:11.022454Z"},"links":{"citing_paper":"/paper/2506.20187"},"observation_digest":"sha256:341957dfa1b7af2f78eef324297c9aee25c4efec9f73119cbde17e55a5323e67","observation_id":"28d100c7-787c-4b44-bede-46058dc61525","resolution":{"observed_at":"2026-08-06T23:00:11.022454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:00:11.865017Z","title":null,"venue":null,"work_id":"731ef84b-80e0-45be-b09d-010b412add89","year":2024},"citing_paper":{"arxiv_id":"2506.20187","last_updated":"2025-07-02T05:12:29Z","snapshot_observed_at":"2026-08-07T20:42:38.846597Z","submitted_at":"2025-06-25T07:26:42Z","title":"Breaking the Boundaries of Long-Context LLM Inference: Adaptive KV Management on a Single Commodity GPU","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T23:00:11.026073Z"},"links":{"citing_paper":"/paper/2506.20187"},"observation_digest":"sha256:17411fd008a4b8dac6e3be5f12a887f29132b7a4d7062be0c5644a4d235079a8","observation_id":"759f16c2-a05f-49db-9a28-ccc79cc1085a","resolution":{"observed_at":"2026-08-06T23:00:11.868015Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.14508","last_updated":"2024-06-19T04:00:32Z","snapshot_observed_at":"2026-08-08T03:49:18.086396Z","submitted_at":"2023-08-28T11:53:40Z","title":"LongBench: A Bilingual, Multitask Benchmark for Long Context Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.14508","snapshot_observed_at":"2026-08-06T23:00:11.029267Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20187","last_updated":"2025-07-02T05:12:29Z","snapshot_observed_at":"2026-08-07T20:42:38.846597Z","submitted_at":"2025-06-25T07:26:42Z","title":"Breaking the Boundaries of Long-Context LLM Inference: Adaptive KV Management on a Single Commodity GPU","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T23:00:11.029267Z"},"links":{"cited_paper":"/paper/2308.14508","citing_paper":"/paper/2506.20187"},"observation_digest":"sha256:914067037cffc372776462c663fced24856405b97e0a2ebd1191cbd7ee78876a","observation_id":"9a1f3507-329b-44eb-827a-7a34d901c4ec","resolution":{"observed_at":"2026-08-06T23:00:11.029267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-06T23:00:11.032835Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.20187","last_updated":"2025-07-02T05:12:29Z","snapshot_observed_at":"2026-08-07T20:42:38.846597Z","submitted_at":"2025-06-25T07:26:42Z","title":"Breaking the Boundaries of Long-Context LLM Inference: Adaptive KV Management on a Single Commodity GPU","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T23:00:11.032835Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2506.20187"},"observation_digest":"sha256:4b093dbf57465fb32fe55c037b03467f48d105b2899274c3bc347e9eab40436c","observation_id":"39ae85f0-c3b5-43bc-8a4b-9c7c319167af","resolution":{"observed_at":"2026-08-06T23:00:11.032835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:00:11.856948Z","title":null,"venue":null,"work_id":"d5722621-fddc-4c32-99dc-3c4e2271be68","year":2020},"citing_paper":{"arxiv_id":"2506.20187","last_updated":"2025-07-02T05:12:29Z","snapshot_observed_at":"2026-08-07T20:42:38.846597Z","submitted_at":"2025-06-25T07:26:42Z","title":"Breaking the Boundaries of Long-Context LLM Inference: Adaptive KV Management on a Single Commodity GPU","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T23:00:11.036911Z"},"links":{"citing_paper":"/paper/2506.20187"},"observation_digest":"sha256:bc5708580d6d22bfe9e622d509084f75bca55ac85131c4214a44f40c9dfd2366","observation_id":"c5c6c8e9-800c-4fdb-8526-263cb501b268","resolution":{"observed_at":"2026-08-06T23:00:11.860102Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:00:11.849159Z","title":null,"venue":null,"work_id":"b5d02e86-d4a3-49f9-9e0c-255e8df5d5e3","year":2023},"citing_paper":{"arxiv_id":"2506.20187","last_updated":"2025-07-02T05:12:29Z","snapshot_observed_at":"2026-08-07T20:42:38.846597Z","submitted_at":"2025-06-25T07:26:42Z","title":"Breaking the Boundaries of Long-Context LLM Inference: Adaptive KV Management on a Single Commodity GPU","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T23:00:11.039706Z"},"links":{"citing_paper":"/paper/2506.20187"},"observation_digest":"sha256:754327dc9bea01e91bd696d967c6c660fd565791e1ceac8ff2966d78263f3eda","observation_id":"21d94218-256a-4189-b9d6-3a072d6ad3fb","resolution":{"observed_at":"2026-08-06T23:00:11.851918Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:00:11.840317Z","title":"2025.{IMPRESS}: An{Importance-Informed}{ Multi-Tier} Prefix{KV} Storage System for Large Language Model Inference","venue":null,"work_id":"412e5cf2-1daf-41da-bdc1-3196a8f5d9d3","year":2025},"citing_paper":{"arxiv_id":"2506.20187","last_updated":"2025-07-02T05:12:29Z","snapshot_observed_at":"2026-08-07T20:42:38.846597Z","submitted_at":"2025-06-25T07:26:42Z","title":"Breaking the Boundaries of Long-Context LLM Inference: Adaptive KV Management on a Single Commodity GPU","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T23:00:11.042310Z"},"links":{"citing_paper":"/paper/2506.20187"},"observation_digest":"sha256:4ad734e3b1b403666cc3634db211f18ba245461db95ceed718d28cfeaf2cb250","observation_id":"6946337e-e57d-4c3c-bb57-22d04d94e796","resolution":{"observed_at":"2026-08-06T23:00:11.843573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:00:11.832529Z","title":null,"venue":null,"work_id":"ecf09e32-65b9-4aaf-9f62-c5ef29588185","year":null},"citing_paper":{"arxiv_id":"2506.20187","last_updated":"2025-07-02T05:12:29Z","snapshot_observed_at":"2026-08-07T20:42:38.846597Z","submitted_at":"2025-06-25T07:26:42Z","title":"Breaking the Boundaries of Long-Context LLM Inference: Adaptive KV Management on a Single Commodity GPU","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T23:00:11.045290Z"},"links":{"citing_paper":"/paper/2506.20187"},"observation_digest":"sha256:9dac5456eb28e0793a2b4f6cb603177dfc88f5e0a847df6e0f2a8773647affda","observation_id":"cb5520d9-0532-4caf-b113-ca8020818d57","resolution":{"observed_at":"2026-08-06T23:00:11.835196Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09521","last_updated":"2020-04-19T07:27:42Z","snapshot_observed_at":"2026-08-04T01:49:40.988424Z","submitted_at":"2019-04-21T00:42:22Z","title":"Few-Shot NLG with Pre-Trained Language Model","version":3},"cited_work":{"arxiv_id":"1904.09521","doi":null,"metadata_source":"pith","pith_arxiv_id":"1904.09521","snapshot_observed_at":"2026-08-06T23:00:11.442796Z","title":"Few-Shot NLG with Pre-Trained Language Model","venue":"cs.CL","work_id":"b8398f22-4837-45b7-a2a3-6d756b77aa09","year":2019},"citing_paper":{"arxiv_id":"2506.20187","last_updated":"2025-07-02T05:12:29Z","snapshot_observed_at":"2026-08-07T20:42:38.846597Z","submitted_at":"2025-06-25T07:26:42Z","title":"Breaking the Boundaries of Long-Context LLM Inference: Adaptive KV Management on a Single Commodity GPU","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T23:00:11.048552Z"},"links":{"cited_paper":"/paper/1904.09521","citing_paper":"/paper/2506.20187"},"observation_digest":"sha256:41f3b09252358f18d2c856cc668cab4a0234614111b77d16412b4e15d270088e","observation_id":"012ce635-c357-4104-93e3-4e26f34ee054","resolution":{"observed_at":"2026-08-06T23:00:11.445981Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:00:11.824250Z","title":null,"venue":null,"work_id":"d8279437-c874-4719-be48-40576961537a","year":null},"citing_paper":{"arxiv_id":"2506.20187","last_updated":"2025-07-02T05:12:29Z","snapshot_observed_at":"2026-08-07T20:42:38.846597Z","submitted_at":"2025-06-25T07:26:42Z","title":"Breaking the Boundaries of Long-Context LLM Inference: Adaptive KV Management on a Single Commodity GPU","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T23:00:11.051521Z"},"links":{"citing_paper":"/paper/2506.20187"},"observation_digest":"sha256:0f105bdad5c443d996953207f90256254a6960bfc66e5eea046c6c48a41de1a0","observation_id":"4da509f6-c852-4b23-b3d7-e6f984c1299c","resolution":{"observed_at":"2026-08-06T23:00:11.827610Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:00:11.815720Z","title":null,"venue":null,"work_id":"3a207008-cada-404e-a56b-0281cfba232e","year":2023},"citing_paper":{"arxiv_id":"2506.20187","last_updated":"2025-07-02T05:12:29Z","snapshot_observed_at":"2026-08-07T20:42:38.846597Z","submitted_at":"2025-06-25T07:26:42Z","title":"Breaking the Boundaries of Long-Context LLM Inference: Adaptive KV Management on a Single Commodity GPU","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T23:00:11.053902Z"},"links":{"citing_paper":"/paper/2506.20187"},"observation_digest":"sha256:929921955bb7e8f1fe04c14ea69c0759b4cd04dae9f1c95c1eb44e1b595b847b","observation_id":"e2eaa2bf-1941-4352-a955-806e65df6812","resolution":{"observed_at":"2026-08-06T23:00:11.818847Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:00:11.807560Z","title":null,"venue":null,"work_id":"b44630d6-8f1c-4317-ae0b-bbe31e4f5ba8","year":2024},"citing_paper":{"arxiv_id":"2506.20187","last_updated":"2025-07-02T05:12:29Z","snapshot_observed_at":"2026-08-07T20:42:38.846597Z","submitted_at":"2025-06-25T07:26:42Z","title":"Breaking the Boundaries of Long-Context LLM Inference: Adaptive KV Management on a Single Commodity GPU","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T23:00:11.056651Z"},"links":{"citing_paper":"/paper/2506.20187"},"observation_digest":"sha256:af3dd9af2f83031291e9837c824a7bc200ee56b074318880a0add1811654f885","observation_id":"be8746f0-4cde-48fa-9daf-beb43fc3ad8e","resolution":{"observed_at":"2026-08-06T23:00:11.810467Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:00:11.799264Z","title":null,"venue":null,"work_id":"272f4018-73eb-4e75-8f0d-5b0df4450070","year":null},"citing_paper":{"arxiv_id":"2506.20187","last_updated":"2025-07-02T05:12:29Z","snapshot_observed_at":"2026-08-07T20:42:38.846597Z","submitted_at":"2025-06-25T07:26:42Z","title":"Breaking the Boundaries of Long-Context LLM Inference: Adaptive KV Management on a Single Commodity GPU","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T23:00:11.059407Z"},"links":{"citing_paper":"/paper/2506.20187"},"observation_digest":"sha256:10af85fe6ba9cea9c5cff6cdd5c109a418e32a5f06d8a63a7a09303948daac5b","observation_id":"c46bbd5c-cefe-4d6a-8257-a9bd255f5e10","resolution":{"observed_at":"2026-08-06T23:00:11.802212Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04643","last_updated":"2024-04-12T13:00:25Z","snapshot_observed_at":"2026-08-04T07:21:43.170218Z","submitted_at":"2024-03-07T16:42:37Z","title":"QAQ: Quality Adaptive Quantization for LLM KV Cache","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04643","snapshot_observed_at":"2026-08-06T23:00:11.062539Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20187","last_updated":"2025-07-02T05:12:29Z","snapshot_observed_at":"2026-08-07T20:42:38.846597Z","submitted_at":"2025-06-25T07:26:42Z","title":"Breaking the Boundaries of Long-Context LLM Inference: Adaptive KV Management on a Single Commodity GPU","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T23:00:11.062539Z"},"links":{"cited_paper":"/paper/2403.04643","citing_paper":"/paper/2506.20187"},"observation_digest":"sha256:87a02aaead5cb67e3b0febfb6c8a7118dd14007e9bd471243f873b7e031fd8d0","observation_id":"c79b3b0b-5e97-454e-8fc3-9898097c5917","resolution":{"observed_at":"2026-08-06T23:00:11.062539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:00:11.792098Z","title":null,"venue":null,"work_id":"74ca1992-7efa-473e-bf28-daf3b718d255","year":null},"citing_paper":{"arxiv_id":"2506.20187","last_updated":"2025-07-02T05:12:29Z","snapshot_observed_at":"2026-08-07T20:42:38.846597Z","submitted_at":"2025-06-25T07:26:42Z","title":"Breaking the Boundaries of Long-Context LLM Inference: Adaptive KV Management on a Single Commodity GPU","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T23:00:11.065440Z"},"links":{"citing_paper":"/paper/2506.20187"},"observation_digest":"sha256:b24a47978fcb1ccabf80f0908d6924c7ff5809d54bbfa377eedf911d4a37e7e5","observation_id":"d6dab555-365b-475e-852b-42b9835b1450","resolution":{"observed_at":"2026-08-06T23:00:11.794836Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:00:11.067881Z","title":"2024.{Cost- Efficient} large language model serving for multi-turn conversations with{CachedAttention}","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20187","last_updated":"2025-07-02T05:12:29Z","snapshot_observed_at":"2026-08-07T20:42:38.846597Z","submitted_at":"2025-06-25T07:26:42Z","title":"Breaking the Boundaries of Long-Context LLM Inference: Adaptive KV Management on a Single Commodity GPU","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T23:00:11.067881Z"},"links":{"citing_paper":"/paper/2506.20187"},"observation_digest":"sha256:899513cc9c9c539f6e2f4d5f0c3ccdbeb9d74c194545971c825f8722d858bcfa","observation_id":"402982f5-ca92-4ca9-8baf-b8a47501813b","resolution":{"observed_at":"2026-08-06T23:00:11.067881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:00:11.779686Z","title":null,"venue":null,"work_id":"b8b7a1bb-eca2-4907-8cd0-334e5885b3f0","year":2023},"citing_paper":{"arxiv_id":"2506.20187","last_updated":"2025-07-02T05:12:29Z","snapshot_observed_at":"2026-08-07T20:42:38.846597Z","submitted_at":"2025-06-25T07:26:42Z","title":"Breaking the Boundaries of Long-Context LLM Inference: Adaptive KV Management on a Single Commodity GPU","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T23:00:11.071627Z"},"links":{"citing_paper":"/paper/2506.20187"},"observation_digest":"sha256:7ad3ed9daf7e7811c4ae0e6e85189337d362a45e1300fb2e6ffc3ab88e8b274e","observation_id":"0f11429a-5466-4508-bee2-6551d62fd90f","resolution":{"observed_at":"2026-08-06T23:00:11.782156Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:00:11.769822Z","title":null,"venue":null,"work_id":"b79e03e6-2983-4641-93ec-79948dc84e25","year":2024},"citing_paper":{"arxiv_id":"2506.20187","last_updated":"2025-07-02T05:12:29Z","snapshot_observed_at":"2026-08-07T20:42:38.846597Z","submitted_at":"2025-06-25T07:26:42Z","title":"Breaking the Boundaries of Long-Context LLM Inference: Adaptive KV Management on a Single Commodity GPU","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T23:00:11.074180Z"},"links":{"citing_paper":"/paper/2506.20187"},"observation_digest":"sha256:8c3582fb6dfb47dd9b163961f820d092adc1baee130a39ead15f9976c170b44e","observation_id":"cee4d1dc-3dc9-4739-a12f-2b3bae0e6038","resolution":{"observed_at":"2026-08-06T23:00:11.772235Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-05T09:48:25.127042Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-06T23:00:11.077208Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20187","last_updated":"2025-07-02T05:12:29Z","snapshot_observed_at":"2026-08-07T20:42:38.846597Z","submitted_at":"2025-06-25T07:26:42Z","title":"Breaking the Boundaries of Long-Context LLM Inference: Adaptive KV Management on a Single Commodity GPU","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T23:00:11.077208Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2506.20187"},"observation_digest":"sha256:4ad445bbdfe197b7c30b097d2f95848ab519928b59c9dac95c2d53ea7d7901d7","observation_id":"19c85dd1-eaf2-46ec-b9ce-a79b014b1e82","resolution":{"observed_at":"2026-08-06T23:00:11.077208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21325","last_updated":"2025-02-28T03:32:10Z","snapshot_observed_at":"2026-07-06T18:54:49.923926Z","submitted_at":"2024-07-31T04:16:37Z","title":"EdgeLLM: A Highly Efficient CPU-FPGA Heterogeneous Edge Accelerator for Large Language Models","version":2},"cited_work":{"arxiv_id":"2407.21325","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.21325","snapshot_observed_at":"2026-08-06T23:00:11.417905Z","title":"EdgeLLM: A Highly Efficient CPU-FPGA Heterogeneous Edge Accelerator for Large Language Models","venue":"cs.AR","work_id":"c13a7356-b669-495c-b376-ff32e9629bf3","year":2024},"citing_paper":{"arxiv_id":"2506.20187","last_updated":"2025-07-02T05:12:29Z","snapshot_observed_at":"2026-08-07T20:42:38.846597Z","submitted_at":"2025-06-25T07:26:42Z","title":"Breaking the Boundaries of Long-Context LLM Inference: Adaptive KV Management on a Single Commodity GPU","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T23:00:11.080857Z"},"links":{"cited_paper":"/paper/2407.21325","citing_paper":"/paper/2506.20187"},"observation_digest":"sha256:ffed9ccb99b4a51d4a2f7b56ad5de3657c3bbcf6326bc625c13632bd2abeeedf","observation_id":"f11acfcb-6238-4764-985a-46fef35084c6","resolution":{"observed_at":"2026-08-06T23:00:11.422577Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01805","last_updated":"2025-01-30T13:07:37Z","snapshot_observed_at":"2026-07-06T19:26:22.646942Z","submitted_at":"2024-10-02T17:59:52Z","title":"Locret: Enhancing Eviction in Long-Context LLM Inference with Trained Retaining Heads on Consumer-Grade Devices","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01805","snapshot_observed_at":"2026-08-06T23:00:11.083856Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20187","last_updated":"2025-07-02T05:12:29Z","snapshot_observed_at":"2026-08-07T20:42:38.846597Z","submitted_at":"2025-06-25T07:26:42Z","title":"Breaking the Boundaries of Long-Context LLM Inference: Adaptive KV Management on a Single Commodity GPU","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T23:00:11.083856Z"},"links":{"cited_paper":"/paper/2410.01805","citing_paper":"/paper/2506.20187"},"observation_digest":"sha256:5ef696bb7992325ba1a2d957c6440454ea2f76bc413c39c5057bf0d58848a7f3","observation_id":"6cbc9942-3086-4cae-92f5-e6ef33476007","resolution":{"observed_at":"2026-08-06T23:00:11.083856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:00:11.761182Z","title":null,"venue":null,"work_id":"5816b8d4-6806-4bf0-af6c-14c91fc25612","year":null},"citing_paper":{"arxiv_id":"2506.20187","last_updated":"2025-07-02T05:12:29Z","snapshot_observed_at":"2026-08-07T20:42:38.846597Z","submitted_at":"2025-06-25T07:26:42Z","title":"Breaking the Boundaries of Long-Context LLM Inference: Adaptive KV Management on a Single Commodity GPU","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T23:00:11.087822Z"},"links":{"citing_paper":"/paper/2506.20187"},"observation_digest":"sha256:3658c1a32c065f4680f526942642576492788da5f223313a1c03daf98d4eff50","observation_id":"9f61da3c-dced-46d2-ab09-1ef6ec0816e3","resolution":{"observed_at":"2026-08-06T23:00:11.763557Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:00:11.751895Z","title":null,"venue":null,"work_id":"0f10b7c8-5004-4f1e-a9fe-f607f3e41a4c","year":null},"citing_paper":{"arxiv_id":"2506.20187","last_updated":"2025-07-02T05:12:29Z","snapshot_observed_at":"2026-08-07T20:42:38.846597Z","submitted_at":"2025-06-25T07:26:42Z","title":"Breaking the Boundaries of Long-Context LLM Inference: Adaptive KV Management on a Single Commodity GPU","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T23:00:11.090348Z"},"links":{"citing_paper":"/paper/2506.20187"},"observation_digest":"sha256:cc4c6f472ff773a899213746aa2ee33dbe98f377accf02f6f0498710b1bfc809","observation_id":"617bf4fd-73a8-4d10-b005-370ebe5154a1","resolution":{"observed_at":"2026-08-06T23:00:11.754860Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05099","last_updated":"2024-05-13T08:49:44Z","snapshot_observed_at":"2026-08-04T23:21:31.317269Z","submitted_at":"2024-02-07T18:53:01Z","title":"Hydragen: High-Throughput LLM Inference with Shared Prefixes","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05099","snapshot_observed_at":"2026-08-06T23:00:11.093224Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20187","last_updated":"2025-07-02T05:12:29Z","snapshot_observed_at":"2026-08-07T20:42:38.846597Z","submitted_at":"2025-06-25T07:26:42Z","title":"Breaking the Boundaries of Long-Context LLM Inference: Adaptive KV Management on a Single Commodity GPU","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T23:00:11.093224Z"},"links":{"cited_paper":"/paper/2402.05099","citing_paper":"/paper/2506.20187"},"observation_digest":"sha256:d839b80a7944e9a6a28009df18cc74f1c47c7dd1719c2b3bafaa2d5c2b0de8e8","observation_id":"6acb8aa0-8d0e-42d9-9f0f-43b53db11b11","resolution":{"observed_at":"2026-08-06T23:00:11.093224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:00:11.744007Z","title":null,"venue":null,"work_id":"b541593a-3c8c-41f1-9505-05f211ebde24","year":2024},"citing_paper":{"arxiv_id":"2506.20187","last_updated":"2025-07-02T05:12:29Z","snapshot_observed_at":"2026-08-07T20:42:38.846597Z","submitted_at":"2025-06-25T07:26:42Z","title":"Breaking the Boundaries of Long-Context LLM Inference: Adaptive KV Management on a Single Commodity GPU","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T23:00:11.096398Z"},"links":{"citing_paper":"/paper/2506.20187"},"observation_digest":"sha256:502d45af7bac6fd58a86f4e2acd72a12f8d974a2d6af374ae807c7b80c4a7491","observation_id":"21afadde-ff39-4134-b0a2-f1cfc01bb7a9","resolution":{"observed_at":"2026-08-06T23:00:11.746822Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:00:11.099764Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.20187","last_updated":"2025-07-02T05:12:29Z","snapshot_observed_at":"2026-08-07T20:42:38.846597Z","submitted_at":"2025-06-25T07:26:42Z","title":"Breaking the Boundaries of Long-Context LLM Inference: Adaptive KV Management on a Single Commodity GPU","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T23:00:11.099764Z"},"links":{"citing_paper":"/paper/2506.20187"},"observation_digest":"sha256:6ce8e28fb62fd8c2f639534b1d1ee5d52662c271dccaaaa6bcc73a5c0d015032","observation_id":"d9a93331-e1fa-4f97-8275-cbc1e0ac6b15","resolution":{"observed_at":"2026-08-06T23:00:11.099764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:00:11.105890Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20187","last_updated":"2025-07-02T05:12:29Z","snapshot_observed_at":"2026-08-07T20:42:38.846597Z","submitted_at":"2025-06-25T07:26:42Z","title":"Breaking the Boundaries of Long-Context LLM Inference: Adaptive KV Management on a Single Commodity GPU","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T23:00:11.105890Z"},"links":{"citing_paper":"/paper/2506.20187"},"observation_digest":"sha256:9d8f2ff164b202c01ffe99b601b2f9c3d4b04ce7832577f1848475a46702eb21","observation_id":"912b82a9-3319-4208-8a7c-0d482be9dc51","resolution":{"observed_at":"2026-08-06T23:00:11.105890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:00:11.723264Z","title":null,"venue":null,"work_id":"978f2a5c-484e-4eee-b849-34b416b01b14","year":2014},"citing_paper":{"arxiv_id":"2506.20187","last_updated":"2025-07-02T05:12:29Z","snapshot_observed_at":"2026-08-07T20:42:38.846597Z","submitted_at":"2025-06-25T07:26:42Z","title":"Breaking the Boundaries of Long-Context LLM Inference: Adaptive KV Management on a Single Commodity GPU","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T23:00:11.109387Z"},"links":{"citing_paper":"/paper/2506.20187"},"observation_digest":"sha256:b3478817eee3003b9192be7f7178811525288883256e8843bb1ed9ffea398fe6","observation_id":"ee8dd3b8-450d-4674-b743-ccd47dfcf2fb","resolution":{"observed_at":"2026-08-06T23:00:11.726465Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:00:11.716034Z","title":null,"venue":null,"work_id":"dc0cf13e-e80a-472f-936c-07dc652b4160","year":2025},"citing_paper":{"arxiv_id":"2506.20187","last_updated":"2025-07-02T05:12:29Z","snapshot_observed_at":"2026-08-07T20:42:38.846597Z","submitted_at":"2025-06-25T07:26:42Z","title":"Breaking the Boundaries of Long-Context LLM Inference: Adaptive KV Management on a Single Commodity GPU","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T23:00:11.112297Z"},"links":{"citing_paper":"/paper/2506.20187"},"observation_digest":"sha256:e36f58d371c71a245f78cb19971a41286335535a2a94df738556e5b8c179c3ec","observation_id":"4080c216-4d57-4d76-9ba9-892bd659b4c9","resolution":{"observed_at":"2026-08-06T23:00:11.718521Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.05459","last_updated":"2024-05-08T06:16:23Z","snapshot_observed_at":"2026-08-02T13:57:57.119489Z","submitted_at":"2024-01-10T09:25:45Z","title":"Personal LLM Agents: Insights and Survey about the Capability, Efficiency and Security","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.05459","snapshot_observed_at":"2026-08-06T23:00:11.114538Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20187","last_updated":"2025-07-02T05:12:29Z","snapshot_observed_at":"2026-08-07T20:42:38.846597Z","submitted_at":"2025-06-25T07:26:42Z","title":"Breaking the Boundaries of Long-Context LLM Inference: Adaptive KV Management on a Single Commodity GPU","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T23:00:11.114538Z"},"links":{"cited_paper":"/paper/2401.05459","citing_paper":"/paper/2506.20187"},"observation_digest":"sha256:39c25a38ed02c380c02ac3e5fd49217b455d7782c716a6becfa076f3cf3176aa","observation_id":"26fc1fb9-71ea-4b22-9736-91ecefa87d01","resolution":{"observed_at":"2026-08-06T23:00:11.114538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:00:11.118383Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.20187","last_updated":"2025-07-02T05:12:29Z","snapshot_observed_at":"2026-08-07T20:42:38.846597Z","submitted_at":"2025-06-25T07:26:42Z","title":"Breaking the Boundaries of Long-Context LLM Inference: Adaptive KV Management on a Single Commodity GPU","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T23:00:11.118383Z"},"links":{"citing_paper":"/paper/2506.20187"},"observation_digest":"sha256:dc9b6f951700cf4ee280c18488561a662b6e4cdb7f23b3b45583a57f7da07b26","observation_id":"105f50a3-4f92-4c81-8eca-511cfca885aa","resolution":{"observed_at":"2026-08-06T23:00:11.118383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02669","last_updated":"2024-07-04T15:12:54Z","snapshot_observed_at":"2026-07-06T17:11:55.112404Z","submitted_at":"2024-01-05T06:53:00Z","title":"Infinite-LLM: Efficient LLM Service for Long Context with DistAttention and Distributed KVCache","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02669","snapshot_observed_at":"2026-08-06T23:00:11.123886Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20187","last_updated":"2025-07-02T05:12:29Z","snapshot_observed_at":"2026-08-07T20:42:38.846597Z","submitted_at":"2025-06-25T07:26:42Z","title":"Breaking the Boundaries of Long-Context LLM Inference: Adaptive KV Management on a Single Commodity GPU","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T23:00:11.123886Z"},"links":{"cited_paper":"/paper/2401.02669","citing_paper":"/paper/2506.20187"},"observation_digest":"sha256:d33af635f147d4f758324fa16f49ab6964ade71ca0c25e96981893cdfae703c2","observation_id":"3ef143eb-2b8a-420b-8be2-f182a9b87772","resolution":{"observed_at":"2026-08-06T23:00:11.123886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:00:11.694783Z","title":null,"venue":null,"work_id":"39a8d2c6-e14c-4399-b337-4bca5ad7a97c","year":null},"citing_paper":{"arxiv_id":"2506.20187","last_updated":"2025-07-02T05:12:29Z","snapshot_observed_at":"2026-08-07T20:42:38.846597Z","submitted_at":"2025-06-25T07:26:42Z","title":"Breaking the Boundaries of Long-Context LLM Inference: Adaptive KV Management on a Single Commodity GPU","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T23:00:11.127399Z"},"links":{"citing_paper":"/paper/2506.20187"},"observation_digest":"sha256:9573506c252ba56b83aa003958f94ec0c3602ae7e0db17de2c0164d747147500","observation_id":"86954114-e5c2-44e4-8d49-51936a7771fd","resolution":{"observed_at":"2026-08-06T23:00:11.697394Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:00:11.688008Z","title":null,"venue":null,"work_id":"2d7abdfc-38e4-4e06-8c36-ed86301aa942","year":2024},"citing_paper":{"arxiv_id":"2506.20187","last_updated":"2025-07-02T05:12:29Z","snapshot_observed_at":"2026-08-07T20:42:38.846597Z","submitted_at":"2025-06-25T07:26:42Z","title":"Breaking the Boundaries of Long-Context LLM Inference: Adaptive KV Management on a Single Commodity GPU","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T23:00:11.133227Z"},"links":{"citing_paper":"/paper/2506.20187"},"observation_digest":"sha256:0c1b46c946229b3fd6b4af1cb94170ea71e8daa8559f90acca70ec517f344b98","observation_id":"0a5912b1-1dd2-4377-8575-01d21cf51f36","resolution":{"observed_at":"2026-08-06T23:00:11.690719Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:00:11.677600Z","title":null,"venue":null,"work_id":"26bc8281-1b14-4c28-a271-874b3c2ac5a1","year":2024},"citing_paper":{"arxiv_id":"2506.20187","last_updated":"2025-07-02T05:12:29Z","snapshot_observed_at":"2026-08-07T20:42:38.846597Z","submitted_at":"2025-06-25T07:26:42Z","title":"Breaking the Boundaries of Long-Context LLM Inference: Adaptive KV Management on a Single Commodity GPU","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T23:00:11.135626Z"},"links":{"citing_paper":"/paper/2506.20187"},"observation_digest":"sha256:0dd353afadb03482c110bb46e7c80fb7709f67b492e77f8dc8e1e5455a20d0e4","observation_id":"fa711cf2-30be-4290-a2fd-079d1eb317dc","resolution":{"observed_at":"2026-08-06T23:00:11.681268Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-08-07T09:13:28.333702Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.10516","snapshot_observed_at":"2026-08-06T23:00:11.130073Z","title":"arXiv preprint arXiv:2409.10516 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20187","last_updated":"2025-07-02T05:12:29Z","snapshot_observed_at":"2026-08-07T20:42:38.846597Z","submitted_at":"2025-06-25T07:26:42Z","title":"Breaking the Boundaries of Long-Context LLM Inference: Adaptive KV Management on a Single Commodity GPU","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T23:00:11.130073Z"},"links":{"cited_paper":"/paper/2409.10516","citing_paper":"/paper/2506.20187"},"observation_digest":"sha256:654d1696e89834805b6289bdfa0fb425452e7d3096db789ee0ee6ae571fa5ab5","observation_id":"b5bf4945-8f0c-4d60-b4c3-5adf40afa034","resolution":{"observed_at":"2026-08-06T23:00:11.130073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:00:11.661227Z","title":null,"venue":null,"work_id":"59991182-687c-4285-9c41-cd3be4236af6","year":null},"citing_paper":{"arxiv_id":"2506.20187","last_updated":"2025-07-02T05:12:29Z","snapshot_observed_at":"2026-08-07T20:42:38.846597Z","submitted_at":"2025-06-25T07:26:42Z","title":"Breaking the Boundaries of Long-Context LLM Inference: Adaptive KV Management on a Single Commodity GPU","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T23:00:11.140670Z"},"links":{"citing_paper":"/paper/2506.20187"},"observation_digest":"sha256:17856ba8545183879b366adfdc174b1e19734b1abcd508aa43a12232cd09e8a9","observation_id":"d2499fee-d581-4119-a2e6-a6c6076a0065","resolution":{"observed_at":"2026-08-06T23:00:11.664379Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01523","last_updated":"2024-11-12T04:37:44Z","snapshot_observed_at":"2026-08-06T08:51:10.907429Z","submitted_at":"2024-07-01T17:59:26Z","title":"MMLongBench-Doc: Benchmarking Long-context Document Understanding with Visualizations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01523","snapshot_observed_at":"2026-08-06T23:00:11.143406Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20187","last_updated":"2025-07-02T05:12:29Z","snapshot_observed_at":"2026-08-07T20:42:38.846597Z","submitted_at":"2025-06-25T07:26:42Z","title":"Breaking the Boundaries of Long-Context LLM Inference: Adaptive KV Management on a Single Commodity GPU","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T23:00:11.143406Z"},"links":{"cited_paper":"/paper/2407.01523","citing_paper":"/paper/2506.20187"},"observation_digest":"sha256:80c7ad1aeeb3b780f31f96f34cfeb7298eb9559f9f22a21c17bb47018e2b9116","observation_id":"3b933033-63d9-44ac-aff3-402f563405c4","resolution":{"observed_at":"2026-08-06T23:00:11.143406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:00:11.670566Z","title":null,"venue":null,"work_id":"4f89284c-636a-45f8-93c5-3aa4cb1de8b8","year":2025},"citing_paper":{"arxiv_id":"2506.20187","last_updated":"2025-07-02T05:12:29Z","snapshot_observed_at":"2026-08-07T20:42:38.846597Z","submitted_at":"2025-06-25T07:26:42Z","title":"Breaking the Boundaries of Long-Context LLM Inference: Adaptive KV Management on a Single Commodity GPU","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T23:00:11.137963Z"},"links":{"citing_paper":"/paper/2506.20187"},"observation_digest":"sha256:aef054305f4b96af55e64855c680918b058ba5df5556b70f09f1838458f55407","observation_id":"402f0165-0bc0-4327-bfe7-3940521b907e","resolution":{"observed_at":"2026-08-06T23:00:11.672992Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:00:11.645279Z","title":null,"venue":null,"work_id":"0ddb2088-91af-42a7-9020-6f75e6fe0eb9","year":2025},"citing_paper":{"arxiv_id":"2506.20187","last_updated":"2025-07-02T05:12:29Z","snapshot_observed_at":"2026-08-07T20:42:38.846597Z","submitted_at":"2025-06-25T07:26:42Z","title":"Breaking the Boundaries of Long-Context LLM Inference: Adaptive KV Management on a Single Commodity GPU","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T23:00:11.149836Z"},"links":{"citing_paper":"/paper/2506.20187"},"observation_digest":"sha256:1d50830bfc66a2804fc66aa41e9805deb7c9b0887c9c6d9bb1a3867b3948c37d","observation_id":"235fa288-fd17-4603-8bad-20c4e5932282","resolution":{"observed_at":"2026-08-06T23:00:11.648774Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04992","last_updated":"2024-09-08T06:06:44Z","snapshot_observed_at":"2026-08-03T16:41:00.102590Z","submitted_at":"2024-09-08T06:06:44Z","title":"InstInfer: In-Storage Attention Offloading for Cost-Effective Long-Context LLM Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.04992","snapshot_observed_at":"2026-08-06T23:00:11.154210Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20187","last_updated":"2025-07-02T05:12:29Z","snapshot_observed_at":"2026-08-07T20:42:38.846597Z","submitted_at":"2025-06-25T07:26:42Z","title":"Breaking the Boundaries of Long-Context LLM Inference: Adaptive KV Management on a Single Commodity GPU","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T23:00:11.154210Z"},"links":{"cited_paper":"/paper/2409.04992","citing_paper":"/paper/2506.20187"},"observation_digest":"sha256:93f70260d45a21286c7e9c69063d47f32258a5d2a5ed1924b7f2210143820da1","observation_id":"ce740891-810a-48c2-b92e-2e3cb7a9f7f1","resolution":{"observed_at":"2026-08-06T23:00:11.154210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:00:11.653867Z","title":null,"venue":null,"work_id":"901a1a3e-d5d8-4395-82df-f95fc7030ba8","year":2024},"citing_paper":{"arxiv_id":"2506.20187","last_updated":"2025-07-02T05:12:29Z","snapshot_observed_at":"2026-08-07T20:42:38.846597Z","submitted_at":"2025-06-25T07:26:42Z","title":"Breaking the Boundaries of Long-Context LLM Inference: Adaptive KV Management on a Single Commodity GPU","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T23:00:11.146642Z"},"links":{"citing_paper":"/paper/2506.20187"},"observation_digest":"sha256:83192869c878f45e1bf96bb522a15d16198b65e49adafe604485f2a496a37bc6","observation_id":"e025d8e9-ec6e-4e38-9d16-6a5fc8663390","resolution":{"observed_at":"2026-08-06T23:00:11.656292Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:00:11.629888Z","title":null,"venue":null,"work_id":"2be05493-b536-4062-b703-715ffa7d81cb","year":2024},"citing_paper":{"arxiv_id":"2506.20187","last_updated":"2025-07-02T05:12:29Z","snapshot_observed_at":"2026-08-07T20:42:38.846597Z","submitted_at":"2025-06-25T07:26:42Z","title":"Breaking the Boundaries of Long-Context LLM Inference: Adaptive KV Management on a Single Commodity GPU","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T23:00:11.161622Z"},"links":{"citing_paper":"/paper/2506.20187"},"observation_digest":"sha256:e9548f24b6af1959a6c9937331a658605c9fb8d15b67e3afc58e7bd34beedebc","observation_id":"5b5abeb3-511f-47bf-bc57-519d82b1a3aa","resolution":{"observed_at":"2026-08-06T23:00:11.632833Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.05507","snapshot_observed_at":"2026-08-06T23:00:11.164618Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.20187","last_updated":"2025-07-02T05:12:29Z","snapshot_observed_at":"2026-08-07T20:42:38.846597Z","submitted_at":"2025-06-25T07:26:42Z","title":"Breaking the Boundaries of Long-Context LLM Inference: Adaptive KV Management on a Single Commodity GPU","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T23:00:11.164618Z"},"links":{"cited_paper":"/paper/1911.05507","citing_paper":"/paper/2506.20187"},"observation_digest":"sha256:7a1b73a29aeb6cb106d397d3e4078b474e1f431be1c41e64fd005804ac16d95c","observation_id":"e06dcd07-280d-4555-be4b-36911bd2f7ce","resolution":{"observed_at":"2026-08-06T23:00:11.164618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:00:11.637490Z","title":null,"venue":null,"work_id":"7bc66f58-915e-4603-b4f5-53eebeab6cd4","year":2023},"citing_paper":{"arxiv_id":"2506.20187","last_updated":"2025-07-02T05:12:29Z","snapshot_observed_at":"2026-08-07T20:42:38.846597Z","submitted_at":"2025-06-25T07:26:42Z","title":"Breaking the Boundaries of Long-Context LLM Inference: Adaptive KV Management on a Single Commodity GPU","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T23:00:11.158170Z"},"links":{"citing_paper":"/paper/2506.20187"},"observation_digest":"sha256:d6763c057f8bb3b526ca4389c89284f39a835d186ea776bf3e68a076712a46b2","observation_id":"9e523da6-4464-4cda-97c4-2b1a80e42139","resolution":{"observed_at":"2026-08-06T23:00:11.640451Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.12456","last_updated":"2024-12-12T12:38:12Z","snapshot_observed_at":"2026-08-07T20:41:48.188566Z","submitted_at":"2023-12-16T02:27:00Z","title":"PowerInfer: Fast Large Language Model Serving with a Consumer-grade GPU","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.12456","snapshot_observed_at":"2026-08-06T23:00:11.173785Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20187","last_updated":"2025-07-02T05:12:29Z","snapshot_observed_at":"2026-08-07T20:42:38.846597Z","submitted_at":"2025-06-25T07:26:42Z","title":"Breaking the Boundaries of Long-Context LLM Inference: Adaptive KV Management on a Single Commodity GPU","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T23:00:11.173785Z"},"links":{"cited_paper":"/paper/2312.12456","citing_paper":"/paper/2506.20187"},"observation_digest":"sha256:53e4edb56a7307266d475d47fbf714a000dd4fe0dc2bae0dcae540799a734c33","observation_id":"5568e98f-9628-4a2d-b939-7a04aeaab1fb","resolution":{"observed_at":"2026-08-06T23:00:11.173785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16546","last_updated":"2024-10-21T05:06:01Z","snapshot_observed_at":"2026-08-06T04:48:22.899485Z","submitted_at":"2024-09-25T01:39:02Z","title":"AlignedKV: Reducing Memory Access of KV-Cache with Precision-Aligned Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.16546","snapshot_observed_at":"2026-08-06T23:00:11.177146Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20187","last_updated":"2025-07-02T05:12:29Z","snapshot_observed_at":"2026-08-07T20:42:38.846597Z","submitted_at":"2025-06-25T07:26:42Z","title":"Breaking the Boundaries of Long-Context LLM Inference: Adaptive KV Management on a Single Commodity GPU","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T23:00:11.177146Z"},"links":{"cited_paper":"/paper/2409.16546","citing_paper":"/paper/2506.20187"},"observation_digest":"sha256:b1930f85996e654e50a1282e9023dda237dd31cc3c9bf366de24e62da968192e","observation_id":"245b5dd0-586a-42fa-aa7c-77aecf5a2c76","resolution":{"observed_at":"2026-08-06T23:00:11.177146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:00:11.167977Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.20187","last_updated":"2025-07-02T05:12:29Z","snapshot_observed_at":"2026-08-07T20:42:38.846597Z","submitted_at":"2025-06-25T07:26:42Z","title":"Breaking the Boundaries of Long-Context LLM Inference: Adaptive KV Management on a Single Commodity GPU","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T23:00:11.167977Z"},"links":{"citing_paper":"/paper/2506.20187"},"observation_digest":"sha256:8eb959ef01a4a76b5819327fd8add880c076a6395f859f3b78ea854a229eb0a9","observation_id":"4a750796-1dc1-41eb-a62b-34ac31a4d186","resolution":{"observed_at":"2026-08-06T23:00:11.167977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:00:11.617653Z","title":"In International Conference on Machine Learning","venue":null,"work_id":"c233d49e-bc82-440a-86bc-edf098a3b3c4","year":null},"citing_paper":{"arxiv_id":"2506.20187","last_updated":"2025-07-02T05:12:29Z","snapshot_observed_at":"2026-08-07T20:42:38.846597Z","submitted_at":"2025-06-25T07:26:42Z","title":"Breaking the Boundaries of Long-Context LLM Inference: Adaptive KV Management on a Single Commodity GPU","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T23:00:11.170875Z"},"links":{"citing_paper":"/paper/2506.20187"},"observation_digest":"sha256:9dc32bb2bba3f128c5f01df28190d40ee5728e464bd182206f473c3590dc8bea","observation_id":"6f880a37-c0fb-4cc4-acf9-7b9a71498846","resolution":{"observed_at":"2026-08-06T23:00:11.621323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-06T23:00:11.184844Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20187","last_updated":"2025-07-02T05:12:29Z","snapshot_observed_at":"2026-08-07T20:42:38.846597Z","submitted_at":"2025-06-25T07:26:42Z","title":"Breaking the Boundaries of Long-Context LLM Inference: Adaptive KV Management on a Single Commodity GPU","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T23:00:11.184844Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2506.20187"},"observation_digest":"sha256:be627b65a6c2bfcc354c92859e445fe262de5a976e849f9eeb9cc05ad2a37d34","observation_id":"a0c58dda-5e75-4ea5-af08-6f33bfd1d740","resolution":{"observed_at":"2026-08-06T23:00:11.184844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:00:11.590569Z","title":null,"venue":null,"work_id":"67b37594-2d73-42d4-9b1b-0a26fd7e7be1","year":2024},"citing_paper":{"arxiv_id":"2506.20187","last_updated":"2025-07-02T05:12:29Z","snapshot_observed_at":"2026-08-07T20:42:38.846597Z","submitted_at":"2025-06-25T07:26:42Z","title":"Breaking the Boundaries of Long-Context LLM Inference: Adaptive KV Management on a Single Commodity GPU","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T23:00:11.188081Z"},"links":{"citing_paper":"/paper/2506.20187"},"observation_digest":"sha256:a32e1bf9513e0760aa700e767499f3c80e58e92a853093749caa41bf86463e20","observation_id":"a6e50baf-9074-43ee-98da-7b86ead4a4cc","resolution":{"observed_at":"2026-08-06T23:00:11.593081Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:00:11.608062Z","title":null,"venue":null,"work_id":"0afacece-cf2a-43e6-ade1-cf9ee15cb7fb","year":null},"citing_paper":{"arxiv_id":"2506.20187","last_updated":"2025-07-02T05:12:29Z","snapshot_observed_at":"2026-08-07T20:42:38.846597Z","submitted_at":"2025-06-25T07:26:42Z","title":"Breaking the Boundaries of Long-Context LLM Inference: Adaptive KV Management on a Single Commodity GPU","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T23:00:11.179877Z"},"links":{"citing_paper":"/paper/2506.20187"},"observation_digest":"sha256:8c8d6b4d735dabc68d52bcf3b972b5590421bcc390b34800571764fa4b58c2d8","observation_id":"769d6449-d2c3-4c96-a6cd-1a7aa80c593b","resolution":{"observed_at":"2026-08-06T23:00:11.610996Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:00:11.599023Z","title":null,"venue":null,"work_id":"d773f6ba-732b-466c-8e01-35df04050374","year":2024},"citing_paper":{"arxiv_id":"2506.20187","last_updated":"2025-07-02T05:12:29Z","snapshot_observed_at":"2026-08-07T20:42:38.846597Z","submitted_at":"2025-06-25T07:26:42Z","title":"Breaking the Boundaries of Long-Context LLM Inference: Adaptive KV Management on a Single Commodity GPU","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T23:00:11.182538Z"},"links":{"citing_paper":"/paper/2506.20187"},"observation_digest":"sha256:3b7f076b5e54e743290268876f05a86030cfdbdfd7b695ec230f45d5a807da6f","observation_id":"a2d4e614-e073-4746-9d83-23aa22c60377","resolution":{"observed_at":"2026-08-06T23:00:11.602869Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:00:11.582291Z","title":null,"venue":null,"work_id":"88d8fabe-d757-4256-bc8c-c29b60393c41","year":null},"citing_paper":{"arxiv_id":"2506.20187","last_updated":"2025-07-02T05:12:29Z","snapshot_observed_at":"2026-08-07T20:42:38.846597Z","submitted_at":"2025-06-25T07:26:42Z","title":"Breaking the Boundaries of Long-Context LLM Inference: Adaptive KV Management on a Single Commodity GPU","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T23:00:11.196644Z"},"links":{"citing_paper":"/paper/2506.20187"},"observation_digest":"sha256:d2ffbaa9b66c6ad1ece514f07124bdd5f827ccd86384948cedb2b16cf609a113","observation_id":"00cbb8b3-40f4-4047-bc69-5ab3014aa410","resolution":{"observed_at":"2026-08-06T23:00:11.585902Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.03771","last_updated":"2020-07-14T03:42:34Z","snapshot_observed_at":"2026-07-06T08:27:58.343233Z","submitted_at":"2019-10-09T03:23:22Z","title":"HuggingFace's Transformers: State-of-the-art Natural Language Processing","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.03771","snapshot_observed_at":"2026-08-06T23:00:11.201904Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.20187","last_updated":"2025-07-02T05:12:29Z","snapshot_observed_at":"2026-08-07T20:42:38.846597Z","submitted_at":"2025-06-25T07:26:42Z","title":"Breaking the Boundaries of Long-Context LLM Inference: Adaptive KV Management on a Single Commodity GPU","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T23:00:11.201904Z"},"links":{"cited_paper":"/paper/1910.03771","citing_paper":"/paper/2506.20187"},"observation_digest":"sha256:9da986439a134de9eb13df62f34790152359b7883a75f4046ea803ba91bbaaed","observation_id":"9faa91c4-4c95-43d9-ab22-8e75d17d0ddf","resolution":{"observed_at":"2026-08-06T23:00:11.201904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.03762","last_updated":"2023-08-02T00:41:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-06-12T17:57:34Z","title":"Attention Is All You Need","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.03762","snapshot_observed_at":"2026-08-06T23:00:11.190412Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.20187","last_updated":"2025-07-02T05:12:29Z","snapshot_observed_at":"2026-08-07T20:42:38.846597Z","submitted_at":"2025-06-25T07:26:42Z","title":"Breaking the Boundaries of Long-Context LLM Inference: Adaptive KV Management on a Single Commodity GPU","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T23:00:11.190412Z"},"links":{"cited_paper":"/paper/1706.03762","citing_paper":"/paper/2506.20187"},"observation_digest":"sha256:6ab9270c0a9d3d122b7fa1b9739e63adab416a9bb1d5f5f81a4c2038dad04ba5","observation_id":"dc9c0f6d-fb3a-42bc-9121-98fa8597dadb","resolution":{"observed_at":"2026-08-06T23:00:11.190412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18139","last_updated":"2024-06-26T07:44:24Z","snapshot_observed_at":"2026-08-04T06:27:25.663339Z","submitted_at":"2024-06-26T07:44:24Z","title":"LOOK-M: Look-Once Optimization in KV Cache for Efficient Multimodal Long-Context Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18139","snapshot_observed_at":"2026-08-06T23:00:11.193142Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20187","last_updated":"2025-07-02T05:12:29Z","snapshot_observed_at":"2026-08-07T20:42:38.846597Z","submitted_at":"2025-06-25T07:26:42Z","title":"Breaking the Boundaries of Long-Context LLM Inference: Adaptive KV Management on a Single Commodity GPU","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T23:00:11.193142Z"},"links":{"cited_paper":"/paper/2406.18139","citing_paper":"/paper/2506.20187"},"observation_digest":"sha256:697641307e5443d2da0f289ae5194db40dce1ec3b8161290de4cd09237b4cf26","observation_id":"b265b223-eb3a-43b3-b1eb-2b0e57b0a087","resolution":{"observed_at":"2026-08-06T23:00:11.193142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12532","last_updated":"2024-06-05T09:01:24Z","snapshot_observed_at":"2026-07-06T18:17:08.160308Z","submitted_at":"2024-05-21T06:46:37Z","title":"PyramidInfer: Pyramid KV Cache Compression for High-throughput LLM Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12532","snapshot_observed_at":"2026-08-06T23:00:11.211770Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20187","last_updated":"2025-07-02T05:12:29Z","snapshot_observed_at":"2026-08-07T20:42:38.846597Z","submitted_at":"2025-06-25T07:26:42Z","title":"Breaking the Boundaries of Long-Context LLM Inference: Adaptive KV Management on a Single Commodity GPU","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T23:00:11.211770Z"},"links":{"cited_paper":"/paper/2405.12532","citing_paper":"/paper/2506.20187"},"observation_digest":"sha256:7e534608e986d6feb6e31a35a06b9307814fb3b286a8ece7786ae9b929c71f8c","observation_id":"72268e6b-f74b-4d8c-bf88-5a2f34360f62","resolution":{"observed_at":"2026-08-06T23:00:11.211770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:00:11.574398Z","title":"CoRR (2024)","venue":null,"work_id":"74f567d9-313e-492a-a892-becb64d4cba1","year":2024},"citing_paper":{"arxiv_id":"2506.20187","last_updated":"2025-07-02T05:12:29Z","snapshot_observed_at":"2026-08-07T20:42:38.846597Z","submitted_at":"2025-06-25T07:26:42Z","title":"Breaking the Boundaries of Long-Context LLM Inference: Adaptive KV Management on a Single Commodity GPU","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T23:00:11.199482Z"},"links":{"citing_paper":"/paper/2506.20187"},"observation_digest":"sha256:c62ea1c9bf1bc211bdff735bb5ce1dbe3305eb1ba257518ee02761ff2e53c191","observation_id":"9a237ed3-4f35-4776-8544-477683237d4a","resolution":{"observed_at":"2026-08-06T23:00:11.577027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:00:11.565217Z","title":null,"venue":null,"work_id":"e6b84b3f-bd52-4db5-9fd5-4ecdf1a5446a","year":2024},"citing_paper":{"arxiv_id":"2506.20187","last_updated":"2025-07-02T05:12:29Z","snapshot_observed_at":"2026-08-07T20:42:38.846597Z","submitted_at":"2025-06-25T07:26:42Z","title":"Breaking the Boundaries of Long-Context LLM Inference: Adaptive KV Management on a Single Commodity GPU","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T23:00:11.218073Z"},"links":{"citing_paper":"/paper/2506.20187"},"observation_digest":"sha256:b20b10050e10aa2ea9217af106f27320d2008bb3646f455badc3cb958d52811b","observation_id":"53660d0d-4639-4fd1-8374-2cc1c21b9dff","resolution":{"observed_at":"2026-08-06T23:00:11.568169Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09526","last_updated":"2024-10-29T13:04:42Z","snapshot_observed_at":"2026-08-08T10:01:02.085894Z","submitted_at":"2024-04-15T07:45:04Z","title":"LoongServe: Efficiently Serving Long-Context Large Language Models with Elastic Sequence Parallelism","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09526","snapshot_observed_at":"2026-08-06T23:00:11.204437Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20187","last_updated":"2025-07-02T05:12:29Z","snapshot_observed_at":"2026-08-07T20:42:38.846597Z","submitted_at":"2025-06-25T07:26:42Z","title":"Breaking the Boundaries of Long-Context LLM Inference: Adaptive KV Management on a Single Commodity GPU","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T23:00:11.204437Z"},"links":{"cited_paper":"/paper/2404.09526","citing_paper":"/paper/2506.20187"},"observation_digest":"sha256:2876bb53839a3c68016b0fc18b3b5b9d2d22ecfd63bbf35627f2e8c1ef6d512d","observation_id":"8b265304-d579-481a-a31f-dab3b8fadf1e","resolution":{"observed_at":"2026-08-06T23:00:11.204437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21018","last_updated":"2025-02-27T12:30:43Z","snapshot_observed_at":"2026-08-02T14:11:02.770149Z","submitted_at":"2024-07-30T17:59:08Z","title":"ThinK: Thinner Key Cache by Query-Driven Pruning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21018","snapshot_observed_at":"2026-08-06T23:00:11.208166Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20187","last_updated":"2025-07-02T05:12:29Z","snapshot_observed_at":"2026-08-07T20:42:38.846597Z","submitted_at":"2025-06-25T07:26:42Z","title":"Breaking the Boundaries of Long-Context LLM Inference: Adaptive KV Management on a Single Commodity GPU","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T23:00:11.208166Z"},"links":{"cited_paper":"/paper/2407.21018","citing_paper":"/paper/2506.20187"},"observation_digest":"sha256:1ac1562158c2daf7e7efdeed3d5d0bd4a084b731a35f31f6164e7d99bfcfc689","observation_id":"ef238234-d80b-46c7-922d-49b515f2b452","resolution":{"observed_at":"2026-08-06T23:00:11.208166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:00:11.542706Z","title":null,"venue":null,"work_id":"caddb1ba-f845-4031-b0da-c7773c7c5610","year":2024},"citing_paper":{"arxiv_id":"2506.20187","last_updated":"2025-07-02T05:12:29Z","snapshot_observed_at":"2026-08-07T20:42:38.846597Z","submitted_at":"2025-06-25T07:26:42Z","title":"Breaking the Boundaries of Long-Context LLM Inference: Adaptive KV Management on a Single Commodity GPU","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T23:00:11.226972Z"},"links":{"citing_paper":"/paper/2506.20187"},"observation_digest":"sha256:2ef67169ac13d4e78ee409856280382a116963157fe01c79b7bdfad2fcb2f1e9","observation_id":"6105dbbd-527b-4de3-ac63-e16d37d08ba3","resolution":{"observed_at":"2026-08-06T23:00:11.546105Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16444","last_updated":"2025-04-03T22:49:22Z","snapshot_observed_at":"2026-08-07T00:11:38.883613Z","submitted_at":"2024-05-26T06:00:17Z","title":"CacheBlend: Fast Large Language Model Serving for RAG with Cached Knowledge Fusion","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16444","snapshot_observed_at":"2026-08-06T23:00:11.214547Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20187","last_updated":"2025-07-02T05:12:29Z","snapshot_observed_at":"2026-08-07T20:42:38.846597Z","submitted_at":"2025-06-25T07:26:42Z","title":"Breaking the Boundaries of Long-Context LLM Inference: Adaptive KV Management on a Single Commodity GPU","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T23:00:11.214547Z"},"links":{"cited_paper":"/paper/2405.16444","citing_paper":"/paper/2506.20187"},"observation_digest":"sha256:2e467935ba3c143117c4c4050e6ee83500bd6f27096522ff1597e9bbd5c1b642","observation_id":"982655e1-4327-4add-b550-c68d1e0d768d","resolution":{"observed_at":"2026-08-06T23:00:11.214547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.18223","last_updated":"2026-03-18T05:34:39Z","snapshot_observed_at":"2026-08-06T23:27:24.356320Z","submitted_at":"2023-03-31T17:28:46Z","title":"A Survey of Large Language Models","version":19},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.18223","snapshot_observed_at":"2026-08-06T23:00:11.232057Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20187","last_updated":"2025-07-02T05:12:29Z","snapshot_observed_at":"2026-08-07T20:42:38.846597Z","submitted_at":"2025-06-25T07:26:42Z","title":"Breaking the Boundaries of Long-Context LLM Inference: Adaptive KV Management on a Single Commodity GPU","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T23:00:11.232057Z"},"links":{"cited_paper":"/paper/2303.18223","citing_paper":"/paper/2506.20187"},"observation_digest":"sha256:38bf7c6e312e11c845d1866164413512fa5c58c28f2adfe5ee1fb7f8d5ede762","observation_id":"5d4f426f-5312-485f-ae9a-e17e6d90758b","resolution":{"observed_at":"2026-08-06T23:00:11.232057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12820","last_updated":"2025-03-30T08:13:50Z","snapshot_observed_at":"2026-07-06T18:48:00.070861Z","submitted_at":"2024-07-01T13:05:42Z","title":"PQCache: Product Quantization-based KVCache for Long Context LLM Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12820","snapshot_observed_at":"2026-08-06T23:00:11.220828Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20187","last_updated":"2025-07-02T05:12:29Z","snapshot_observed_at":"2026-08-07T20:42:38.846597Z","submitted_at":"2025-06-25T07:26:42Z","title":"Breaking the Boundaries of Long-Context LLM Inference: Adaptive KV Management on a Single Commodity GPU","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T23:00:11.220828Z"},"links":{"cited_paper":"/paper/2407.12820","citing_paper":"/paper/2506.20187"},"observation_digest":"sha256:614c6e1e6b16ca9fa3e6ae6bf929e47686497058fc1d930f83586b05c6e092c6","observation_id":"2f441ba8-0dff-49a9-a7c4-17d4fbf2545c","resolution":{"observed_at":"2026-08-06T23:00:11.220828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:00:11.554764Z","title":null,"venue":null,"work_id":"dc2b2cb2-301d-44a8-9220-ddb905a68e99","year":2024},"citing_paper":{"arxiv_id":"2506.20187","last_updated":"2025-07-02T05:12:29Z","snapshot_observed_at":"2026-08-07T20:42:38.846597Z","submitted_at":"2025-06-25T07:26:42Z","title":"Breaking the Boundaries of Long-Context LLM Inference: Adaptive KV Management on a Single Commodity GPU","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T23:00:11.224307Z"},"links":{"citing_paper":"/paper/2506.20187"},"observation_digest":"sha256:bc213d1891ac77beddae6209857a48fc90b6f9eae2b120c99e54d56899f52cb8","observation_id":"21dcce89-2d65-49be-8219-088415133011","resolution":{"observed_at":"2026-08-06T23:00:11.558370Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14294","last_updated":"2024-07-19T04:47:36Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T15:53:08Z","title":"A Survey on Efficient Inference for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14294","snapshot_observed_at":"2026-08-06T23:00:11.240664Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20187","last_updated":"2025-07-02T05:12:29Z","snapshot_observed_at":"2026-08-07T20:42:38.846597Z","submitted_at":"2025-06-25T07:26:42Z","title":"Breaking the Boundaries of Long-Context LLM Inference: Adaptive KV Management on a Single Commodity GPU","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T23:00:11.240664Z"},"links":{"cited_paper":"/paper/2404.14294","citing_paper":"/paper/2506.20187"},"observation_digest":"sha256:150716f8fc45232647e9060f2828f5077604237b8e682b9e2fa1a8e6e2880b55","observation_id":"786f3f45-932e-4111-858c-a3bb056ef05c","resolution":{"observed_at":"2026-08-06T23:00:11.240664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:00:11.229346Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20187","last_updated":"2025-07-02T05:12:29Z","snapshot_observed_at":"2026-08-07T20:42:38.846597Z","submitted_at":"2025-06-25T07:26:42Z","title":"Breaking the Boundaries of Long-Context LLM Inference: Adaptive KV Management on a Single Commodity GPU","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T23:00:11.229346Z"},"links":{"citing_paper":"/paper/2506.20187"},"observation_digest":"sha256:fd6bcd837de4130c20c8786cb33aaec86a769d5140ea4fc1d819312eda3d9c50","observation_id":"86c39ce3-400f-4d9b-aaf4-52551a49c237","resolution":{"observed_at":"2026-08-06T23:00:11.229346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17312","last_updated":"2024-03-26T01:46:34Z","snapshot_observed_at":"2026-07-31T15:33:16.160466Z","submitted_at":"2024-03-26T01:46:34Z","title":"ALISA: Accelerating Large Language Model Inference via Sparsity-Aware KV Caching","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17312","snapshot_observed_at":"2026-08-06T23:00:11.235417Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20187","last_updated":"2025-07-02T05:12:29Z","snapshot_observed_at":"2026-08-07T20:42:38.846597Z","submitted_at":"2025-06-25T07:26:42Z","title":"Breaking the Boundaries of Long-Context LLM Inference: Adaptive KV Management on a Single Commodity GPU","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T23:00:11.235417Z"},"links":{"cited_paper":"/paper/2403.17312","citing_paper":"/paper/2506.20187"},"observation_digest":"sha256:b6722e2d832316f1e22cb3ede2dc713e1deaeb8d58df23e709d787f3d7859022","observation_id":"dd39bc2f-a8a1-4b66-ac9e-69c0233636d2","resolution":{"observed_at":"2026-08-06T23:00:11.235417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:00:11.238133Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20187","last_updated":"2025-07-02T05:12:29Z","snapshot_observed_at":"2026-08-07T20:42:38.846597Z","submitted_at":"2025-06-25T07:26:42Z","title":"Breaking the Boundaries of Long-Context LLM Inference: Adaptive KV Management on a Single Commodity GPU","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T23:00:11.238133Z"},"links":{"citing_paper":"/paper/2506.20187"},"observation_digest":"sha256:81627bc23606f151845eaa89a551862ba76fa6ebfa33839129a3bcc68488f042","observation_id":"e078f43c-07b0-446d-9db3-d63d4217b598","resolution":{"observed_at":"2026-08-06T23:00:11.238133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15486","last_updated":"2025-09-03T02:11:32Z","snapshot_observed_at":"2026-07-06T18:35:08.874127Z","submitted_at":"2024-06-17T11:05:15Z","title":"SampleAttention: Near-Lossless Acceleration of Long Context LLM Inference with Adaptive Structured Sparse Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15486","snapshot_observed_at":"2026-08-06T23:00:11.244159Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20187","last_updated":"2025-07-02T05:12:29Z","snapshot_observed_at":"2026-08-07T20:42:38.846597Z","submitted_at":"2025-06-25T07:26:42Z","title":"Breaking the Boundaries of Long-Context LLM Inference: Adaptive KV Management on a Single Commodity GPU","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T23:00:11.244159Z"},"links":{"cited_paper":"/paper/2406.15486","citing_paper":"/paper/2506.20187"},"observation_digest":"sha256:ceb223b420cfa4ec3cd9f0d2fe7f5bcf732777637b7192922e70f14c13979d5e","observation_id":"1e48076b-dbe4-4a8a-82fc-b0250b397dc8","resolution":{"observed_at":"2026-08-06T23:00:11.244159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:00:11.103318Z","title":"InProceedings of the 29th Symposium on Operating Systems Principles","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.20187","last_updated":"2025-07-02T05:12:29Z","snapshot_observed_at":"2026-08-07T20:42:38.846597Z","submitted_at":"2025-06-25T07:26:42Z","title":"Breaking the Boundaries of Long-Context LLM Inference: Adaptive KV Management on a Single Commodity GPU","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T23:00:11.103318Z"},"links":{"citing_paper":"/paper/2506.20187"},"observation_digest":"sha256:52d64f7dc9b164803b2eac0c3326fb2a7eafa8c1962d8cf157102412edd83604","observation_id":"fdbb2d96-e0a5-4a4d-b3b4-ad2d91310eed","resolution":{"observed_at":"2026-08-06T23:00:11.103318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:00:11.703264Z","title":"In Proceedings of the ACM SIGCOMM 2024 Conference","venue":null,"work_id":"2595d82d-eec5-497c-83f3-f01e247ffd37","year":2024},"citing_paper":{"arxiv_id":"2506.20187","last_updated":"2025-07-02T05:12:29Z","snapshot_observed_at":"2026-08-07T20:42:38.846597Z","submitted_at":"2025-06-25T07:26:42Z","title":"Breaking the Boundaries of Long-Context LLM Inference: Adaptive KV Management on a Single Commodity GPU","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T23:00:11.121422Z"},"links":{"citing_paper":"/paper/2506.20187"},"observation_digest":"sha256:1adde59271d1783aba6b49c48509550c428d813c1abbbd5f0eec26cbaae91bfc","observation_id":"3479ea6b-be0f-4aa1-bf07-2c93a4a24d47","resolution":{"observed_at":"2026-08-06T23:00:11.706064Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.20187","last_updated":"2025-07-02T05:12:29Z","latest_version":2,"primary_category":"cs.OS","snapshot_observed_at":"2026-08-07T20:42:38.846597Z","submitted_at":"2025-06-25T07:26:42Z","title":"Breaking the Boundaries of Long-Context LLM Inference: Adaptive KV Management on a Single Commodity GPU"},"reference_resolution":{"displayed":75,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":69,"verified_exact":2,"verified_fuzzy":4},"total_outbound_references":75},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 75 of 75 outbound references and 2 inbound Pith citation observations for arXiv:2506.20187."}