{"as_of":"2026-08-15T02:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e76e67e905b0e039270e2eaba871fabfb5a4d2a991939c51738277ac012b4ced","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":17,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":17,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":17,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":17,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T17:00:04.086265Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T01:36:44.087990Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2310.07240","last_updated":"2024-07-19T21:04:14Z","snapshot_observed_at":"2026-08-13T05:52:26.338685Z","submitted_at":"2023-10-11T07:08:20Z","title":"CacheGen: KV Cache Compression and Streaming for Fast Large Language Model Serving","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07240","snapshot_observed_at":"2026-08-12T17:00:04.086265Z","title":"Cachegen: Fast context loading for language model applications","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.13009","last_updated":"2024-11-21T16:49:51Z","snapshot_observed_at":"2026-08-14T21:51:32.597592Z","submitted_at":"2024-11-20T03:17:51Z","title":"LLMSteer: Improving Long-Context LLM Inference by Steering Attention on Reused Contexts","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T17:00:04.086265Z"},"links":{"cited_paper":"/paper/2310.07240","citing_paper":"/paper/2411.13009"},"observation_digest":"sha256:fc2148ebe817bfc5610b42c78a6ed3356c62c33d9397ac58bb82a39cccee46ad","observation_id":"78ac79e8-f742-4930-865d-5fec79050c14","resolution":{"observed_at":"2026-08-12T17:00:04.086265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07240","last_updated":"2024-07-19T21:04:14Z","snapshot_observed_at":"2026-08-13T05:52:26.338685Z","submitted_at":"2023-10-11T07:08:20Z","title":"CacheGen: KV Cache Compression and Streaming for Fast Large Language Model Serving","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07240","snapshot_observed_at":"2026-08-11T15:56:14.604922Z","title":"Cachegen: Fast context loading for language model applications","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.14743","last_updated":"2024-12-13T21:54:16Z","snapshot_observed_at":"2026-08-13T11:30:30.407590Z","submitted_at":"2024-12-13T21:54:16Z","title":"KVDirect: Distributed Disaggregated LLM Inference","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T15:56:14.604922Z"},"links":{"cited_paper":"/paper/2310.07240","citing_paper":"/paper/2501.14743"},"observation_digest":"sha256:72589e9b89f27040340c3b5ebc5b0b55c716aa11f76ae1f99038ea88968847da","observation_id":"febecb8e-2517-4865-896c-d5737ddc14a5","resolution":{"observed_at":"2026-08-11T15:56:14.604922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07240","last_updated":"2024-07-19T21:04:14Z","snapshot_observed_at":"2026-08-13T05:52:26.338685Z","submitted_at":"2023-10-11T07:08:20Z","title":"CacheGen: KV Cache Compression and Streaming for Fast Large Language Model Serving","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07240","snapshot_observed_at":"2026-08-09T11:11:17.739768Z","title":"Cachegen: Kv cache compression and streaming for fast large language model serving, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02789","last_updated":"2025-05-19T18:24:50Z","snapshot_observed_at":"2026-08-13T08:58:53.238480Z","submitted_at":"2025-02-05T00:22:06Z","title":"Speculative Prefill: Turbocharging TTFT with Lightweight and Training-Free Token Importance Estimation","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-09T11:11:17.739768Z"},"links":{"cited_paper":"/paper/2310.07240","citing_paper":"/paper/2502.02789"},"observation_digest":"sha256:451de6024cc3d84660df1e34ccbb97bad60001bcd05944f73523a8e08ae4507c","observation_id":"12d1fef0-7650-4007-95a7-1d84b3e70cb5","resolution":{"observed_at":"2026-08-09T11:11:17.739768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07240","last_updated":"2024-07-19T21:04:14Z","snapshot_observed_at":"2026-08-13T05:52:26.338685Z","submitted_at":"2023-10-11T07:08:20Z","title":"CacheGen: KV Cache Compression and Streaming for Fast Large Language Model Serving","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07240","snapshot_observed_at":"2026-08-09T05:40:21.554321Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.15734","last_updated":"2025-02-05T14:12:33Z","snapshot_observed_at":"2026-08-13T04:33:17.001464Z","submitted_at":"2025-02-05T14:12:33Z","title":"Cache-Craft: Managing Chunk-Caches for Efficient Retrieval-Augmented Generation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-09T05:40:21.554321Z"},"links":{"cited_paper":"/paper/2310.07240","citing_paper":"/paper/2502.15734"},"observation_digest":"sha256:dcbcb8e36100848002b18fe2691c653f8a553024448172417c67d505e8e6ce12","observation_id":"e560a3a0-8f46-49e1-8f74-80956214fa5a","resolution":{"observed_at":"2026-08-09T05:40:21.554321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07240","last_updated":"2024-07-19T21:04:14Z","snapshot_observed_at":"2026-08-13T05:52:26.338685Z","submitted_at":"2023-10-11T07:08:20Z","title":"CacheGen: KV Cache Compression and Streaming for Fast Large Language Model Serving","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07240","snapshot_observed_at":"2026-08-07T04:15:44.937596Z","title":"Cachegen: Kv cache compression and stream- ing for fast large language model serving, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11309","last_updated":"2025-06-12T21:15:58Z","snapshot_observed_at":"2026-08-08T01:16:03.022130Z","submitted_at":"2025-06-12T21:15:58Z","title":"SwiftSpec: Ultra-Low Latency LLM Decoding by Scaling Asynchronous Speculative Decoding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T04:15:44.937596Z"},"links":{"cited_paper":"/paper/2310.07240","citing_paper":"/paper/2506.11309"},"observation_digest":"sha256:1db977ef1845e62cd0999138e1e6276f061706d495b4586d680edd515517ef41","observation_id":"d04da29a-e91d-4121-9b85-9c9c9a1bacee","resolution":{"observed_at":"2026-08-07T04:15:44.937596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07240","last_updated":"2024-07-19T21:04:14Z","snapshot_observed_at":"2026-08-13T05:52:26.338685Z","submitted_at":"2023-10-11T07:08:20Z","title":"CacheGen: KV Cache Compression and Streaming for Fast Large Language Model Serving","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07240","snapshot_observed_at":"2026-08-06T23:49:26.441620Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16258","last_updated":"2025-06-19T12:17:31Z","snapshot_observed_at":"2026-08-10T03:09:55.520770Z","submitted_at":"2025-06-19T12:17:31Z","title":"ViFusion: In-Network Tensor Fusion for Scalable Video Feature Indexing","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:26.441620Z"},"links":{"cited_paper":"/paper/2310.07240","citing_paper":"/paper/2506.16258"},"observation_digest":"sha256:bc815fe7dfa9198fdf360e394beefcee45ad7f0b0142f20217aaa4b253a3b529","observation_id":"8d66700f-ad39-4d58-a4f0-4ec86695dbfc","resolution":{"observed_at":"2026-08-06T23:49:26.441620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07240","last_updated":"2024-07-19T21:04:14Z","snapshot_observed_at":"2026-08-13T05:52:26.338685Z","submitted_at":"2023-10-11T07:08:20Z","title":"CacheGen: KV Cache Compression and Streaming for Fast Large Language Model Serving","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07240","snapshot_observed_at":"2026-08-06T18:11:15.906010Z","title":"Cachegen: Fast context loading for language model applications","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09019","last_updated":"2025-07-11T20:58:21Z","snapshot_observed_at":"2026-08-13T20:44:23.894752Z","submitted_at":"2025-07-11T20:58:21Z","title":"On Evaluating Performance of LLM Inference Serving Systems","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T18:11:15.906010Z"},"links":{"cited_paper":"/paper/2310.07240","citing_paper":"/paper/2507.09019"},"observation_digest":"sha256:4bd953403080e275245d2b4a5031f566c3a5a18dad49e862dfdd826fbbfca474","observation_id":"aa5dc71d-861b-48c0-9a3a-05f55e5e1dc4","resolution":{"observed_at":"2026-08-06T18:11:15.906010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07240","last_updated":"2024-07-19T21:04:14Z","snapshot_observed_at":"2026-08-13T05:52:26.338685Z","submitted_at":"2023-10-11T07:08:20Z","title":"CacheGen: KV Cache Compression and Streaming for Fast Large Language Model Serving","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07240","snapshot_observed_at":"2026-08-05T14:28:37.932904Z","title":"Oct 2023 CacheGen: KV Cache Compression and Streaming for Fast Large Language Model Serving [https://arxiv.org/abs/2310.07240]","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.21307","last_updated":"2025-08-29T02:08:36Z","snapshot_observed_at":"2026-08-14T04:58:14.863265Z","submitted_at":"2025-08-29T02:08:36Z","title":"MultiFluxAI Enhancing Platform Engineering with Advanced Agent-Orchestrated Retrieval Systems","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T14:28:37.932904Z"},"links":{"cited_paper":"/paper/2310.07240","citing_paper":"/paper/2508.21307"},"observation_digest":"sha256:5842e1f3814c20f99ea636beaf6ff0e7c37beb1ab3dcb1b6b6f6e11f32ab9b93","observation_id":"347e9ca1-f020-4eed-8969-5d0979cfd26f","resolution":{"observed_at":"2026-08-05T14:28:37.932904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07240","last_updated":"2024-07-19T21:04:14Z","snapshot_observed_at":"2026-08-13T05:52:26.338685Z","submitted_at":"2023-10-11T07:08:20Z","title":"CacheGen: KV Cache Compression and Streaming for Fast Large Language Model Serving","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07240","snapshot_observed_at":"2026-08-04T20:42:45.723763Z","title":"Cachegen: Kv cache compression and streaming for fast large language model serving,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08400","last_updated":"2025-09-10T08:44:57Z","snapshot_observed_at":"2026-08-14T12:06:05.012725Z","submitted_at":"2025-09-10T08:44:57Z","title":"Ubiquitous Intelligence Via Wireless Network-Driven LLMs Evolution","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-04T20:42:45.723763Z"},"links":{"cited_paper":"/paper/2310.07240","citing_paper":"/paper/2509.08400"},"observation_digest":"sha256:54678530a3cc35011dd48be76160e9037088a20ec8044c8b849d318467411c6a","observation_id":"f388e6c0-2d7e-45fb-a46c-9d99ab23b9cf","resolution":{"observed_at":"2026-08-04T20:42:45.723763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07240","last_updated":"2024-07-19T21:04:14Z","snapshot_observed_at":"2026-08-13T05:52:26.338685Z","submitted_at":"2023-10-11T07:08:20Z","title":"CacheGen: KV Cache Compression and Streaming for Fast Large Language Model Serving","version":6},"cited_work":{"arxiv_id":"2310.07240","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.07240","snapshot_observed_at":"2026-07-10T01:36:44.087990Z","title":"CacheGen: KV Cache Compression and Streaming for Fast Large Language Model Serving","venue":"cs.NI","work_id":"49940440-d8c7-48da-9838-5e97439af9cb","year":2023},"citing_paper":{"arxiv_id":"2605.24022","last_updated":"2026-05-20T08:59:48Z","snapshot_observed_at":"2026-08-12T22:54:06.883058Z","submitted_at":"2026-05-20T08:59:48Z","title":"Adaptive KV Cache Reuse for Fast Long-Context LLM Serving","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-30T17:23:13.154458Z"},"links":{"cited_paper":"/paper/2310.07240","citing_paper":"/paper/2605.24022"},"observation_digest":"sha256:cb3e44955229ade47659eb31bf116d401bb0e40a179e73dcc13605b5a70f7333","observation_id":"09e55922-d738-414a-9c2b-16ce9c3cedde","resolution":{"observed_at":"2026-06-30T17:24:56.970739Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07240","last_updated":"2024-07-19T21:04:14Z","snapshot_observed_at":"2026-08-13T05:52:26.338685Z","submitted_at":"2023-10-11T07:08:20Z","title":"CacheGen: KV Cache Compression and Streaming for Fast Large Language Model Serving","version":6},"cited_work":{"arxiv_id":"2310.07240","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.07240","snapshot_observed_at":"2026-07-10T01:36:44.087990Z","title":"CacheGen: KV Cache Compression and Streaming for Fast Large Language Model Serving","venue":"cs.NI","work_id":"49940440-d8c7-48da-9838-5e97439af9cb","year":2023},"citing_paper":{"arxiv_id":"2606.05875","last_updated":"2026-06-04T08:47:46Z","snapshot_observed_at":"2026-08-14T03:15:05.778194Z","submitted_at":"2026-06-04T08:47:46Z","title":"QCFuse: Query-Aware Cache Fusion via Compressed View for Efficient RAG Serving","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-28T01:47:43.240850Z"},"links":{"cited_paper":"/paper/2310.07240","citing_paper":"/paper/2606.05875"},"observation_digest":"sha256:13c3c84d41c7ee2591fd512069c9a50d11254fae6905782cda5f3c62073ec6d2","observation_id":"2694c557-0caa-45ea-8992-a1bfed5e6542","resolution":{"observed_at":"2026-07-02T12:46:57.479670Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07240","last_updated":"2024-07-19T21:04:14Z","snapshot_observed_at":"2026-08-13T05:52:26.338685Z","submitted_at":"2023-10-11T07:08:20Z","title":"CacheGen: KV Cache Compression and Streaming for Fast Large Language Model Serving","version":6},"cited_work":{"arxiv_id":"2310.07240","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.07240","snapshot_observed_at":"2026-07-10T01:36:44.087990Z","title":"CacheGen: KV Cache Compression and Streaming for Fast Large Language Model Serving","venue":"cs.NI","work_id":"49940440-d8c7-48da-9838-5e97439af9cb","year":2023},"citing_paper":{"arxiv_id":"2606.29708","last_updated":"2026-06-30T03:13:37Z","snapshot_observed_at":"2026-08-14T23:01:52.369119Z","submitted_at":"2026-06-29T02:24:13Z","title":"Demystifying the Design Space and Best Practices for Heterogeneous LLM Inference and Serving","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-30T05:37:13.211613Z"},"links":{"cited_paper":"/paper/2310.07240","citing_paper":"/paper/2606.29708"},"observation_digest":"sha256:083b53fbb4464c5566714383641337bedbeaf6842c13cd6e58f269df2e608a63","observation_id":"e221043e-7543-4001-a33a-60b3ebba5179","resolution":{"observed_at":"2026-06-30T14:04:45.315356Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07240","last_updated":"2024-07-19T21:04:14Z","snapshot_observed_at":"2026-08-13T05:52:26.338685Z","submitted_at":"2023-10-11T07:08:20Z","title":"CacheGen: KV Cache Compression and Streaming for Fast Large Language Model Serving","version":6},"cited_work":{"arxiv_id":"2310.07240","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.07240","snapshot_observed_at":"2026-07-10T01:36:44.087990Z","title":"CacheGen: KV Cache Compression and Streaming for Fast Large Language Model Serving","venue":"cs.NI","work_id":"49940440-d8c7-48da-9838-5e97439af9cb","year":2023},"citing_paper":{"arxiv_id":"2606.29708","last_updated":"2026-06-30T03:13:37Z","snapshot_observed_at":"2026-08-14T23:01:52.369119Z","submitted_at":"2026-06-29T02:24:13Z","title":"Demystifying the Design Space and Best Practices for Heterogeneous LLM Inference and Serving","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-01T07:06:53.318182Z"},"links":{"cited_paper":"/paper/2310.07240","citing_paper":"/paper/2606.29708"},"observation_digest":"sha256:0b623353780e02168615be0aa780179a956a1d0c39bd6dcb72d9d0193449d037","observation_id":"b66cc25a-7a9f-4cbf-b764-20fd0aedde85","resolution":{"observed_at":"2026-07-01T08:55:35.115489Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07240","last_updated":"2024-07-19T21:04:14Z","snapshot_observed_at":"2026-08-13T05:52:26.338685Z","submitted_at":"2023-10-11T07:08:20Z","title":"CacheGen: KV Cache Compression and Streaming for Fast Large Language Model Serving","version":6},"cited_work":{"arxiv_id":"2310.07240","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.07240","snapshot_observed_at":"2026-07-10T01:36:44.087990Z","title":"CacheGen: KV Cache Compression and Streaming for Fast Large Language Model Serving","venue":"cs.NI","work_id":"49940440-d8c7-48da-9838-5e97439af9cb","year":2023},"citing_paper":{"arxiv_id":"2607.08032","last_updated":"2026-07-09T01:15:03Z","snapshot_observed_at":"2026-08-02T16:38:21.894642Z","submitted_at":"2026-07-09T01:15:03Z","title":"What to Keep, What to Forget: A Rate--Distortion View of Memory Compaction in LLMs and Agents","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-07-10T01:26:59.421158Z"},"links":{"cited_paper":"/paper/2310.07240","citing_paper":"/paper/2607.08032"},"observation_digest":"sha256:d7036d082a362aa798e8a4fb7985eeb5db08c13e702a3e1b80d27e8d63e0a4b0","observation_id":"0a8d3eba-7310-4e24-8daf-309770ebc037","resolution":{"observed_at":"2026-07-10T01:36:44.089166Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07240","last_updated":"2024-07-19T21:04:14Z","snapshot_observed_at":"2026-08-13T05:52:26.338685Z","submitted_at":"2023-10-11T07:08:20Z","title":"CacheGen: KV Cache Compression and Streaming for Fast Large Language Model Serving","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07240","snapshot_observed_at":"2026-08-02T02:10:49.534551Z","title":"LMCache: An Eﬀicient KV Cache Layer for Enterprise-Scale LLM Inference","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14431","last_updated":"2026-07-15T23:55:48Z","snapshot_observed_at":"2026-08-13T04:24:45.805856Z","submitted_at":"2026-07-15T23:55:48Z","title":"Smarter and Cheaper at Once: Byte-Exact KV-Cache Grafting Turns a Frozen Small Model into a Verified-Knowledge Flywheel","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T02:10:49.534551Z"},"links":{"cited_paper":"/paper/2310.07240","citing_paper":"/paper/2607.14431"},"observation_digest":"sha256:259c50e4226f34cf1423af919c956b3df685c9fdd921566cbd80cf1cf9b75e3e","observation_id":"dcc0f714-5a6a-48f1-8a67-3630cf0085b9","resolution":{"observed_at":"2026-08-02T02:10:49.534551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07240","last_updated":"2024-07-19T21:04:14Z","snapshot_observed_at":"2026-08-13T05:52:26.338685Z","submitted_at":"2023-10-11T07:08:20Z","title":"CacheGen: KV Cache Compression and Streaming for Fast Large Language Model Serving","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07240","snapshot_observed_at":"2026-08-01T07:46:26.861103Z","title":"CacheGen: KV Cache Compression and Streaming for Fast Large Language Model Serving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21686","last_updated":"2026-07-23T14:39:46Z","snapshot_observed_at":"2026-08-08T08:20:20.803685Z","submitted_at":"2026-07-23T14:39:46Z","title":"Persistent Computational State: A Session-Centric Runtime for Generative World Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T07:46:26.861103Z"},"links":{"cited_paper":"/paper/2310.07240","citing_paper":"/paper/2607.21686"},"observation_digest":"sha256:106753e33ddac6435be4aa9278cc9f23583c5f702281c1d476c251c248944da8","observation_id":"2de3a19a-a0f9-4dc1-9201-8d2d0e35ce6d","resolution":{"observed_at":"2026-08-01T07:46:26.861103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07240","last_updated":"2024-07-19T21:04:14Z","snapshot_observed_at":"2026-08-13T05:52:26.338685Z","submitted_at":"2023-10-11T07:08:20Z","title":"CacheGen: KV Cache Compression and Streaming for Fast Large Language Model Serving","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07240","snapshot_observed_at":"2026-08-06T00:33:27.633007Z","title":"Cachegen: KV cache compression and streaming for fast large language model serving,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.01126","last_updated":"2026-08-02T09:51:15Z","snapshot_observed_at":"2026-08-14T05:03:26.100362Z","submitted_at":"2026-08-02T09:51:15Z","title":"Spatial Prefix Caching for Wireless Edge LLM Inference: A Stochastic-Geometry and Queueing Framework","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T00:33:27.633007Z"},"links":{"cited_paper":"/paper/2310.07240","citing_paper":"/paper/2608.01126"},"observation_digest":"sha256:020ccd7ad443dd2e179ec863a8ce8ccd37437a95a4ec8cd922e9f08055d7202f","observation_id":"d8f82b89-0ba8-445c-93ef-2f2041318699","resolution":{"observed_at":"2026-08-06T00:33:27.633007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2310.07240/citation-record","integrity":"/paper/2310.07240/integrity","json":"/paper/2310.07240/citation-record.json","paper":"/paper/2310.07240"},"outbound":[],"paper":{"arxiv_id":"2310.07240","last_updated":"2024-07-19T21:04:14Z","latest_version":6,"primary_category":"cs.NI","snapshot_observed_at":"2026-08-13T05:52:26.338685Z","submitted_at":"2023-10-11T07:08:20Z","title":"CacheGen: KV Cache Compression and Streaming for Fast Large Language Model Serving"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 17 inbound Pith citation observations for arXiv:2310.07240."}