{"as_of":"2026-08-20T11:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:204b6256be3d90e8d07f93f85a73923ef7a0f7fe9a5414d4512eb279d5eb9d8a","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":24,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":24,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":24,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T00:27:45.534694Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":12,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2311.04934","last_updated":"2024-04-25T15:45:19Z","snapshot_observed_at":"2026-08-18T21:38:48.895755Z","submitted_at":"2023-11-07T18:17:05Z","title":"Prompt Cache: Modular Attention Reuse for Low-Latency Inference","version":2},"cited_work":{"arxiv_id":"2311.04934","doi":"10.48550/arxiv.2311.04934","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.04934","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Prompt cache: Modular attention reuse for low-latency inference","venue":"arXiv (Cornell University)","work_id":"afbbfafd-6a60-4022-83bf-378314908161","year":2024},"citing_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-08-18T16:18:58.765617Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-12T08:20:01.011625Z"},"links":{"cited_paper":"/paper/2311.04934","citing_paper":"/paper/2312.07104"},"observation_digest":"sha256:4d8fc74e43be1cb593d140b752f1ed32ccff69fc5a5f91966996c5b679771e9a","observation_id":"dd159a32-1bc2-4141-8132-23950eee6907","resolution":{"observed_at":"2026-05-12T08:20:01.060678Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04934","last_updated":"2024-04-25T15:45:19Z","snapshot_observed_at":"2026-08-18T21:38:48.895755Z","submitted_at":"2023-11-07T18:17:05Z","title":"Prompt Cache: Modular Attention Reuse for Low-Latency Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04934","snapshot_observed_at":"2026-08-11T15:45:23.028887Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15246","last_updated":"2024-12-14T06:47:56Z","snapshot_observed_at":"2026-08-19T22:53:56.519598Z","submitted_at":"2024-12-14T06:47:56Z","title":"Accelerating Retrieval-Augmented Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T15:45:23.028887Z"},"links":{"cited_paper":"/paper/2311.04934","citing_paper":"/paper/2412.15246"},"observation_digest":"sha256:31b1d00b97b6ced7a4df9e9f777428cabd1bf47dc1084d67f73b832ee739bce6","observation_id":"faa06f4f-055a-4740-b990-f77bbe3509f4","resolution":{"observed_at":"2026-08-11T15:45:23.028887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04934","last_updated":"2024-04-25T15:45:19Z","snapshot_observed_at":"2026-08-18T21:38:48.895755Z","submitted_at":"2023-11-07T18:17:05Z","title":"Prompt Cache: Modular Attention Reuse for Low-Latency Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04934","snapshot_observed_at":"2026-08-09T20:45:51.269548Z","title":"org/CorpusID:54457299","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2501.19300","last_updated":"2025-05-29T03:11:10Z","snapshot_observed_at":"2026-08-17T15:18:52.232222Z","submitted_at":"2025-01-31T16:56:18Z","title":"Offline Learning for Combinatorial Multi-armed Bandits","version":2},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-09T20:45:51.269548Z"},"links":{"cited_paper":"/paper/2311.04934","citing_paper":"/paper/2501.19300"},"observation_digest":"sha256:04b9fa959d84fc0368f07c13e98ba9bc02755b6a19c3e600373ab6e53aaec3d0","observation_id":"f5c29039-d30e-42c7-8632-b2361c11eb78","resolution":{"observed_at":"2026-08-09T20:45:51.269548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04934","last_updated":"2024-04-25T15:45:19Z","snapshot_observed_at":"2026-08-18T21:38:48.895755Z","submitted_at":"2023-11-07T18:17:05Z","title":"Prompt Cache: Modular Attention Reuse for Low-Latency Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04934","snapshot_observed_at":"2026-08-15T21:10:19.864940Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.10640","last_updated":"2025-06-02T20:08:34Z","snapshot_observed_at":"2026-08-18T09:36:23.346739Z","submitted_at":"2025-05-15T18:22:45Z","title":"The Hitchhikers Guide to Production-ready Trustworthy Foundation Model powered Software (FMware)","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T21:10:19.864940Z"},"links":{"cited_paper":"/paper/2311.04934","citing_paper":"/paper/2505.10640"},"observation_digest":"sha256:8251c9837b19b84a444fcb31cb030d98c561bceb23eebace1c83e51e75459c16","observation_id":"e53a4bae-80f1-46c9-b5d3-d5a35ebd824d","resolution":{"observed_at":"2026-08-15T21:10:19.864940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04934","last_updated":"2024-04-25T15:45:19Z","snapshot_observed_at":"2026-08-18T21:38:48.895755Z","submitted_at":"2023-11-07T18:17:05Z","title":"Prompt Cache: Modular Attention Reuse for Low-Latency Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04934","snapshot_observed_at":"2026-08-15T20:58:47.904448Z","title":"Prompt cache: Modular attention reuse for low-latency inference","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11271","last_updated":"2025-05-16T14:04:31Z","snapshot_observed_at":"2026-08-18T17:14:31.943828Z","submitted_at":"2025-05-16T14:04:31Z","title":"Semantic Caching of Contextual Summaries for Efficient Question-Answering with Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T20:58:47.904448Z"},"links":{"cited_paper":"/paper/2311.04934","citing_paper":"/paper/2505.11271"},"observation_digest":"sha256:057b4d170807ed2884d3d14b61c50756c50debd8470116439ba5f1fd9e873135","observation_id":"16ed6f4d-bfae-4ca9-baa0-85949ef8450c","resolution":{"observed_at":"2026-08-15T20:58:47.904448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04934","last_updated":"2024-04-25T15:45:19Z","snapshot_observed_at":"2026-08-18T21:38:48.895755Z","submitted_at":"2023-11-07T18:17:05Z","title":"Prompt Cache: Modular Attention Reuse for Low-Latency Inference","version":2},"cited_work":{"arxiv_id":"2311.04934","doi":"10.48550/arxiv.2311.04934","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.04934","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Prompt cache: Modular attention reuse for low-latency inference","venue":"arXiv (Cornell University)","work_id":"afbbfafd-6a60-4022-83bf-378314908161","year":2024},"citing_paper":{"arxiv_id":"2602.09725","last_updated":"2026-05-12T14:12:11Z","snapshot_observed_at":"2026-08-11T13:19:39.209270Z","submitted_at":"2026-02-10T12:29:02Z","title":"Efficient Remote KV Cache Reuse with GPU-native Video Codec","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-16T05:21:04.555356Z"},"links":{"cited_paper":"/paper/2311.04934","citing_paper":"/paper/2602.09725"},"observation_digest":"sha256:b85d653cf9a780cd64f1685cbc2cb19db3973ac0b0e909bbfc28f1ce4319a743","observation_id":"0963909e-d08c-4d8d-a699-ec5caa12d701","resolution":{"observed_at":"2026-05-16T05:22:22.751793Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04934","last_updated":"2024-04-25T15:45:19Z","snapshot_observed_at":"2026-08-18T21:38:48.895755Z","submitted_at":"2023-11-07T18:17:05Z","title":"Prompt Cache: Modular Attention Reuse for Low-Latency Inference","version":2},"cited_work":{"arxiv_id":"2311.04934","doi":"10.48550/arxiv.2311.04934","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.04934","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Prompt cache: Modular attention reuse for low-latency inference","venue":"arXiv (Cornell University)","work_id":"afbbfafd-6a60-4022-83bf-378314908161","year":2024},"citing_paper":{"arxiv_id":"2603.10726","last_updated":"2026-05-20T10:27:28Z","snapshot_observed_at":"2026-08-16T00:06:10.598472Z","submitted_at":"2026-03-11T12:59:12Z","title":"PrefixWall: Mitigating Prefix Caching Side Channels in Shared LLM Systems","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-21T12:14:09.509302Z"},"links":{"cited_paper":"/paper/2311.04934","citing_paper":"/paper/2603.10726"},"observation_digest":"sha256:40abca2bfb69d9b65d5449e5241d56d4e2e978cbb095b453b1490dccd4e3f6b9","observation_id":"92fa110f-13f9-48be-b398-b59bb357c2cb","resolution":{"observed_at":"2026-05-21T12:15:06.759644Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04934","last_updated":"2024-04-25T15:45:19Z","snapshot_observed_at":"2026-08-18T21:38:48.895755Z","submitted_at":"2023-11-07T18:17:05Z","title":"Prompt Cache: Modular Attention Reuse for Low-Latency Inference","version":2},"cited_work":{"arxiv_id":"2311.04934","doi":"10.48550/arxiv.2311.04934","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.04934","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Prompt cache: Modular attention reuse for low-latency inference","venue":"arXiv (Cornell University)","work_id":"afbbfafd-6a60-4022-83bf-378314908161","year":2024},"citing_paper":{"arxiv_id":"2604.16864","last_updated":"2026-08-17T11:03:28Z","snapshot_observed_at":"2026-08-20T11:13:59.423661Z","submitted_at":"2026-04-18T06:28:21Z","title":"HieraSparse: Hierarchical Semi-Structured Sparse KV Attention","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-10T07:15:19.184970Z"},"links":{"cited_paper":"/paper/2311.04934","citing_paper":"/paper/2604.16864"},"observation_digest":"sha256:274c3e575dc8061d983be92303a7bfe39b4c5dcb32bce45b12e912b430e06470","observation_id":"2a2e0a21-0aea-4f25-ba68-87e6aa32af2d","resolution":{"observed_at":"2026-05-10T07:16:54.115010Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04934","last_updated":"2024-04-25T15:45:19Z","snapshot_observed_at":"2026-08-18T21:38:48.895755Z","submitted_at":"2023-11-07T18:17:05Z","title":"Prompt Cache: Modular Attention Reuse for Low-Latency Inference","version":2},"cited_work":{"arxiv_id":"2311.04934","doi":"10.48550/arxiv.2311.04934","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.04934","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Prompt cache: Modular attention reuse for low-latency inference","venue":"arXiv (Cornell University)","work_id":"afbbfafd-6a60-4022-83bf-378314908161","year":2024},"citing_paper":{"arxiv_id":"2604.20021","last_updated":"2026-04-21T21:56:43Z","snapshot_observed_at":"2026-08-15T06:44:58.110677Z","submitted_at":"2026-04-21T21:56:43Z","title":"Continuous Semantic Caching for Low-Cost LLM Serving","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T02:32:28.923367Z"},"links":{"cited_paper":"/paper/2311.04934","citing_paper":"/paper/2604.20021"},"observation_digest":"sha256:86b6c30aeee23365b6970de0c627a17842878615276ec518d025c365ab3bba52","observation_id":"bd4add9d-645e-4228-a9c8-d058c812b0d9","resolution":{"observed_at":"2026-05-11T13:01:03.329620Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04934","last_updated":"2024-04-25T15:45:19Z","snapshot_observed_at":"2026-08-18T21:38:48.895755Z","submitted_at":"2023-11-07T18:17:05Z","title":"Prompt Cache: Modular Attention Reuse for Low-Latency Inference","version":2},"cited_work":{"arxiv_id":"2311.04934","doi":"10.48550/arxiv.2311.04934","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.04934","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Prompt cache: Modular attention reuse for low-latency inference","venue":"arXiv (Cornell University)","work_id":"afbbfafd-6a60-4022-83bf-378314908161","year":2024},"citing_paper":{"arxiv_id":"2605.11232","last_updated":"2026-05-11T20:47:41Z","snapshot_observed_at":"2026-08-15T04:45:50.146323Z","submitted_at":"2026-05-11T20:47:41Z","title":"Rethinking LLMOps for Fraud and AML: Building a Compliance-Grade LLM Serving Stack","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-13T02:11:18.259161Z"},"links":{"cited_paper":"/paper/2311.04934","citing_paper":"/paper/2605.11232"},"observation_digest":"sha256:e0502f671d7c058b01e246f8e8a69e65ea71063f37bb065a3007af51004349af","observation_id":"b3ac640f-1592-41ff-baf2-0a54928892e1","resolution":{"observed_at":"2026-05-13T02:12:07.117712Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04934","last_updated":"2024-04-25T15:45:19Z","snapshot_observed_at":"2026-08-18T21:38:48.895755Z","submitted_at":"2023-11-07T18:17:05Z","title":"Prompt Cache: Modular Attention Reuse for Low-Latency Inference","version":2},"cited_work":{"arxiv_id":"2311.04934","doi":"10.48550/arxiv.2311.04934","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.04934","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Prompt cache: Modular attention reuse for low-latency inference","venue":"arXiv (Cornell University)","work_id":"afbbfafd-6a60-4022-83bf-378314908161","year":2024},"citing_paper":{"arxiv_id":"2605.30613","last_updated":"2026-05-28T22:06:54Z","snapshot_observed_at":"2026-08-17T01:07:47.305172Z","submitted_at":"2026-05-28T22:06:54Z","title":"CacheProbe: Auditing Prompt Cache Isolation in Gateway APIs","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-29T06:22:28.511930Z"},"links":{"cited_paper":"/paper/2311.04934","citing_paper":"/paper/2605.30613"},"observation_digest":"sha256:70de437f4de028a9e03d93707d382a7e4368c95e874b08f3cc1199bae303c092","observation_id":"c60f87ed-cae7-406e-aecf-459bebd1366a","resolution":{"observed_at":"2026-06-29T06:23:08.727622Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04934","last_updated":"2024-04-25T15:45:19Z","snapshot_observed_at":"2026-08-18T21:38:48.895755Z","submitted_at":"2023-11-07T18:17:05Z","title":"Prompt Cache: Modular Attention Reuse for Low-Latency Inference","version":2},"cited_work":{"arxiv_id":"2311.04934","doi":"10.48550/arxiv.2311.04934","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.04934","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Prompt cache: Modular attention reuse for low-latency inference","venue":"arXiv (Cornell University)","work_id":"afbbfafd-6a60-4022-83bf-378314908161","year":2024},"citing_paper":{"arxiv_id":"2606.01502","last_updated":"2026-05-31T23:53:24Z","snapshot_observed_at":"2026-08-13T17:07:29.514916Z","submitted_at":"2026-05-31T23:53:24Z","title":"Move the Query, Not the Cache: Characterizing Cross-Instance Latent Attention Redistribution Across GPU Fabrics","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-28T16:02:53.294235Z"},"links":{"cited_paper":"/paper/2311.04934","citing_paper":"/paper/2606.01502"},"observation_digest":"sha256:a8c8f83e67139dd8d5d5f30e35cc736c687cafe0643966e9c1fc929f20aefe49","observation_id":"bfaf9d39-e4d1-4421-be0b-24ae52176da5","resolution":{"observed_at":"2026-07-01T21:56:15.724672Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04934","last_updated":"2024-04-25T15:45:19Z","snapshot_observed_at":"2026-08-18T21:38:48.895755Z","submitted_at":"2023-11-07T18:17:05Z","title":"Prompt Cache: Modular Attention Reuse for Low-Latency Inference","version":2},"cited_work":{"arxiv_id":"2311.04934","doi":"10.48550/arxiv.2311.04934","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.04934","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Prompt cache: Modular attention reuse for low-latency inference","venue":"arXiv (Cornell University)","work_id":"afbbfafd-6a60-4022-83bf-378314908161","year":2024},"citing_paper":{"arxiv_id":"2606.09441","last_updated":"2026-06-08T12:50:13Z","snapshot_observed_at":"2026-08-15T01:11:56.604097Z","submitted_at":"2026-06-08T12:50:13Z","title":"SIFT: Selective-Index For Fast Compute of RAG Prefill by Exploiting Attention Invariance","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-27T16:24:31.109508Z"},"links":{"cited_paper":"/paper/2311.04934","citing_paper":"/paper/2606.09441"},"observation_digest":"sha256:2f6d0fe55544a8361207169080cc9b12a46998abc2e8b60039db071efdc1d3b3","observation_id":"85dadf70-ad99-4a12-bbfd-c82eb014cff8","resolution":{"observed_at":"2026-07-03T01:37:31.262604Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04934","last_updated":"2024-04-25T15:45:19Z","snapshot_observed_at":"2026-08-18T21:38:48.895755Z","submitted_at":"2023-11-07T18:17:05Z","title":"Prompt Cache: Modular Attention Reuse for Low-Latency Inference","version":2},"cited_work":{"arxiv_id":"2311.04934","doi":"10.48550/arxiv.2311.04934","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.04934","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Prompt cache: Modular attention reuse for low-latency inference","venue":"arXiv (Cornell University)","work_id":"afbbfafd-6a60-4022-83bf-378314908161","year":2024},"citing_paper":{"arxiv_id":"2606.13126","last_updated":"2026-06-11T09:51:36Z","snapshot_observed_at":"2026-08-12T17:45:43.488699Z","submitted_at":"2026-06-11T09:51:36Z","title":"MiniPIC: Flexible Position-Independent Caching in <100LOC","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-27T07:12:45.449658Z"},"links":{"cited_paper":"/paper/2311.04934","citing_paper":"/paper/2606.13126"},"observation_digest":"sha256:c4bda033002b1d7565d2079b1ff59d0647b18dd7ae8e5d82ea4c0b8128a93d38","observation_id":"37c68cb6-0a91-4c8a-87bd-31d350c349f0","resolution":{"observed_at":"2026-06-27T07:20:42.194167Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04934","last_updated":"2024-04-25T15:45:19Z","snapshot_observed_at":"2026-08-18T21:38:48.895755Z","submitted_at":"2023-11-07T18:17:05Z","title":"Prompt Cache: Modular Attention Reuse for Low-Latency Inference","version":2},"cited_work":{"arxiv_id":"2311.04934","doi":"10.48550/arxiv.2311.04934","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.04934","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Prompt cache: Modular attention reuse for low-latency inference","venue":"arXiv (Cornell University)","work_id":"afbbfafd-6a60-4022-83bf-378314908161","year":2024},"citing_paper":{"arxiv_id":"2606.20537","last_updated":"2026-06-18T17:49:36Z","snapshot_observed_at":"2026-08-13T13:46:08.665911Z","submitted_at":"2026-06-18T17:49:36Z","title":"Execution-State Capsules: Graph-Bound Execution-State Checkpoint and Restore for Low-Latency, Small-Batch, On-Device Physical-AI Serving","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-26T17:39:47.477338Z"},"links":{"cited_paper":"/paper/2311.04934","citing_paper":"/paper/2606.20537"},"observation_digest":"sha256:51903dd20607fa22907484766831eff38efd0c637159dc64463367da55bcfdba","observation_id":"a4ce376b-a86c-4d18-8d68-2843cdf4baaa","resolution":{"observed_at":"2026-07-04T03:49:29.942545Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04934","last_updated":"2024-04-25T15:45:19Z","snapshot_observed_at":"2026-08-18T21:38:48.895755Z","submitted_at":"2023-11-07T18:17:05Z","title":"Prompt Cache: Modular Attention Reuse for Low-Latency Inference","version":2},"cited_work":{"arxiv_id":"2311.04934","doi":"10.48550/arxiv.2311.04934","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.04934","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Prompt cache: Modular attention reuse for low-latency inference","venue":"arXiv (Cornell University)","work_id":"afbbfafd-6a60-4022-83bf-378314908161","year":2024},"citing_paper":{"arxiv_id":"2606.21676","last_updated":"2026-06-19T18:32:44Z","snapshot_observed_at":"2026-08-12T17:46:36.292151Z","submitted_at":"2026-06-19T18:32:44Z","title":"CRAwLeR -- Cross-Reference Aware Legal Retrieval","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-26T12:37:33.877749Z"},"links":{"cited_paper":"/paper/2311.04934","citing_paper":"/paper/2606.21676"},"observation_digest":"sha256:58d574379e0e8d6068dea7d299fe4eaefdf71b6c0fe9b5c1222a42c3c571b7a6","observation_id":"26caed26-3309-46d9-89ef-878ff58d3e8a","resolution":{"observed_at":"2026-07-04T07:49:39.642868Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04934","last_updated":"2024-04-25T15:45:19Z","snapshot_observed_at":"2026-08-18T21:38:48.895755Z","submitted_at":"2023-11-07T18:17:05Z","title":"Prompt Cache: Modular Attention Reuse for Low-Latency Inference","version":2},"cited_work":{"arxiv_id":"2311.04934","doi":"10.48550/arxiv.2311.04934","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.04934","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Prompt cache: Modular attention reuse for low-latency inference","venue":"arXiv (Cornell University)","work_id":"afbbfafd-6a60-4022-83bf-378314908161","year":2024},"citing_paper":{"arxiv_id":"2606.26924","last_updated":"2026-06-25T12:02:18Z","snapshot_observed_at":"2026-08-17T03:46:07.556473Z","submitted_at":"2026-06-25T12:02:18Z","title":"A Deterministic Control Plane for LLM Coding Agents","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-06-26T03:58:28.523545Z"},"links":{"cited_paper":"/paper/2311.04934","citing_paper":"/paper/2606.26924"},"observation_digest":"sha256:37e525e30c909e57350ab099d38705dc258bcd18cfcb201403551db98e93873f","observation_id":"624a7fda-bf59-4d3b-ac12-10ace44a4d26","resolution":{"observed_at":"2026-06-26T03:58:57.012444Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04934","last_updated":"2024-04-25T15:45:19Z","snapshot_observed_at":"2026-08-18T21:38:48.895755Z","submitted_at":"2023-11-07T18:17:05Z","title":"Prompt Cache: Modular Attention Reuse for Low-Latency Inference","version":2},"cited_work":{"arxiv_id":"2311.04934","doi":"10.48550/arxiv.2311.04934","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.04934","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Prompt cache: Modular attention reuse for low-latency inference","venue":"arXiv (Cornell University)","work_id":"afbbfafd-6a60-4022-83bf-378314908161","year":2024},"citing_paper":{"arxiv_id":"2606.28565","last_updated":"2026-07-02T09:24:03Z","snapshot_observed_at":"2026-08-15T19:19:49.079754Z","submitted_at":"2026-06-26T19:43:38Z","title":"KernelSight-LM: A Kernel-Level LLM Inference Simulator","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-30T00:48:19.207465Z"},"links":{"cited_paper":"/paper/2311.04934","citing_paper":"/paper/2606.28565"},"observation_digest":"sha256:7b4ee59ac2bf2af5603e12e0c78312d562669e0872b2f3aa7bb454fec1d1d976","observation_id":"93d08a1b-9ecd-4804-b9fc-8f6a1bac1d30","resolution":{"observed_at":"2026-06-30T00:54:06.243600Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04934","last_updated":"2024-04-25T15:45:19Z","snapshot_observed_at":"2026-08-18T21:38:48.895755Z","submitted_at":"2023-11-07T18:17:05Z","title":"Prompt Cache: Modular Attention Reuse for Low-Latency Inference","version":2},"cited_work":{"arxiv_id":"2311.04934","doi":"10.48550/arxiv.2311.04934","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.04934","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Prompt cache: Modular attention reuse for low-latency inference","venue":"arXiv (Cornell University)","work_id":"afbbfafd-6a60-4022-83bf-378314908161","year":2024},"citing_paper":{"arxiv_id":"2606.28565","last_updated":"2026-07-02T09:24:03Z","snapshot_observed_at":"2026-08-15T19:19:49.079754Z","submitted_at":"2026-06-26T19:43:38Z","title":"KernelSight-LM: A Kernel-Level LLM Inference Simulator","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-03T23:09:38.092583Z"},"links":{"cited_paper":"/paper/2311.04934","citing_paper":"/paper/2606.28565"},"observation_digest":"sha256:e3c583889ee43c00c8879f5e467f025b0a08798a3182b56416c1f41d38479c56","observation_id":"32144030-bfe6-4ae6-9006-c298a7780836","resolution":{"observed_at":"2026-07-03T23:19:02.214792Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04934","last_updated":"2024-04-25T15:45:19Z","snapshot_observed_at":"2026-08-18T21:38:48.895755Z","submitted_at":"2023-11-07T18:17:05Z","title":"Prompt Cache: Modular Attention Reuse for Low-Latency Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04934","snapshot_observed_at":"2026-08-02T02:10:49.354541Z","title":"Gemma 4 model card","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14431","last_updated":"2026-07-15T23:55:48Z","snapshot_observed_at":"2026-08-13T04:24:45.805856Z","submitted_at":"2026-07-15T23:55:48Z","title":"Smarter and Cheaper at Once: Byte-Exact KV-Cache Grafting Turns a Frozen Small Model into a Verified-Knowledge Flywheel","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-02T02:10:49.354541Z"},"links":{"cited_paper":"/paper/2311.04934","citing_paper":"/paper/2607.14431"},"observation_digest":"sha256:63424dec249873b418fa33671ac3b5193a2bfece0c8226ec98c38e0a1348ba78","observation_id":"a13ebabe-ba70-4929-aba6-63c486ffc31a","resolution":{"observed_at":"2026-08-02T02:10:49.354541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04934","last_updated":"2024-04-25T15:45:19Z","snapshot_observed_at":"2026-08-18T21:38:48.895755Z","submitted_at":"2023-11-07T18:17:05Z","title":"Prompt Cache: Modular Attention Reuse for Low-Latency Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04934","snapshot_observed_at":"2026-08-01T08:35:41.852997Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21672","last_updated":"2026-07-23T09:19:16Z","snapshot_observed_at":"2026-08-14T07:04:32.409803Z","submitted_at":"2026-07-23T09:19:16Z","title":"Pixels for Programs? A Cross-Provider Case Study of Input-Token Accounting for Source Code as Text and Images","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T08:35:41.852997Z"},"links":{"cited_paper":"/paper/2311.04934","citing_paper":"/paper/2607.21672"},"observation_digest":"sha256:71ab50e3c4a5b14de83682eccb4430396dcd008e402d33ef3d3a7f994cf03582","observation_id":"de1d7fba-23a8-4471-8cb9-b49677e9a0b0","resolution":{"observed_at":"2026-08-01T08:35:41.852997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04934","last_updated":"2024-04-25T15:45:19Z","snapshot_observed_at":"2026-08-18T21:38:48.895755Z","submitted_at":"2023-11-07T18:17:05Z","title":"Prompt Cache: Modular Attention Reuse for Low-Latency Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04934","snapshot_observed_at":"2026-07-30T23:47:57.858093Z","title":"Prompt cache: Modular attention reuse for low-latency inference,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.26694","last_updated":"2026-08-17T13:29:53Z","snapshot_observed_at":"2026-08-20T11:15:02.844547Z","submitted_at":"2026-07-29T09:40:23Z","title":"Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-30T23:47:57.858093Z"},"links":{"cited_paper":"/paper/2311.04934","citing_paper":"/paper/2607.26694"},"observation_digest":"sha256:aadabc3c1f703a9bee48a368d411d00ef84a7d76095c3ac3d9a538d382723fdc","observation_id":"0be0343d-266a-43a5-9403-52a7359ec686","resolution":{"observed_at":"2026-07-30T23:47:57.858093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04934","last_updated":"2024-04-25T15:45:19Z","snapshot_observed_at":"2026-08-18T21:38:48.895755Z","submitted_at":"2023-11-07T18:17:05Z","title":"Prompt Cache: Modular Attention Reuse for Low-Latency Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04934","snapshot_observed_at":"2026-08-15T14:37:20.662090Z","title":"Available: https://arxiv.org/abs/2311.04934","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06557","last_updated":"2026-08-06T20:14:21Z","snapshot_observed_at":"2026-08-18T10:40:17.166341Z","submitted_at":"2026-08-06T20:14:21Z","title":"Cascade: Exploiting SLO-Aware latency budget for fair and high goodput LLM inference serving","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-15T14:37:20.662090Z"},"links":{"cited_paper":"/paper/2311.04934","citing_paper":"/paper/2608.06557"},"observation_digest":"sha256:363a8ec6d7d1453bea98fc8548af2440b43e30816fd38bbbe1311fd3f1e87ee3","observation_id":"5490f1a0-917e-4e28-9f39-e4d82775af4e","resolution":{"observed_at":"2026-08-15T14:37:20.662090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04934","last_updated":"2024-04-25T15:45:19Z","snapshot_observed_at":"2026-08-18T21:38:48.895755Z","submitted_at":"2023-11-07T18:17:05Z","title":"Prompt Cache: Modular Attention Reuse for Low-Latency Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04934","snapshot_observed_at":"2026-08-16T00:27:45.534694Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11879","last_updated":"2026-08-12T10:05:29Z","snapshot_observed_at":"2026-08-20T11:05:20.882918Z","submitted_at":"2026-08-12T10:05:29Z","title":"Total Recall at What Cost? Benchmarking the Serving Cost of Agentic Memory Systems","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T00:27:45.534694Z"},"links":{"cited_paper":"/paper/2311.04934","citing_paper":"/paper/2608.11879"},"observation_digest":"sha256:59be83d68f9db3c1c6f4cb35504e61e2efae14c8c8f0aad3c76ccd503b241c8d","observation_id":"406282b1-80b3-4997-bf03-855d288ec60d","resolution":{"observed_at":"2026-08-16T00:27:45.534694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2311.04934/citation-record","integrity":"/paper/2311.04934/integrity","json":"/paper/2311.04934/citation-record.json","paper":"/paper/2311.04934"},"outbound":[],"paper":{"arxiv_id":"2311.04934","last_updated":"2024-04-25T15:45:19Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-18T21:38:48.895755Z","submitted_at":"2023-11-07T18:17:05Z","title":"Prompt Cache: Modular Attention Reuse for Low-Latency Inference"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 24 inbound Pith citation observations for arXiv:2311.04934."}