{"as_of":"2026-08-13T10:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:df8a479ee77dda15d9847915dbe97252d867d9bd9cd3a17692f022e2abe38360","coverage":[{"denominator":78,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":78,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T01:47:43.240850Z","state":"measured"},{"denominator":79,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":79,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T18:49:54.243730Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.05875","last_updated":"2026-06-04T08:47:46Z","snapshot_observed_at":"2026-08-07T04:31:32.433154Z","submitted_at":"2026-06-04T08:47:46Z","title":"QCFuse: Query-Aware Cache Fusion via Compressed View for Efficient RAG Serving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.05875","snapshot_observed_at":"2026-07-31T18:49:54.243730Z","title":"Yang, A.; Li, A.; Yang, B.; Zhang, B.; Hui, B.; Zheng, B.; Yu, B.; Gao, C.; Huang, C.; Lv, C.; et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28069","last_updated":"2026-08-10T15:40:55Z","snapshot_observed_at":"2026-08-13T09:17:49.879094Z","submitted_at":"2026-07-30T11:45:24Z","title":"SemPIC: Learning Semantic Position-Independent KV Caches","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-31T18:49:54.243730Z"},"links":{"cited_paper":"/paper/2606.05875","citing_paper":"/paper/2607.28069"},"observation_digest":"sha256:2ac3e62681a4ce9e7d0ae13f70c4bd568eb794b0fb078a9026f1014234e19f7d","observation_id":"dbeb90f5-357e-430d-93d7-e5220cf1d2b6","resolution":{"observed_at":"2026-07-31T18:49:54.243730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2606.05875/citation-record","integrity":"/paper/2606.05875/integrity","json":"/paper/2606.05875/citation-record.json","paper":"/paper/2606.05875"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T01:47:43.240850Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.05875","last_updated":"2026-06-04T08:47:46Z","snapshot_observed_at":"2026-08-07T04:31:32.433154Z","submitted_at":"2026-06-04T08:47:46Z","title":"QCFuse: Query-Aware Cache Fusion via Compressed View for Efficient RAG Serving","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-28T01:47:43.240850Z"},"links":{"citing_paper":"/paper/2606.05875"},"observation_digest":"sha256:ec24b827dace84fe6a085470d9b3cf0bac59d8ca021c2a0674627168a42201cf","observation_id":"2fe0b14c-f305-42c9-a547-3644642eafc7","resolution":{"observed_at":"2026-06-28T01:47:43.240850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T01:47:43.240850Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.05875","last_updated":"2026-06-04T08:47:46Z","snapshot_observed_at":"2026-08-07T04:31:32.433154Z","submitted_at":"2026-06-04T08:47:46Z","title":"QCFuse: Query-Aware Cache Fusion via Compressed View for Efficient RAG Serving","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-28T01:47:43.240850Z"},"links":{"citing_paper":"/paper/2606.05875"},"observation_digest":"sha256:9dc010b447f756128bf750e02cbfbcee3f1f03da2f3459f68004c72d5ea17cd0","observation_id":"68b78cb0-7f28-446d-8dd8-91601824fb80","resolution":{"observed_at":"2026-06-28T01:47:43.240850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2023.emnlp-","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:27:45.234690Z","title":"In: Bouamor, H., Pino, J., Bali, K","venue":null,"work_id":"f41400a7-85b0-475c-b87a-d9a17c838b18","year":2023},"citing_paper":{"arxiv_id":"2606.05875","last_updated":"2026-06-04T08:47:46Z","snapshot_observed_at":"2026-08-07T04:31:32.433154Z","submitted_at":"2026-06-04T08:47:46Z","title":"QCFuse: Query-Aware Cache Fusion via Compressed View for Efficient RAG Serving","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-28T01:47:43.240850Z"},"links":{"citing_paper":"/paper/2606.05875"},"observation_digest":"sha256:e3b3a867a44cd485b5baec32cae9d94c09de71fada1fc93dca3b8489382ccdad","observation_id":"e4394d1d-801d-4d22-9c3b-67b2d17b2451","resolution":{"observed_at":"2026-06-28T01:51:28.980098Z","resolver_source":"doi_truncated","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.14508","last_updated":"2024-06-19T04:00:32Z","snapshot_observed_at":"2026-08-08T03:49:18.086396Z","submitted_at":"2023-08-28T11:53:40Z","title":"LongBench: A Bilingual, Multitask Benchmark for Long Context Understanding","version":2},"cited_work":{"arxiv_id":"2308.14508","doi":"10.48550/arxiv.2308.14508","metadata_source":"pith","pith_arxiv_id":"2308.14508","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LongBench: A Bilingual, Multitask Benchmark for Long Context Understanding","venue":"cs.CL","work_id":"ba7831c4-9427-4e0e-a5c1-4e98511f4b53","year":2023},"citing_paper":{"arxiv_id":"2606.05875","last_updated":"2026-06-04T08:47:46Z","snapshot_observed_at":"2026-08-07T04:31:32.433154Z","submitted_at":"2026-06-04T08:47:46Z","title":"QCFuse: Query-Aware Cache Fusion via Compressed View for Efficient RAG Serving","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-28T01:47:43.240850Z"},"links":{"cited_paper":"/paper/2308.14508","citing_paper":"/paper/2606.05875"},"observation_digest":"sha256:f22f6d79ffde1ff7c31500dbe7655107eee7bca48197d8b2af35989e3629c58e","observation_id":"1720899e-d874-45dc-9ce5-2ade3476eb6e","resolution":{"observed_at":"2026-07-02T12:46:57.483395Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T01:47:43.240850Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.05875","last_updated":"2026-06-04T08:47:46Z","snapshot_observed_at":"2026-08-07T04:31:32.433154Z","submitted_at":"2026-06-04T08:47:46Z","title":"QCFuse: Query-Aware Cache Fusion via Compressed View for Efficient RAG Serving","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-28T01:47:43.240850Z"},"links":{"citing_paper":"/paper/2606.05875"},"observation_digest":"sha256:d2d49b2a5c4e770105c7d239d930c0074af2d5cfd216adc9e4a3b5dbbfb31090","observation_id":"76935a56-3aa3-4a7d-963d-eadfd9a2e7c0","resolution":{"observed_at":"2026-06-28T01:47:43.240850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02069","last_updated":"2025-05-15T17:18:12Z","snapshot_observed_at":"2026-08-13T04:39:30.300015Z","submitted_at":"2024-06-04T07:51:30Z","title":"PyramidKV: Dynamic KV Cache Compression based on Pyramidal Information Funneling","version":4},"cited_work":{"arxiv_id":"2406.02069","doi":"10.48550/arxiv.2406.02069","metadata_source":"pith","pith_arxiv_id":"2406.02069","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PyramidKV: Dynamic KV Cache Compression based on Pyramidal Information Funneling","venue":"cs.CL","work_id":"6317700d-f903-4ce1-8f53-b43cb146d48b","year":2024},"citing_paper":{"arxiv_id":"2606.05875","last_updated":"2026-06-04T08:47:46Z","snapshot_observed_at":"2026-08-07T04:31:32.433154Z","submitted_at":"2026-06-04T08:47:46Z","title":"QCFuse: Query-Aware Cache Fusion via Compressed View for Efficient RAG Serving","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-28T01:47:43.240850Z"},"links":{"cited_paper":"/paper/2406.02069","citing_paper":"/paper/2606.05875"},"observation_digest":"sha256:dc4b9c3e57e1c71e6a154698b0dd65f2c7f093c4a9cca49d505127563c0db9d3","observation_id":"25317026-020d-4960-8907-d7d6826142fa","resolution":{"observed_at":"2026-07-02T12:46:57.486135Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-05-25T13:53:26.042348+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T13:53:26.042348+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"5800.368580","doi":"10.14778/3685800.3685805","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":"Proceedings of the VLDB Endowment","work_id":"6d610823-b2b7-4b8d-a496-4c3048aa1738","year":2024},"citing_paper":{"arxiv_id":"2606.05875","last_updated":"2026-06-04T08:47:46Z","snapshot_observed_at":"2026-08-07T04:31:32.433154Z","submitted_at":"2026-06-04T08:47:46Z","title":"QCFuse: Query-Aware Cache Fusion via Compressed View for Efficient RAG Serving","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-28T01:47:43.240850Z"},"links":{"citing_paper":"/paper/2606.05875"},"observation_digest":"sha256:7c297a52c4e7e22225ac795e37e0476abee05f36c8fa8e50a319d3cd7e94bb17","observation_id":"ee19234f-312c-48be-acfb-8523ecb7137c","resolution":{"observed_at":"2026-06-28T01:51:29.018992Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-05-24T05:23:13.10784+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T05:23:13.10784+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T01:47:43.240850Z","title":"Fu, Stefano Ermon, Atri Rudra, and Christopher Ré","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.05875","last_updated":"2026-06-04T08:47:46Z","snapshot_observed_at":"2026-08-07T04:31:32.433154Z","submitted_at":"2026-06-04T08:47:46Z","title":"QCFuse: Query-Aware Cache Fusion via Compressed View for Efficient RAG Serving","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-28T01:47:43.240850Z"},"links":{"citing_paper":"/paper/2606.05875"},"observation_digest":"sha256:fcee16e1465c2fcad9944b562d2acc782dba313dcac80ea29ca833070859f1ce","observation_id":"5bca079c-7575-444d-871d-6d23538bf9af","resolution":{"observed_at":"2026-06-28T01:47:43.240850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2212.372442","doi":"10.1145/3722212.3724425","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":null,"work_id":"9cbbecdf-0d27-49b3-82c8-d44b9bc76e06","year":2025},"citing_paper":{"arxiv_id":"2606.05875","last_updated":"2026-06-04T08:47:46Z","snapshot_observed_at":"2026-08-07T04:31:32.433154Z","submitted_at":"2026-06-04T08:47:46Z","title":"QCFuse: Query-Aware Cache Fusion via Compressed View for Efficient RAG Serving","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-28T01:47:43.240850Z"},"links":{"citing_paper":"/paper/2606.05875"},"observation_digest":"sha256:e543c1dc47fac6429e6468ce7bfd3ee847b673074b058c3c99a95b82cd265434","observation_id":"7eb98344-a669-4120-88f0-4a2e4a2929b8","resolution":{"observed_at":"2026-06-28T01:51:28.994583Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.00636","doi":"10.48550/arxiv.2510.00636","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Expected attention: KV cache compression by estimating attention from future queries distribution","venue":"arXiv (Cornell University)","work_id":"06043450-dbd9-4e7f-92b5-07811314b835","year":2025},"citing_paper":{"arxiv_id":"2606.05875","last_updated":"2026-06-04T08:47:46Z","snapshot_observed_at":"2026-08-07T04:31:32.433154Z","submitted_at":"2026-06-04T08:47:46Z","title":"QCFuse: Query-Aware Cache Fusion via Compressed View for Efficient RAG Serving","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-28T01:47:43.240850Z"},"links":{"citing_paper":"/paper/2606.05875"},"observation_digest":"sha256:9df6c99930aa76a2b406248ea4bc5e21901dbffe4749f8a880586d8f03f01b24","observation_id":"debcc308-24e1-435d-aa5b-b47d6c0311e3","resolution":{"observed_at":"2026-06-28T01:51:29.003682Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-05-25T13:53:29.197878+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T13:53:29.197878+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.emnlp-main.1027","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Devoto, Y","venue":null,"work_id":"db993716-a77e-491b-9261-3cc5ba38c565","year":2024},"citing_paper":{"arxiv_id":"2606.05875","last_updated":"2026-06-04T08:47:46Z","snapshot_observed_at":"2026-08-07T04:31:32.433154Z","submitted_at":"2026-06-04T08:47:46Z","title":"QCFuse: Query-Aware Cache Fusion via Compressed View for Efficient RAG Serving","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-28T01:47:43.240850Z"},"links":{"citing_paper":"/paper/2606.05875"},"observation_digest":"sha256:90c1d376e2da520420663a6d855e7ef66a29d95127729ebc7c34a9008d8b2f68","observation_id":"d2bbe92d-8768-44b4-a57e-81cf1da099bc","resolution":{"observed_at":"2026-06-28T01:51:29.011999Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-05-22T20:52:55.698703+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T20:52:55.698703+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T01:47:43.240850Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.05875","last_updated":"2026-06-04T08:47:46Z","snapshot_observed_at":"2026-08-07T04:31:32.433154Z","submitted_at":"2026-06-04T08:47:46Z","title":"QCFuse: Query-Aware Cache Fusion via Compressed View for Efficient RAG Serving","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-28T01:47:43.240850Z"},"links":{"citing_paper":"/paper/2606.05875"},"observation_digest":"sha256:78ebdd4b4094c16384b15e7132f4c4870935e1c070c42183f0b59712913c4c66","observation_id":"e7b8e50d-405b-47e0-a83a-60ce8c8e354a","resolution":{"observed_at":"2026-06-28T01:47:43.240850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-08-12T20:32:53.188699Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"cited_work":{"arxiv_id":"2407.11550","doi":"10.48550/arxiv.2407.11550","metadata_source":"pith","pith_arxiv_id":"2407.11550","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","venue":"cs.CL","work_id":"b41eb6db-193f-48ba-8278-6b1698524755","year":2024},"citing_paper":{"arxiv_id":"2606.05875","last_updated":"2026-06-04T08:47:46Z","snapshot_observed_at":"2026-08-07T04:31:32.433154Z","submitted_at":"2026-06-04T08:47:46Z","title":"QCFuse: Query-Aware Cache Fusion via Compressed View for Efficient RAG Serving","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-28T01:47:43.240850Z"},"links":{"cited_paper":"/paper/2407.11550","citing_paper":"/paper/2606.05875"},"observation_digest":"sha256:54aaa3a816e62f86fd6e5ce595b492f2796679be6ca1ac544a9b3bf125897da5","observation_id":"f696f251-de49-4933-aeb5-6970a3fa6c40","resolution":{"observed_at":"2026-07-02T12:46:57.470290Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-05-25T13:53:26.442662+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T13:53:26.442662+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T01:47:43.240850Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.05875","last_updated":"2026-06-04T08:47:46Z","snapshot_observed_at":"2026-08-07T04:31:32.433154Z","submitted_at":"2026-06-04T08:47:46Z","title":"QCFuse: Query-Aware Cache Fusion via Compressed View for Efficient RAG Serving","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-28T01:47:43.240850Z"},"links":{"citing_paper":"/paper/2606.05875"},"observation_digest":"sha256:eccd5a86810c2b4183c879dd0a36c0c6e4adfec3bae7fe66b8eb01a9747cc344","observation_id":"1185775c-23dd-413f-a307-6e559222a901","resolution":{"observed_at":"2026-06-28T01:47:43.240850Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10997","last_updated":"2024-03-27T09:16:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-18T07:47:33Z","title":"Retrieval-Augmented Generation for Large Language Models: A Survey","version":5},"cited_work":{"arxiv_id":"2312.10997","doi":"10.1186/1476-072x-8-72","metadata_source":"pith","pith_arxiv_id":"2312.10997","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Retrieval-Augmented Generation for Large Language Models: A Survey","venue":"cs.CL","work_id":"b80d2790-6cd9-4c87-b3c4-de404f99a80e","year":2023},"citing_paper":{"arxiv_id":"2606.05875","last_updated":"2026-06-04T08:47:46Z","snapshot_observed_at":"2026-08-07T04:31:32.433154Z","submitted_at":"2026-06-04T08:47:46Z","title":"QCFuse: Query-Aware Cache Fusion via Compressed View for Efficient RAG Serving","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-28T01:47:43.240850Z"},"links":{"cited_paper":"/paper/2312.10997","citing_paper":"/paper/2606.05875"},"observation_digest":"sha256:d414ac72a0af1c5c3c5f126ef216248a20668aa687d14b266b1bb25449e8424c","observation_id":"3564b163-9f38-4a4d-869e-4ae5e7c88dbd","resolution":{"observed_at":"2026-07-02T12:46:57.468007Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T01:47:43.240850Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.05875","last_updated":"2026-06-04T08:47:46Z","snapshot_observed_at":"2026-08-07T04:31:32.433154Z","submitted_at":"2026-06-04T08:47:46Z","title":"QCFuse: Query-Aware Cache Fusion via Compressed View for Efficient RAG Serving","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-28T01:47:43.240850Z"},"links":{"citing_paper":"/paper/2606.05875"},"observation_digest":"sha256:f28e5f94aa0e3ecf0c57250a827d376c3d7b1614275aa89e5b5684c1c446f55e","observation_id":"3db06e88-1306-41fd-9a64-99ece88b66e3","resolution":{"observed_at":"2026-06-28T01:47:43.240850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01801","last_updated":"2024-10-29T18:26:09Z","snapshot_observed_at":"2026-08-12T07:32:52.500307Z","submitted_at":"2023-10-03T05:17:08Z","title":"Model Tells You What to Discard: Adaptive KV Cache Compression for LLMs","version":4},"cited_work":{"arxiv_id":"2310.01801","doi":"10.48550/arxiv.2310.01801","metadata_source":"pith","pith_arxiv_id":"2310.01801","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Model Tells You What to Discard: Adaptive KV Cache Compression for LLMs","venue":"cs.CL","work_id":"91379982-466d-4895-96f5-079b66259a73","year":2023},"citing_paper":{"arxiv_id":"2606.05875","last_updated":"2026-06-04T08:47:46Z","snapshot_observed_at":"2026-08-07T04:31:32.433154Z","submitted_at":"2026-06-04T08:47:46Z","title":"QCFuse: Query-Aware Cache Fusion via Compressed View for Efficient RAG Serving","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-28T01:47:43.240850Z"},"links":{"cited_paper":"/paper/2310.01801","citing_paper":"/paper/2606.05875"},"observation_digest":"sha256:386576202c92cdf50325e2b460204d5ef4589e0984a5a4a4eaf5b6a1fe187ecd","observation_id":"4fa14159-69fa-460b-83f1-4463210cafd0","resolution":{"observed_at":"2026-07-02T12:46:57.457488Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T01:47:43.240850Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.05875","last_updated":"2026-06-04T08:47:46Z","snapshot_observed_at":"2026-08-07T04:31:32.433154Z","submitted_at":"2026-06-04T08:47:46Z","title":"QCFuse: Query-Aware Cache Fusion via Compressed View for Efficient RAG Serving","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-28T01:47:43.240850Z"},"links":{"citing_paper":"/paper/2606.05875"},"observation_digest":"sha256:a32f769f5dba26587cd619758fec8f23fc5027edae9364bf23981cf0a1f4585a","observation_id":"3a471377-b23e-4cca-8855-aca9463884cb","resolution":{"observed_at":"2026-06-28T01:47:43.240850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":"2407.21783","doi":"10.1016/s0749-0720(15","metadata_source":"pith","pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"The Llama 3 Herd of Models","venue":"cs.AI","work_id":"1549a635-88af-4ac1-acfe-51ae7bb53345","year":2024},"citing_paper":{"arxiv_id":"2606.05875","last_updated":"2026-06-04T08:47:46Z","snapshot_observed_at":"2026-08-07T04:31:32.433154Z","submitted_at":"2026-06-04T08:47:46Z","title":"QCFuse: Query-Aware Cache Fusion via Compressed View for Efficient RAG Serving","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-28T01:47:43.240850Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2606.05875"},"observation_digest":"sha256:d31b735311fc53420097b3224e3d635ce0f4e65eb2f1975c418604009d4b8eb9","observation_id":"2af0c8a3-e75f-499d-8754-a43aaffae835","resolution":{"observed_at":"2026-07-02T12:46:57.460080Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T01:47:43.240850Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.05875","last_updated":"2026-06-04T08:47:46Z","snapshot_observed_at":"2026-08-07T04:31:32.433154Z","submitted_at":"2026-06-04T08:47:46Z","title":"QCFuse: Query-Aware Cache Fusion via Compressed View for Efficient RAG Serving","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-28T01:47:43.240850Z"},"links":{"citing_paper":"/paper/2606.05875"},"observation_digest":"sha256:e44b51c1a5b90664f1af14afb71d4845eab55c2e390747be94ee83dcf31a339b","observation_id":"a0f31f6e-c739-4546-92ca-1684912fd470","resolution":{"observed_at":"2026-06-28T01:47:43.240850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T01:47:43.240850Z","title":"InInternational confer- ence on machine learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.05875","last_updated":"2026-06-04T08:47:46Z","snapshot_observed_at":"2026-08-07T04:31:32.433154Z","submitted_at":"2026-06-04T08:47:46Z","title":"QCFuse: Query-Aware Cache Fusion via Compressed View for Efficient RAG Serving","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-28T01:47:43.240850Z"},"links":{"citing_paper":"/paper/2606.05875"},"observation_digest":"sha256:59af4addf0520f01600fba0589ca5314213e0dab1c89e617c4fb8afa9fdfaa82","observation_id":"175e315f-7a3d-49f2-b1cf-24b9aa5da260","resolution":{"observed_at":"2026-06-28T01:47:43.240850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.01060","last_updated":"2020-11-12T07:47:48Z","snapshot_observed_at":"2026-07-06T10:10:56.466018Z","submitted_at":"2020-11-02T15:42:40Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","version":2},"cited_work":{"arxiv_id":"2011.01060","doi":null,"metadata_source":"pith","pith_arxiv_id":"2011.01060","snapshot_observed_at":"2026-07-11T03:17:50.841893Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","venue":"cs.CL","work_id":"73ded6d0-6905-404f-b7d5-b66e36e1b4f8","year":2020},"citing_paper":{"arxiv_id":"2606.05875","last_updated":"2026-06-04T08:47:46Z","snapshot_observed_at":"2026-08-07T04:31:32.433154Z","submitted_at":"2026-06-04T08:47:46Z","title":"QCFuse: Query-Aware Cache Fusion via Compressed View for Efficient RAG Serving","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-28T01:47:43.240850Z"},"links":{"cited_paper":"/paper/2011.01060","citing_paper":"/paper/2606.05875"},"observation_digest":"sha256:da6b64cf3fedb300b07e5241309eff0bdfbee3bb8aa5b57f848275bb62cdbdd5","observation_id":"155c6d3f-b9e7-43e3-a831-2cd7182b4323","resolution":{"observed_at":"2026-07-02T12:46:57.465624Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-08-10T09:20:57.804343Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":"2404.06654","doi":"10.48550/arxiv.2404.06654","metadata_source":"pith","pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","venue":"cs.CL","work_id":"c0bc4689-3ce8-4e3d-9442-bd74869445bb","year":2024},"citing_paper":{"arxiv_id":"2606.05875","last_updated":"2026-06-04T08:47:46Z","snapshot_observed_at":"2026-08-07T04:31:32.433154Z","submitted_at":"2026-06-04T08:47:46Z","title":"QCFuse: Query-Aware Cache Fusion via Compressed View for Efficient RAG Serving","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-28T01:47:43.240850Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2606.05875"},"observation_digest":"sha256:63cfee92deb04d663945a6113458d9018b6c41141bbe825b0671e72bf25fcd3f","observation_id":"1f15485a-a1d5-46a3-ad86-5d2e56405de6","resolution":{"observed_at":"2026-07-02T12:46:57.451712Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15332","last_updated":"2025-05-27T09:24:50Z","snapshot_observed_at":"2026-08-12T22:19:16.430762Z","submitted_at":"2024-10-20T08:42:29Z","title":"EPIC: Efficient Position-Independent Caching for Serving Large Language Models","version":3},"cited_work":{"arxiv_id":"2410.15332","doi":"10.48550/arxiv.2410.15332","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.15332","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Epic: Efficient position-independent context caching for serving large language models","venue":"arXiv (Cornell University)","work_id":"ddb50312-3d0b-4bf6-82fa-cbe4972a4870","year":2025},"citing_paper":{"arxiv_id":"2606.05875","last_updated":"2026-06-04T08:47:46Z","snapshot_observed_at":"2026-08-07T04:31:32.433154Z","submitted_at":"2026-06-04T08:47:46Z","title":"QCFuse: Query-Aware Cache Fusion via Compressed View for Efficient RAG Serving","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-28T01:47:43.240850Z"},"links":{"cited_paper":"/paper/2410.15332","citing_paper":"/paper/2606.05875"},"observation_digest":"sha256:2266d2cd601edf1eba1142bb66330ae522c1a74f29d61808466be115b694f506","observation_id":"cdd55039-99b2-4a1d-92b0-6f07db62d2a0","resolution":{"observed_at":"2026-07-02T12:46:57.448784Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/n19-1357","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A ttention is not E xplanation","venue":null,"work_id":"80233ae8-2e9c-4369-9eaf-eb4fcfd7bebb","year":2019},"citing_paper":{"arxiv_id":"2606.05875","last_updated":"2026-06-04T08:47:46Z","snapshot_observed_at":"2026-08-07T04:31:32.433154Z","submitted_at":"2026-06-04T08:47:46Z","title":"QCFuse: Query-Aware Cache Fusion via Compressed View for Efficient RAG Serving","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-28T01:47:43.240850Z"},"links":{"citing_paper":"/paper/2606.05875"},"observation_digest":"sha256:dbff2e7e0870cc3ef683726413f48b7c2fb53310d9b172ba65cac2f2ee5f2c1f","observation_id":"add5d048-cb4b-4883-9a3c-fe9020847aad","resolution":{"observed_at":"2026-06-28T01:51:29.007110Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-05-22T07:23:16.029039+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T07:23:16.029039+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T01:47:43.240850Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.05875","last_updated":"2026-06-04T08:47:46Z","snapshot_observed_at":"2026-08-07T04:31:32.433154Z","submitted_at":"2026-06-04T08:47:46Z","title":"QCFuse: Query-Aware Cache Fusion via Compressed View for Efficient RAG Serving","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-28T01:47:43.240850Z"},"links":{"citing_paper":"/paper/2606.05875"},"observation_digest":"sha256:407f3d733f3ad9483b55f72464d6a82fcb769893931356bab21828305468ec7a","observation_id":"48dfb789-ada3-49f7-b770-0539f1b15b35","resolution":{"observed_at":"2026-06-28T01:47:43.240850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":"2310.06825","doi":"10.48550/arxiv.2310.06825","metadata_source":"pith","pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mistral 7B","venue":"cs.CL","work_id":"eb5e1305-ad11-4875-ad8d-ad8b8f697599","year":2023},"citing_paper":{"arxiv_id":"2606.05875","last_updated":"2026-06-04T08:47:46Z","snapshot_observed_at":"2026-08-07T04:31:32.433154Z","submitted_at":"2026-06-04T08:47:46Z","title":"QCFuse: Query-Aware Cache Fusion via Compressed View for Efficient RAG Serving","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-28T01:47:43.240850Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2606.05875"},"observation_digest":"sha256:f1d90580e336373815ff8d3a76c9332ee1643d405053fdf5699f88cfff72e6c5","observation_id":"b9f7a595-6822-4dc7-8053-ec78baab29f8","resolution":{"observed_at":"2026-07-02T12:46:57.475659Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-10T22:08:12.954417+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-10T22:08:12.954417+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T01:47:43.240850Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.05875","last_updated":"2026-06-04T08:47:46Z","snapshot_observed_at":"2026-08-07T04:31:32.433154Z","submitted_at":"2026-06-04T08:47:46Z","title":"QCFuse: Query-Aware Cache Fusion via Compressed View for Efficient RAG Serving","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-28T01:47:43.240850Z"},"links":{"citing_paper":"/paper/2606.05875"},"observation_digest":"sha256:fb97d067f1f9faaf3cc4b7200ff3a12be61c3067de7830abd96b8eb8c9fe0d35","observation_id":"657c7a20-51cb-4021-8da6-ec38247130b7","resolution":{"observed_at":"2026-06-28T01:47:43.240850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T01:47:43.240850Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.05875","last_updated":"2026-06-04T08:47:46Z","snapshot_observed_at":"2026-08-07T04:31:32.433154Z","submitted_at":"2026-06-04T08:47:46Z","title":"QCFuse: Query-Aware Cache Fusion via Compressed View for Efficient RAG Serving","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-28T01:47:43.240850Z"},"links":{"citing_paper":"/paper/2606.05875"},"observation_digest":"sha256:732bca5e95a329797476d36a53659f1b794886edcb4d1058257e154350b7245b","observation_id":"51421455-f000-4021-b45c-428e7f0d91df","resolution":{"observed_at":"2026-06-28T01:47:43.240850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05736","last_updated":"2023-12-06T17:02:25Z","snapshot_observed_at":"2026-08-13T05:53:52.455716Z","submitted_at":"2023-10-09T14:10:21Z","title":"LLMLingua: Compressing Prompts for Accelerated Inference of Large Language Models","version":2},"cited_work":{"arxiv_id":"2310.05736","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.05736","snapshot_observed_at":"2026-07-10T01:36:44.322096Z","title":"Llmlingua: Compressing prompts for accelerated inference of large language models","venue":"cs.CL","work_id":"3e2bb4aa-fc83-449c-80b8-000b02d811a4","year":2023},"citing_paper":{"arxiv_id":"2606.05875","last_updated":"2026-06-04T08:47:46Z","snapshot_observed_at":"2026-08-07T04:31:32.433154Z","submitted_at":"2026-06-04T08:47:46Z","title":"QCFuse: Query-Aware Cache Fusion via Compressed View for Efficient RAG Serving","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-28T01:47:43.240850Z"},"links":{"cited_paper":"/paper/2310.05736","citing_paper":"/paper/2606.05875"},"observation_digest":"sha256:3fec10934e36d040a51d340991101b4969e3162019be1b233e5db2e30a39b87e","observation_id":"ddddc700-5c17-4948-8aa4-b4d4e80ec9e8","resolution":{"observed_at":"2026-07-02T12:46:57.478212Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T01:47:43.240850Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.05875","last_updated":"2026-06-04T08:47:46Z","snapshot_observed_at":"2026-08-07T04:31:32.433154Z","submitted_at":"2026-06-04T08:47:46Z","title":"QCFuse: Query-Aware Cache Fusion via Compressed View for Efficient RAG Serving","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-28T01:47:43.240850Z"},"links":{"citing_paper":"/paper/2606.05875"},"observation_digest":"sha256:3c5d96d417eedc0221744f7f1d96bd6e5b0e3709ca6d1768fabff12127da50f4","observation_id":"e1c234eb-a3f2-4733-ad7f-6106a44725ff","resolution":{"observed_at":"2026-06-28T01:47:43.240850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.acl-long.91","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"L ong LLML ingua: Accelerating and Enhancing LLM s in Long Context Scenarios via Prompt Compression","venue":null,"work_id":"2a5dbcdc-612d-42d1-8a80-8c7a47746477","year":2024},"citing_paper":{"arxiv_id":"2606.05875","last_updated":"2026-06-04T08:47:46Z","snapshot_observed_at":"2026-08-07T04:31:32.433154Z","submitted_at":"2026-06-04T08:47:46Z","title":"QCFuse: Query-Aware Cache Fusion via Compressed View for Efficient RAG Serving","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-28T01:47:43.240850Z"},"links":{"citing_paper":"/paper/2606.05875"},"observation_digest":"sha256:7e910c8a951222cae68300ae1280f51edba5d484c74336d5967b1f3470c6d330","observation_id":"836e1a77-5be7-45a9-b071-ce9b3fb16e78","resolution":{"observed_at":"2026-06-28T01:51:29.006017Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-05-25T20:53:42.696017+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T20:53:42.696017+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T01:47:43.240850Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.05875","last_updated":"2026-06-04T08:47:46Z","snapshot_observed_at":"2026-08-07T04:31:32.433154Z","submitted_at":"2026-06-04T08:47:46Z","title":"QCFuse: Query-Aware Cache Fusion via Compressed View for Efficient RAG Serving","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-28T01:47:43.240850Z"},"links":{"citing_paper":"/paper/2606.05875"},"observation_digest":"sha256:750f9cf1bdff6493cd8f2e66b4e83a38f93dfc21f0923fa365490d1f210aa269","observation_id":"6d93f56f-5934-49ee-9c06-dd003fa0074d","resolution":{"observed_at":"2026-06-28T01:47:43.240850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2020.emnlp-main.550","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T20:05:33.949387Z","title":"Dense Passage Retrieval for Open-Domain Question Answering","venue":"Proceedings of the 2020 Conference on Empirical Methods in Natural Language Processing (EMNLP)","work_id":"083391f8-812d-430f-8d08-89a03031ce6c","year":2020},"citing_paper":{"arxiv_id":"2606.05875","last_updated":"2026-06-04T08:47:46Z","snapshot_observed_at":"2026-08-07T04:31:32.433154Z","submitted_at":"2026-06-04T08:47:46Z","title":"QCFuse: Query-Aware Cache Fusion via Compressed View for Efficient RAG Serving","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-28T01:47:43.240850Z"},"links":{"citing_paper":"/paper/2606.05875"},"observation_digest":"sha256:fa5cfa5f146c8117649ba4f2f39e45dccea6dcfacadb15866a19db7240cb5686","observation_id":"57a83d1d-ff96-4898-98fd-0477f8d1d7d8","resolution":{"observed_at":"2026-06-28T01:51:29.009202Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-01T13:38:13.70004+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T13:38:13.70004+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.23416","doi":"10.48550/arxiv.2505.23416","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kvzip: Query-agnostic kv cache compression with context reconstruction","venue":"arXiv (Cornell University)","work_id":"5f731372-7406-4bf9-9ea7-10b18aad3813","year":2026},"citing_paper":{"arxiv_id":"2606.05875","last_updated":"2026-06-04T08:47:46Z","snapshot_observed_at":"2026-08-07T04:31:32.433154Z","submitted_at":"2026-06-04T08:47:46Z","title":"QCFuse: Query-Aware Cache Fusion via Compressed View for Efficient RAG Serving","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-28T01:47:43.240850Z"},"links":{"citing_paper":"/paper/2606.05875"},"observation_digest":"sha256:037ccaacf21230171fcb8aa49e8a7f5e52a0b998c0469a587a17aebbba28492c","observation_id":"5afe5e40-6e07-4300-8f1b-7c5c5d32d2aa","resolution":{"observed_at":"2026-07-02T12:46:57.462548Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1162/tacl_a_00276","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T12:46:14.494802Z","title":"Dai, Jakob Uszkoreit, Quoc Le, and Slav Petrov","venue":"Transactions of the Association for Computational Linguistics","work_id":"45551929-96dc-40f3-9f89-10e76731cc24","year":2019},"citing_paper":{"arxiv_id":"2606.05875","last_updated":"2026-06-04T08:47:46Z","snapshot_observed_at":"2026-08-07T04:31:32.433154Z","submitted_at":"2026-06-04T08:47:46Z","title":"QCFuse: Query-Aware Cache Fusion via Compressed View for Efficient RAG Serving","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-28T01:47:43.240850Z"},"links":{"citing_paper":"/paper/2606.05875"},"observation_digest":"sha256:d39ee979b58b18819c77aa87bf33812af95f9a47797e57d89f5e7097dc3e216f","observation_id":"e50bbbf1-0c7c-4fd5-a36c-965d698d473c","resolution":{"observed_at":"2026-06-28T01:51:28.998795Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-07-10T22:21:01.890529+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T22:21:01.890529+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"0006.361316","doi":"10.1145/3600006.3613163","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention , booktitle =","venue":null,"work_id":"1b10f2a9-a178-4d23-97fb-8db2354c7e6c","year":2023},"citing_paper":{"arxiv_id":"2606.05875","last_updated":"2026-06-04T08:47:46Z","snapshot_observed_at":"2026-08-07T04:31:32.433154Z","submitted_at":"2026-06-04T08:47:46Z","title":"QCFuse: Query-Aware Cache Fusion via Compressed View for Efficient RAG Serving","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-28T01:47:43.240850Z"},"links":{"citing_paper":"/paper/2606.05875"},"observation_digest":"sha256:b442328ec0646ca9ba2d6d7003c71326789fa4de5e63c771dfb7b90b72bc3274","observation_id":"04b56584-fd21-48bc-8e85-e0767c29f2e8","resolution":{"observed_at":"2026-06-28T01:51:28.998883Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T01:47:43.240850Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.05875","last_updated":"2026-06-04T08:47:46Z","snapshot_observed_at":"2026-08-07T04:31:32.433154Z","submitted_at":"2026-06-04T08:47:46Z","title":"QCFuse: Query-Aware Cache Fusion via Compressed View for Efficient RAG Serving","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-28T01:47:43.240850Z"},"links":{"citing_paper":"/paper/2606.05875"},"observation_digest":"sha256:dbe994fe27aa4995f9b666fea2c143e7219e4a0c9c699fb4ae3e50aa19822c2d","observation_id":"e938e4f8-652c-4263-8ff3-6b4062d03ff2","resolution":{"observed_at":"2026-06-28T01:47:43.240850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.14778/3685800","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T01:51:28.995115Z","title":null,"venue":null,"work_id":"3f81d9ae-69d5-45f6-bf64-60175500c10c","year":2024},"citing_paper":{"arxiv_id":"2606.05875","last_updated":"2026-06-04T08:47:46Z","snapshot_observed_at":"2026-08-07T04:31:32.433154Z","submitted_at":"2026-06-04T08:47:46Z","title":"QCFuse: Query-Aware Cache Fusion via Compressed View for Efficient RAG Serving","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-28T01:47:43.240850Z"},"links":{"citing_paper":"/paper/2606.05875"},"observation_digest":"sha256:c68d45bddc9cb69da2172ec29fe3511abc50b532ff1f847c4b94a2827ba8b843","observation_id":"c8a2668d-baec-4af2-a70a-c401cf2c4df6","resolution":{"observed_at":"2026-06-28T01:51:28.996248Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1145/3749168","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":"Proceedings of the ACM on Management of Data","work_id":"ad0f01f2-befd-44d5-a54b-4824bb2f9ab4","year":2025},"citing_paper":{"arxiv_id":"2606.05875","last_updated":"2026-06-04T08:47:46Z","snapshot_observed_at":"2026-08-07T04:31:32.433154Z","submitted_at":"2026-06-04T08:47:46Z","title":"QCFuse: Query-Aware Cache Fusion via Compressed View for Efficient RAG Serving","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-28T01:47:43.240850Z"},"links":{"citing_paper":"/paper/2606.05875"},"observation_digest":"sha256:55cc4bcba9ec4807cb5b0f7ece96a1af87e83c6d3c7c23f241b72cbbf4ad372a","observation_id":"47840e79-f81e-4474-8802-889a901e1472","resolution":{"observed_at":"2026-06-28T01:51:28.978396Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-07-14T04:20:26.115197+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T04:20:26.115197+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T01:47:43.240850Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.05875","last_updated":"2026-06-04T08:47:46Z","snapshot_observed_at":"2026-08-07T04:31:32.433154Z","submitted_at":"2026-06-04T08:47:46Z","title":"QCFuse: Query-Aware Cache Fusion via Compressed View for Efficient RAG Serving","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-28T01:47:43.240850Z"},"links":{"citing_paper":"/paper/2606.05875"},"observation_digest":"sha256:5c376ee398fbdc465bbbe7d5eb7ebdadbe06617f66f566739025179d17c97cca","observation_id":"a5aeb69b-7b15-4aa8-b691-3f70e3abee13","resolution":{"observed_at":"2026-06-28T01:47:43.240850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04532","last_updated":"2025-05-01T02:14:05Z","snapshot_observed_at":"2026-08-13T00:12:52.272658Z","submitted_at":"2024-05-07T17:59:30Z","title":"QServe: W4A8KV4 Quantization and System Co-design for Efficient LLM Serving","version":3},"cited_work":{"arxiv_id":"2405.04532","doi":"10.48550/arxiv.2405.04532","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.04532","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qserve: W4A8KV4 quantization and system co-design for efficient LLM serving.CoRR, abs/2405.04532","venue":"arXiv (Cornell University)","work_id":"c210d46c-8391-4e16-ac58-5568cd278fc1","year":2024},"citing_paper":{"arxiv_id":"2606.05875","last_updated":"2026-06-04T08:47:46Z","snapshot_observed_at":"2026-08-07T04:31:32.433154Z","submitted_at":"2026-06-04T08:47:46Z","title":"QCFuse: Query-Aware Cache Fusion via Compressed View for Efficient RAG Serving","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-28T01:47:43.240850Z"},"links":{"cited_paper":"/paper/2405.04532","citing_paper":"/paper/2606.05875"},"observation_digest":"sha256:ab76b972d5b8eec5769936fb1b313a248dc3187a14c979ecceb4074a13eb15d6","observation_id":"d049da26-ba1f-40bd-aba5-67e5761f8748","resolution":{"observed_at":"2026-07-02T12:46:57.466163Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-07-14T18:49:58.779354+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T18:49:58.779354+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T01:47:43.240850Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.05875","last_updated":"2026-06-04T08:47:46Z","snapshot_observed_at":"2026-08-07T04:31:32.433154Z","submitted_at":"2026-06-04T08:47:46Z","title":"QCFuse: Query-Aware Cache Fusion via Compressed View for Efficient RAG Serving","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-28T01:47:43.240850Z"},"links":{"citing_paper":"/paper/2606.05875"},"observation_digest":"sha256:8e5c116c0813cd22c618ce5e9b10906420d2a51cb3ecddecb070b3e92b29f3df","observation_id":"86e5e84d-e19b-4cd1-a396-38e72ae94a93","resolution":{"observed_at":"2026-06-28T01:47:43.240850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.09665","doi":"10.48550/arxiv.2510.09665","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Lmcache: An efficient kv cache layer for enterprise-scale llm inference","venue":"arXiv (Cornell University)","work_id":"089b937e-f3f9-4525-a792-524ef0f7db1d","year":2025},"citing_paper":{"arxiv_id":"2606.05875","last_updated":"2026-06-04T08:47:46Z","snapshot_observed_at":"2026-08-07T04:31:32.433154Z","submitted_at":"2026-06-04T08:47:46Z","title":"QCFuse: Query-Aware Cache Fusion via Compressed View for Efficient RAG Serving","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-28T01:47:43.240850Z"},"links":{"citing_paper":"/paper/2606.05875"},"observation_digest":"sha256:2bbf2c8ef9f0fa534cfa9c0822f65534abf656be66a27fa7bb646d1b386b63c9","observation_id":"47aeff68-b185-4172-a6ce-8d145f978224","resolution":{"observed_at":"2026-07-02T12:46:57.469130Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07240","last_updated":"2024-07-19T21:04:14Z","snapshot_observed_at":"2026-08-13T05:52:26.338685Z","submitted_at":"2023-10-11T07:08:20Z","title":"CacheGen: KV Cache Compression and Streaming for Fast Large Language Model Serving","version":6},"cited_work":{"arxiv_id":"2310.07240","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.07240","snapshot_observed_at":"2026-07-10T01:36:44.087990Z","title":"CacheGen: KV Cache Compression and Streaming for Fast Large Language Model Serving","venue":"cs.NI","work_id":"49940440-d8c7-48da-9838-5e97439af9cb","year":2023},"citing_paper":{"arxiv_id":"2606.05875","last_updated":"2026-06-04T08:47:46Z","snapshot_observed_at":"2026-08-07T04:31:32.433154Z","submitted_at":"2026-06-04T08:47:46Z","title":"QCFuse: Query-Aware Cache Fusion via Compressed View for Efficient RAG Serving","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-28T01:47:43.240850Z"},"links":{"cited_paper":"/paper/2310.07240","citing_paper":"/paper/2606.05875"},"observation_digest":"sha256:8864cefa01ac8aa483dee561857a222a3f0c2efbe9c12e4ec7035960fa051d88","observation_id":"2694c557-0caa-45ea-8992-a1bfed5e6542","resolution":{"observed_at":"2026-07-02T12:46:57.479670Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T01:47:43.240850Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.05875","last_updated":"2026-06-04T08:47:46Z","snapshot_observed_at":"2026-08-07T04:31:32.433154Z","submitted_at":"2026-06-04T08:47:46Z","title":"QCFuse: Query-Aware Cache Fusion via Compressed View for Efficient RAG Serving","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-28T01:47:43.240850Z"},"links":{"citing_paper":"/paper/2606.05875"},"observation_digest":"sha256:90e6b9fc1964caac1833bd00b3b6cf21716e21b395124aa4eb3711d471322d7c","observation_id":"a1f879b4-5f4c-4ef0-80db-ffa331e0dd2c","resolution":{"observed_at":"2026-06-28T01:47:43.240850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"5800.368591","doi":"10.14778/3685800.3685916","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Cafarella, Michael J","venue":"Proceedings of the VLDB Endowment","work_id":"bc9fbe90-ec56-43ab-be39-f0ea538fab8b","year":2024},"citing_paper":{"arxiv_id":"2606.05875","last_updated":"2026-06-04T08:47:46Z","snapshot_observed_at":"2026-08-07T04:31:32.433154Z","submitted_at":"2026-06-04T08:47:46Z","title":"QCFuse: Query-Aware Cache Fusion via Compressed View for Efficient RAG Serving","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-28T01:47:43.240850Z"},"links":{"citing_paper":"/paper/2606.05875"},"observation_digest":"sha256:dffecab40673b978ec65c2b07884c5925371214ce7cec51bdfe5f3d6e4f8fda3","observation_id":"e693876c-24ac-429c-91a0-6b759b0339ac","resolution":{"observed_at":"2026-06-28T01:51:28.996795Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T01:47:43.240850Z","title":"Smith, and Mike Lewis","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.05875","last_updated":"2026-06-04T08:47:46Z","snapshot_observed_at":"2026-08-07T04:31:32.433154Z","submitted_at":"2026-06-04T08:47:46Z","title":"QCFuse: Query-Aware Cache Fusion via Compressed View for Efficient RAG Serving","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-28T01:47:43.240850Z"},"links":{"citing_paper":"/paper/2606.05875"},"observation_digest":"sha256:d745cd517e5cad7d68d90fa57dd92773de549d595235c4221d33ca1fceb9526d","observation_id":"13a69312-18a7-41ca-a7f3-b56eba77d659","resolution":{"observed_at":"2026-06-28T01:47:43.240850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/d16-1264","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T20:15:34.199731Z","title":"SQ u AD : 100,000+ questions for machine comprehension of text","venue":"Proceedings of the 2016 Conference on Empirical Methods in Natural Language Processing","work_id":"8e6a63f7-90ad-4b5e-8493-c26145f74b69","year":2016},"citing_paper":{"arxiv_id":"2606.05875","last_updated":"2026-06-04T08:47:46Z","snapshot_observed_at":"2026-08-07T04:31:32.433154Z","submitted_at":"2026-06-04T08:47:46Z","title":"QCFuse: Query-Aware Cache Fusion via Compressed View for Efficient RAG Serving","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-28T01:47:43.240850Z"},"links":{"citing_paper":"/paper/2606.05875"},"observation_digest":"sha256:56640f5d83a6bcb0c0f18035dce3fc73639085642c96ea908b79660e90b754ee","observation_id":"1906dab0-0a52-4438-8ac5-1e955d196e66","resolution":{"observed_at":"2026-06-28T01:51:28.989743Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-07-11T05:49:42.935924+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T05:49:42.935924+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/n18-2074","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-Attention with Relative Position Representations","venue":null,"work_id":"5ea063fc-222c-4898-b90d-7b1becd78ebb","year":2074},"citing_paper":{"arxiv_id":"2606.05875","last_updated":"2026-06-04T08:47:46Z","snapshot_observed_at":"2026-08-07T04:31:32.433154Z","submitted_at":"2026-06-04T08:47:46Z","title":"QCFuse: Query-Aware Cache Fusion via Compressed View for Efficient RAG Serving","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-28T01:47:43.240850Z"},"links":{"citing_paper":"/paper/2606.05875"},"observation_digest":"sha256:ab2ee8d6819f537df745648ba278fab8a5ba72442a66c6adfa85ba6a9bdd0f29","observation_id":"e6ccc545-6e2e-42e0-9b87-e840dae9a328","resolution":{"observed_at":"2026-06-28T01:51:29.007654Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-07-16T19:20:39.606716+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-16T19:20:39.606716+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.02150","last_updated":"2019-11-06T00:19:05Z","snapshot_observed_at":"2026-07-06T08:35:01.386074Z","submitted_at":"2019-11-06T00:19:05Z","title":"Fast Transformer Decoding: One Write-Head is All You Need","version":1},"cited_work":{"arxiv_id":"1911.02150","doi":"10.48550/arxiv.1911.02150","metadata_source":"pith","pith_arxiv_id":"1911.02150","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fast Transformer Decoding: One Write-Head is All You Need","venue":"cs.NE","work_id":"160ea164-b1d4-4adb-8ccb-a4655d8a0bb4","year":2019},"citing_paper":{"arxiv_id":"2606.05875","last_updated":"2026-06-04T08:47:46Z","snapshot_observed_at":"2026-08-07T04:31:32.433154Z","submitted_at":"2026-06-04T08:47:46Z","title":"QCFuse: Query-Aware Cache Fusion via Compressed View for Efficient RAG Serving","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-28T01:47:43.240850Z"},"links":{"cited_paper":"/paper/1911.02150","citing_paper":"/paper/2606.05875"},"observation_digest":"sha256:fdc0a270755ddd948283a7a5fc37d7d30ddbee6e66b1d9f9d827985c18d63496","observation_id":"1f53dd2e-461f-4280-aa13-bc063d38eba9","resolution":{"observed_at":"2026-07-02T12:46:57.474291Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02013","last_updated":"2025-06-15T18:27:17Z","snapshot_observed_at":"2026-08-11T13:30:20.350655Z","submitted_at":"2025-02-04T05:03:42Z","title":"Layer by Layer: Uncovering Hidden Representations in Language Models","version":2},"cited_work":{"arxiv_id":"2502.02013","doi":"10.48550/arxiv.2502.02013","metadata_source":"pith","pith_arxiv_id":"2502.02013","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Layer by Layer: Uncovering Hidden Representations in Language Models","venue":"cs.LG","work_id":"7b4ac06a-e804-4f0a-8305-c45f2735afb5","year":2025},"citing_paper":{"arxiv_id":"2606.05875","last_updated":"2026-06-04T08:47:46Z","snapshot_observed_at":"2026-08-07T04:31:32.433154Z","submitted_at":"2026-06-04T08:47:46Z","title":"QCFuse: Query-Aware Cache Fusion via Compressed View for Efficient RAG Serving","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-28T01:47:43.240850Z"},"links":{"cited_paper":"/paper/2502.02013","citing_paper":"/paper/2606.05875"},"observation_digest":"sha256:5007b9ee539aa6421424e150b8f1866c3102a0e69e69766f8faf26871575e226","observation_id":"381184eb-eb0e-42a0-a616-12d7dae7f8b2","resolution":{"observed_at":"2026-07-02T12:46:57.480466Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.09864","last_updated":"2023-11-08T13:36:32Z","snapshot_observed_at":"2026-08-12T04:55:58.532015Z","submitted_at":"2021-04-20T09:54:06Z","title":"RoFormer: Enhanced Transformer with Rotary Position Embedding","version":5},"cited_work":{"arxiv_id":"2104.09864","doi":"10.48550/arxiv.2104.09864","metadata_source":"pith","pith_arxiv_id":"2104.09864","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RoFormer: Enhanced Transformer with Rotary Position Embedding","venue":"cs.CL","work_id":"4e5eee26-cd04-4c7a-988f-3e6d1a1f0eb9","year":2021},"citing_paper":{"arxiv_id":"2606.05875","last_updated":"2026-06-04T08:47:46Z","snapshot_observed_at":"2026-08-07T04:31:32.433154Z","submitted_at":"2026-06-04T08:47:46Z","title":"QCFuse: Query-Aware Cache Fusion via Compressed View for Efficient RAG Serving","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-28T01:47:43.240850Z"},"links":{"cited_paper":"/paper/2104.09864","citing_paper":"/paper/2606.05875"},"observation_digest":"sha256:591c009c81cfac30ec8fcf56bd2b7f6583ee0cb6427e4d15e9b8eeb164873028","observation_id":"0500a10f-a99c-429f-95c3-4064b7955928","resolution":{"observed_at":"2026-07-02T12:46:57.472090Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-10T15:38:39.263809+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-10T15:38:39.263809+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T01:47:43.240850Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.05875","last_updated":"2026-06-04T08:47:46Z","snapshot_observed_at":"2026-08-07T04:31:32.433154Z","submitted_at":"2026-06-04T08:47:46Z","title":"QCFuse: Query-Aware Cache Fusion via Compressed View for Efficient RAG Serving","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-28T01:47:43.240850Z"},"links":{"citing_paper":"/paper/2606.05875"},"observation_digest":"sha256:7b19a6567829ef8671545ca273f43361dd71ef534da2096fee4b6a9fa9cd9cdb","observation_id":"35a81ca9-94ff-4e72-9dcc-61d8d60283df","resolution":{"observed_at":"2026-06-28T01:47:43.240850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2606.05875","last_updated":"2026-06-04T08:47:46Z","snapshot_observed_at":"2026-08-07T04:31:32.433154Z","submitted_at":"2026-06-04T08:47:46Z","title":"QCFuse: Query-Aware Cache Fusion via Compressed View for Efficient RAG Serving","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-28T01:47:43.240850Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2606.05875"},"observation_digest":"sha256:baed4d98b60724f3a334df6af71da22d0cbbb720cacf185fda9bf3233a9a1331","observation_id":"5dc1fd44-b027-4760-a6f0-97919c1b205b","resolution":{"observed_at":"2026-07-02T12:46:57.434245Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T01:47:43.240850Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.05875","last_updated":"2026-06-04T08:47:46Z","snapshot_observed_at":"2026-08-07T04:31:32.433154Z","submitted_at":"2026-06-04T08:47:46Z","title":"QCFuse: Query-Aware Cache Fusion via Compressed View for Efficient RAG Serving","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-28T01:47:43.240850Z"},"links":{"citing_paper":"/paper/2606.05875"},"observation_digest":"sha256:983c3a46db31f0b5927d1b714cdfc7f456fad77dc06accff5519af669d0fde2e","observation_id":"2f7daaa8-4ed6-4a7c-91e6-2ddebf041ab2","resolution":{"observed_at":"2026-06-28T01:47:43.240850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/w17-2623","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proceedings of the 2nd","venue":null,"work_id":"94f740a9-a124-4ce5-82d5-120683536621","year":2017},"citing_paper":{"arxiv_id":"2606.05875","last_updated":"2026-06-04T08:47:46Z","snapshot_observed_at":"2026-08-07T04:31:32.433154Z","submitted_at":"2026-06-04T08:47:46Z","title":"QCFuse: Query-Aware Cache Fusion via Compressed View for Efficient RAG Serving","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-28T01:47:43.240850Z"},"links":{"citing_paper":"/paper/2606.05875"},"observation_digest":"sha256:d1c396d577a518c322facdd73f964adb105e8d146a47fa08c08e8d8081f6173d","observation_id":"91522932-be53-4ecd-8a06-5537b421632d","resolution":{"observed_at":"2026-06-28T01:51:29.013902Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T01:47:43.240850Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.05875","last_updated":"2026-06-04T08:47:46Z","snapshot_observed_at":"2026-08-07T04:31:32.433154Z","submitted_at":"2026-06-04T08:47:46Z","title":"QCFuse: Query-Aware Cache Fusion via Compressed View for Efficient RAG Serving","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-06-28T01:47:43.240850Z"},"links":{"citing_paper":"/paper/2606.05875"},"observation_digest":"sha256:46e0b0a679c7e9269047bd6c11a913b1830e0bff47f4e2dddc07ba6d776b01d7","observation_id":"12ec027a-bf44-46b8-b0a8-cd67cb411d02","resolution":{"observed_at":"2026-06-28T01:47:43.240850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.00573","last_updated":"2022-05-05T05:50:50Z","snapshot_observed_at":"2026-08-11T21:05:57.186979Z","submitted_at":"2021-08-02T00:33:27Z","title":"MuSiQue: Multihop Questions via Single-hop Question Composition","version":3},"cited_work":{"arxiv_id":"2108.00573","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2108.00573","snapshot_observed_at":"2026-07-04T12:09:48.919445Z","title":"Musique: Multihop questions via single-hop question composition","venue":null,"work_id":"3e2d22ea-ef14-4f7f-a36e-cd2848ff6ad0","year":2021},"citing_paper":{"arxiv_id":"2606.05875","last_updated":"2026-06-04T08:47:46Z","snapshot_observed_at":"2026-08-07T04:31:32.433154Z","submitted_at":"2026-06-04T08:47:46Z","title":"QCFuse: Query-Aware Cache Fusion via Compressed View for Efficient RAG Serving","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-06-28T01:47:43.240850Z"},"links":{"cited_paper":"/paper/2108.00573","citing_paper":"/paper/2606.05875"},"observation_digest":"sha256:76f925a45f569089d61f642eada143c4fc941fec150238a6258a984c05c2add2","observation_id":"dd0f265f-fbd0-4b59-9f15-8c2bcf8d8f85","resolution":{"observed_at":"2026-07-02T12:46:57.439595Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T01:47:43.240850Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.05875","last_updated":"2026-06-04T08:47:46Z","snapshot_observed_at":"2026-08-07T04:31:32.433154Z","submitted_at":"2026-06-04T08:47:46Z","title":"QCFuse: Query-Aware Cache Fusion via Compressed View for Efficient RAG Serving","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-06-28T01:47:43.240850Z"},"links":{"citing_paper":"/paper/2606.05875"},"observation_digest":"sha256:f3627e07947c6fb8a95907748c034d36bb78e54d5c41b0847c7756593f6c452c","observation_id":"5afbbbcd-2eee-4dab-b1d0-aa2b244ccbf1","resolution":{"observed_at":"2026-06-28T01:47:43.240850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.04284","last_updated":"2019-06-18T19:42:31Z","snapshot_observed_at":"2026-07-06T07:59:23.899551Z","submitted_at":"2019-06-07T13:58:49Z","title":"Analyzing the Structure of Attention in a Transformer Language Model","version":2},"cited_work":{"arxiv_id":"1906.04284","doi":"10.48550/arxiv.1906.04284","metadata_source":"pith","pith_arxiv_id":"1906.04284","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Analyzing the Structure of Attention in a Transformer Language Model","venue":"cs.CL","work_id":"45dd9488-8b79-4e73-be3f-59f47605b22e","year":2019},"citing_paper":{"arxiv_id":"2606.05875","last_updated":"2026-06-04T08:47:46Z","snapshot_observed_at":"2026-08-07T04:31:32.433154Z","submitted_at":"2026-06-04T08:47:46Z","title":"QCFuse: Query-Aware Cache Fusion via Compressed View for Efficient RAG Serving","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-06-28T01:47:43.240850Z"},"links":{"cited_paper":"/paper/1906.04284","citing_paper":"/paper/2606.05875"},"observation_digest":"sha256:e85c0b8fc166ecd72b8f365de1b11994f258bcf7f1d260ea5964e29b5c79b798","observation_id":"62e1d7dd-6297-40d4-9195-60379aa1034e","resolution":{"observed_at":"2026-07-02T12:46:57.425908Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T01:47:43.240850Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.05875","last_updated":"2026-06-04T08:47:46Z","snapshot_observed_at":"2026-08-07T04:31:32.433154Z","submitted_at":"2026-06-04T08:47:46Z","title":"QCFuse: Query-Aware Cache Fusion via Compressed View for Efficient RAG Serving","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-06-28T01:47:43.240850Z"},"links":{"citing_paper":"/paper/2606.05875"},"observation_digest":"sha256:06eb44bf5843d539f75fee91eb60b62499553d017b53a3039d0345e34eb5a14e","observation_id":"20fa9563-fd9b-4424-bb27-6d822a67b65b","resolution":{"observed_at":"2026-06-28T01:47:43.240850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.02579","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T18:58:50.705878Z","title":"Prophetkv: User- query-driven selective recomputation for efficient kv cache reuse in retrieval-augmented generation.arXiv preprint arXiv:2602.02579, 2026","venue":null,"work_id":"4d8f0f29-2e8e-4323-a31a-c7710e6614c2","year":2026},"citing_paper":{"arxiv_id":"2606.05875","last_updated":"2026-06-04T08:47:46Z","snapshot_observed_at":"2026-08-07T04:31:32.433154Z","submitted_at":"2026-06-04T08:47:46Z","title":"QCFuse: Query-Aware Cache Fusion via Compressed View for Efficient RAG Serving","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-06-28T01:47:43.240850Z"},"links":{"citing_paper":"/paper/2606.05875"},"observation_digest":"sha256:2ce04ad39376e7e2f7f2a017cb2c57c78233e35cea99738cc67747f5e6b68a43","observation_id":"4edff73e-4e9e-4274-99ab-d24fa4949cd4","resolution":{"observed_at":"2026-07-02T12:46:57.428837Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T01:47:43.240850Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.05875","last_updated":"2026-06-04T08:47:46Z","snapshot_observed_at":"2026-08-07T04:31:32.433154Z","submitted_at":"2026-06-04T08:47:46Z","title":"QCFuse: Query-Aware Cache Fusion via Compressed View for Efficient RAG Serving","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-06-28T01:47:43.240850Z"},"links":{"citing_paper":"/paper/2606.05875"},"observation_digest":"sha256:f917043998207cb691ae191366d66fbd54133b9240d59694ca6b35c7c40fe57e","observation_id":"bcfa2d0b-9ac0-43a6-a4d8-dcf655a59553","resolution":{"observed_at":"2026-06-28T01:47:43.240850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T01:47:43.240850Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.05875","last_updated":"2026-06-04T08:47:46Z","snapshot_observed_at":"2026-08-07T04:31:32.433154Z","submitted_at":"2026-06-04T08:47:46Z","title":"QCFuse: Query-Aware Cache Fusion via Compressed View for Efficient RAG Serving","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-06-28T01:47:43.240850Z"},"links":{"citing_paper":"/paper/2606.05875"},"observation_digest":"sha256:4faef8fb403de3807305adbaa2b1f18b2a70a81874a52267f59b6553a56dcf37","observation_id":"4cc53b7e-8187-430a-bbf3-b9eaa4f2530c","resolution":{"observed_at":"2026-06-28T01:47:43.240850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04408","last_updated":"2023-10-06T17:55:36Z","snapshot_observed_at":"2026-08-13T05:55:15.507166Z","submitted_at":"2023-10-06T17:55:36Z","title":"RECOMP: Improving Retrieval-Augmented LMs with Compression and Selective Augmentation","version":1},"cited_work":{"arxiv_id":"2310.04408","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.04408","snapshot_observed_at":"2026-07-10T17:17:25.625826Z","title":"Recomp: Improving retrieval-augmented lms with compression and selective augmentation","venue":"cs.CL","work_id":"217e3d01-8b79-4d21-887a-ed731f75cc45","year":2023},"citing_paper":{"arxiv_id":"2606.05875","last_updated":"2026-06-04T08:47:46Z","snapshot_observed_at":"2026-08-07T04:31:32.433154Z","submitted_at":"2026-06-04T08:47:46Z","title":"QCFuse: Query-Aware Cache Fusion via Compressed View for Efficient RAG Serving","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-06-28T01:47:43.240850Z"},"links":{"cited_paper":"/paper/2310.04408","citing_paper":"/paper/2606.05875"},"observation_digest":"sha256:27a430fa8e1d103d21de3ed5231b83ff9fbf619c464c4069840f3925d6f4e823","observation_id":"a5849987-490a-4cce-8a49-d5ca86805a40","resolution":{"observed_at":"2026-07-02T12:46:57.423069Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T01:47:43.240850Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.05875","last_updated":"2026-06-04T08:47:46Z","snapshot_observed_at":"2026-08-07T04:31:32.433154Z","submitted_at":"2026-06-04T08:47:46Z","title":"QCFuse: Query-Aware Cache Fusion via Compressed View for Efficient RAG Serving","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-06-28T01:47:43.240850Z"},"links":{"citing_paper":"/paper/2606.05875"},"observation_digest":"sha256:caf8342627c2c540dc5a3b660169b59495ab600218b4c1bf1a9543c3fef2142b","observation_id":"bf41e84f-cd53-44c0-b401-a5c31d5a3e6e","resolution":{"observed_at":"2026-06-28T01:47:43.240850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T01:47:43.240850Z","title":"InFindings of the Association for Computational Linguistics: ACL","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.05875","last_updated":"2026-06-04T08:47:46Z","snapshot_observed_at":"2026-08-07T04:31:32.433154Z","submitted_at":"2026-06-04T08:47:46Z","title":"QCFuse: Query-Aware Cache Fusion via Compressed View for Efficient RAG Serving","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-06-28T01:47:43.240850Z"},"links":{"citing_paper":"/paper/2606.05875"},"observation_digest":"sha256:4399a95e15df8b199ee42955b9107aaf7f60bbdaa763db37e3bdd7c18f315dc2","observation_id":"19f62d2f-6328-4854-86ed-df3355b29370","resolution":{"observed_at":"2026-06-28T01:47:43.240850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.findings-acl.195","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"https://doi.org/10.18653/v1/2024.findings-acl.195","venue":null,"work_id":"9935b703-8b4b-4356-a96a-6b108053235c","year":2024},"citing_paper":{"arxiv_id":"2606.05875","last_updated":"2026-06-04T08:47:46Z","snapshot_observed_at":"2026-08-07T04:31:32.433154Z","submitted_at":"2026-06-04T08:47:46Z","title":"QCFuse: Query-Aware Cache Fusion via Compressed View for Efficient RAG Serving","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-06-28T01:47:43.240850Z"},"links":{"citing_paper":"/paper/2606.05875"},"observation_digest":"sha256:ce4408f6eb7769c3957002ed9d54eedada65d3b92ee413cf605ad9ca671a5c16","observation_id":"f414d93d-d04f-4ba4-84f0-786a99bc040e","resolution":{"observed_at":"2026-06-28T01:51:28.992032Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-07T23:38:13.435314+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-07T23:38:13.435314+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1809.09600","last_updated":"2018-09-25T17:28:20Z","snapshot_observed_at":"2026-08-11T10:35:06.989614Z","submitted_at":"2018-09-25T17:28:20Z","title":"HotpotQA: A Dataset for Diverse, Explainable Multi-hop Question Answering","version":1},"cited_work":{"arxiv_id":"1809.09600","doi":"10.48550/arxiv.1809.09600","metadata_source":"pith","pith_arxiv_id":"1809.09600","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HotpotQA: A Dataset for Diverse, Explainable Multi-hop Question Answering","venue":"cs.CL","work_id":"c87d7e5f-b81a-41c8-beca-f0b9d598aae4","year":2018},"citing_paper":{"arxiv_id":"2606.05875","last_updated":"2026-06-04T08:47:46Z","snapshot_observed_at":"2026-08-07T04:31:32.433154Z","submitted_at":"2026-06-04T08:47:46Z","title":"QCFuse: Query-Aware Cache Fusion via Compressed View for Efficient RAG Serving","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-06-28T01:47:43.240850Z"},"links":{"cited_paper":"/paper/1809.09600","citing_paper":"/paper/2606.05875"},"observation_digest":"sha256:49aae2767efe14668babf7215bf0faeb314cb355892e94353dc4c40b39568a07","observation_id":"acbef3a5-3c28-4b45-8909-ab736209cff4","resolution":{"observed_at":"2026-07-02T12:46:57.431636Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T01:47:43.240850Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.05875","last_updated":"2026-06-04T08:47:46Z","snapshot_observed_at":"2026-08-07T04:31:32.433154Z","submitted_at":"2026-06-04T08:47:46Z","title":"QCFuse: Query-Aware Cache Fusion via Compressed View for Efficient RAG Serving","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-06-28T01:47:43.240850Z"},"links":{"citing_paper":"/paper/2606.05875"},"observation_digest":"sha256:f50f94742b31c9981ff79f0772b05d87d6414d07a02557c7c26a0fc6714c28ae","observation_id":"ced311e4-6f71-410d-b783-3774b48f11cb","resolution":{"observed_at":"2026-06-28T01:47:43.240850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T01:47:43.240850Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.05875","last_updated":"2026-06-04T08:47:46Z","snapshot_observed_at":"2026-08-07T04:31:32.433154Z","submitted_at":"2026-06-04T08:47:46Z","title":"QCFuse: Query-Aware Cache Fusion via Compressed View for Efficient RAG Serving","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-06-28T01:47:43.240850Z"},"links":{"citing_paper":"/paper/2606.05875"},"observation_digest":"sha256:14b80f7cfaca42ef84964f5a843e8e0b21cb84907b90d23114535f784b54fd3b","observation_id":"45961894-a20d-412e-8e57-2577b89896ba","resolution":{"observed_at":"2026-06-28T01:47:43.240850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T01:47:43.240850Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.05875","last_updated":"2026-06-04T08:47:46Z","snapshot_observed_at":"2026-08-07T04:31:32.433154Z","submitted_at":"2026-06-04T08:47:46Z","title":"QCFuse: Query-Aware Cache Fusion via Compressed View for Efficient RAG Serving","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-06-28T01:47:43.240850Z"},"links":{"citing_paper":"/paper/2606.05875"},"observation_digest":"sha256:ccd525dd0b7c656ec10d9f286306dc54231c1b9c818e1cd5805daf5b372c055b","observation_id":"cbcc4c82-fa7c-4dad-9c80-aa49dc17adec","resolution":{"observed_at":"2026-06-28T01:47:43.240850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1145/3725338","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pqcache: Product quantization-based kvcache for long context llm inference.Proc","venue":"Proceedings of the ACM on Management of Data","work_id":"91a0bab0-786f-48b4-859c-2fff7fdc334f","year":2025},"citing_paper":{"arxiv_id":"2606.05875","last_updated":"2026-06-04T08:47:46Z","snapshot_observed_at":"2026-08-07T04:31:32.433154Z","submitted_at":"2026-06-04T08:47:46Z","title":"QCFuse: Query-Aware Cache Fusion via Compressed View for Efficient RAG Serving","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-06-28T01:47:43.240850Z"},"links":{"citing_paper":"/paper/2606.05875"},"observation_digest":"sha256:ad11438ac21d04fcdbfed88270162e2874668b00403fa9ff37cb0d673d52f3e7","observation_id":"05e7431c-c6ee-4a42-8e34-b6941cc67e89","resolution":{"observed_at":"2026-06-28T01:51:28.976234Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T01:47:43.240850Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.05875","last_updated":"2026-06-04T08:47:46Z","snapshot_observed_at":"2026-08-07T04:31:32.433154Z","submitted_at":"2026-06-04T08:47:46Z","title":"QCFuse: Query-Aware Cache Fusion via Compressed View for Efficient RAG Serving","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-06-28T01:47:43.240850Z"},"links":{"citing_paper":"/paper/2606.05875"},"observation_digest":"sha256:f8115811d4c43e483d7899e2caeaf592cbe707f021bef77c978a0f46b2f5153b","observation_id":"42ab2ad4-6f12-4298-9a3e-b00e39f277de","resolution":{"observed_at":"2026-06-28T01:47:43.240850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"5800.368590","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T01:51:29.014886Z","title":null,"venue":null,"work_id":"c420bea9-df7f-4e2e-8876-f9222fce76bd","year":2024},"citing_paper":{"arxiv_id":"2606.05875","last_updated":"2026-06-04T08:47:46Z","snapshot_observed_at":"2026-08-07T04:31:32.433154Z","submitted_at":"2026-06-04T08:47:46Z","title":"QCFuse: Query-Aware Cache Fusion via Compressed View for Efficient RAG Serving","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-06-28T01:47:43.240850Z"},"links":{"citing_paper":"/paper/2606.05875"},"observation_digest":"sha256:ed1ab4929c19e879d05418690d8f602554d86c7d1bdaeab79d973e6eef9c219e","observation_id":"32240c30-3a0d-4c12-b738-6454461ed264","resolution":{"observed_at":"2026-06-28T01:51:29.016327Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-08-11T10:42:54.633244Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":"2312.07104","doi":"10.48550/arxiv.2312.07104","metadata_source":"pith","pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","venue":"cs.AI","work_id":"bcc79aed-93ef-4b91-94e6-e62b5fa15ce7","year":2023},"citing_paper":{"arxiv_id":"2606.05875","last_updated":"2026-06-04T08:47:46Z","snapshot_observed_at":"2026-08-07T04:31:32.433154Z","submitted_at":"2026-06-04T08:47:46Z","title":"QCFuse: Query-Aware Cache Fusion via Compressed View for Efficient RAG Serving","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-06-28T01:47:43.240850Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2606.05875"},"observation_digest":"sha256:6c215bf90a55c3b3b25603814c0fb5ddbaf1e4fc51304e3f3b8a5abc6e4a7b45","observation_id":"56210994-c691-4877-bf4b-b9f6d58aa3b6","resolution":{"observed_at":"2026-06-28T01:51:29.010070Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T01:47:43.240850Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.05875","last_updated":"2026-06-04T08:47:46Z","snapshot_observed_at":"2026-08-07T04:31:32.433154Z","submitted_at":"2026-06-04T08:47:46Z","title":"QCFuse: Query-Aware Cache Fusion via Compressed View for Efficient RAG Serving","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-06-28T01:47:43.240850Z"},"links":{"citing_paper":"/paper/2606.05875"},"observation_digest":"sha256:1d0a47def9f2e63d7e5e03d67ab32a614545e92eef769adef6be95b7fdda74a0","observation_id":"38349cf8-62a0-478a-9a91-5492605479cd","resolution":{"observed_at":"2026-06-28T01:47:43.240850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.05875","last_updated":"2026-06-04T08:47:46Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-07T04:31:32.433154Z","submitted_at":"2026-06-04T08:47:46Z","title":"QCFuse: Query-Aware Cache Fusion via Compressed View for Efficient RAG Serving"},"reference_resolution":{"displayed":78,"state_counts":{"malformed_identifier":2,"metadata_mismatch":7,"parse_uncertain":0,"unresolved":33,"verified_exact":36,"verified_fuzzy":0},"total_outbound_references":78},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 78 of 78 outbound references and 1 inbound Pith citation observation for arXiv:2606.05875."}