{"as_of":"2026-08-22T17:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:37b758d7c3d9c34879c284427bd8d8014511f67917c49ab55018878cc7a14016","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-26T00:11:57.763089Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T12:56:45.291959Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.24467","last_updated":"2026-06-23T11:59:46Z","snapshot_observed_at":"2026-08-18T21:03:31.332486Z","submitted_at":"2026-06-23T11:59:46Z","title":"CompressKV: Semantic-Retrieval-Guided KV-Cache Compression for Resource-Efficient Long-Context LLM Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.24467","snapshot_observed_at":"2026-07-31T12:56:45.291959Z","title":"Akide Liu, Jing Liu, Zizheng Pan, Yefei He, Gholam- reza Haffari, and Bohan Zhuang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28263","last_updated":"2026-07-30T14:19:11Z","snapshot_observed_at":"2026-08-15T23:38:03.048468Z","submitted_at":"2026-07-30T14:19:11Z","title":"Understanding Is Done Early: A Depth Division of Labor in Large Language Models and Its Use for Unbounded-Context Memory","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-31T12:56:45.291959Z"},"links":{"cited_paper":"/paper/2606.24467","citing_paper":"/paper/2607.28263"},"observation_digest":"sha256:f894decc268b88040da50d8d1161342719d88a786172a6a54084ac4f9e2affe0","observation_id":"22bdc162-20b6-4d40-8af9-6cef3be9f150","resolution":{"observed_at":"2026-07-31T12:56:45.291959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2606.24467/citation-record","integrity":"/paper/2606.24467/integrity","json":"/paper/2606.24467/citation-record.json","paper":"/paper/2606.24467"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2606.24467","last_updated":"2026-06-23T11:59:46Z","snapshot_observed_at":"2026-08-18T21:03:31.332486Z","submitted_at":"2026-06-23T11:59:46Z","title":"CompressKV: Semantic-Retrieval-Guided KV-Cache Compression for Resource-Efficient Long-Context LLM Inference","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-26T00:11:57.763089Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2606.24467"},"observation_digest":"sha256:50b5442e28a07e9c9c65adb4bb7bbeecc804162cb894850585aa1291aca87405","observation_id":"ed88dafd-6b39-4038-90b5-adccec79cdad","resolution":{"observed_at":"2026-07-04T16:49:58.020178Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T00:11:57.763089Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.24467","last_updated":"2026-06-23T11:59:46Z","snapshot_observed_at":"2026-08-18T21:03:31.332486Z","submitted_at":"2026-06-23T11:59:46Z","title":"CompressKV: Semantic-Retrieval-Guided KV-Cache Compression for Resource-Efficient Long-Context LLM Inference","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-26T00:11:57.763089Z"},"links":{"citing_paper":"/paper/2606.24467"},"observation_digest":"sha256:ee664fc5e2361c1107a8e661b5bf6cfada0cd4860e24875222dbee4a877d5899","observation_id":"1da52462-0a7a-4175-a718-a484a8f40fc7","resolution":{"observed_at":"2026-06-26T00:11:57.763089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T00:11:57.763089Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.24467","last_updated":"2026-06-23T11:59:46Z","snapshot_observed_at":"2026-08-18T21:03:31.332486Z","submitted_at":"2026-06-23T11:59:46Z","title":"CompressKV: Semantic-Retrieval-Guided KV-Cache Compression for Resource-Efficient Long-Context LLM Inference","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-26T00:11:57.763089Z"},"links":{"citing_paper":"/paper/2606.24467"},"observation_digest":"sha256:0d7965339585edeff6bd929336e330baf0e818ebc5cd8709f76f87d149e7c79a","observation_id":"161d8000-00ce-4020-bce7-9a781805fa75","resolution":{"observed_at":"2026-06-26T00:11:57.763089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":"2407.21783","doi":"10.1016/s0749-0720(15","metadata_source":"pith","pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"The Llama 3 Herd of Models","venue":"cs.AI","work_id":"1549a635-88af-4ac1-acfe-51ae7bb53345","year":2024},"citing_paper":{"arxiv_id":"2606.24467","last_updated":"2026-06-23T11:59:46Z","snapshot_observed_at":"2026-08-18T21:03:31.332486Z","submitted_at":"2026-06-23T11:59:46Z","title":"CompressKV: Semantic-Retrieval-Guided KV-Cache Compression for Resource-Efficient Long-Context LLM Inference","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-26T00:11:57.763089Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2606.24467"},"observation_digest":"sha256:8be156b5d6a4db06abe9c5199627b6a5b2142d7334794110d43d93abb8414866","observation_id":"082c550d-f1f2-4e4b-9086-4876c57c6822","resolution":{"observed_at":"2026-07-04T16:49:58.017771Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-08-17T18:50:07.059564Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2412.15115","doi":"10.1145/3581783.3612503","metadata_source":"pith","pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5 Technical Report","venue":"cs.CL","work_id":"d8432992-4980-4a81-85c7-9fa2c2b87f85","year":2024},"citing_paper":{"arxiv_id":"2606.24467","last_updated":"2026-06-23T11:59:46Z","snapshot_observed_at":"2026-08-18T21:03:31.332486Z","submitted_at":"2026-06-23T11:59:46Z","title":"CompressKV: Semantic-Retrieval-Guided KV-Cache Compression for Resource-Efficient Long-Context LLM Inference","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-26T00:11:57.763089Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2606.24467"},"observation_digest":"sha256:9331ad29ef0dd0ce2925b70a6d19a275e9982481988231f904b14e9dd586e1c1","observation_id":"ba327b48-32b6-4ba4-a725-b7086922418b","resolution":{"observed_at":"2026-07-04T16:49:58.044274Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T00:11:57.763089Z","title":"Wang, Y.-G","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.24467","last_updated":"2026-06-23T11:59:46Z","snapshot_observed_at":"2026-08-18T21:03:31.332486Z","submitted_at":"2026-06-23T11:59:46Z","title":"CompressKV: Semantic-Retrieval-Guided KV-Cache Compression for Resource-Efficient Long-Context LLM Inference","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-26T00:11:57.763089Z"},"links":{"citing_paper":"/paper/2606.24467"},"observation_digest":"sha256:64f8934f200c2e40ea962d70ec176f30372b06db7c05eb3b6368f1f0d241edbd","observation_id":"840454fa-54ab-4dfd-8a6c-e695e68eabcb","resolution":{"observed_at":"2026-06-26T00:11:57.763089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T00:11:57.763089Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.24467","last_updated":"2026-06-23T11:59:46Z","snapshot_observed_at":"2026-08-18T21:03:31.332486Z","submitted_at":"2026-06-23T11:59:46Z","title":"CompressKV: Semantic-Retrieval-Guided KV-Cache Compression for Resource-Efficient Long-Context LLM Inference","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-26T00:11:57.763089Z"},"links":{"citing_paper":"/paper/2606.24467"},"observation_digest":"sha256:7a8a46d331fcdd63467a4f93c07f0288c696e2ae6fde7965b9e4d6544a673248","observation_id":"db03baaf-a8e7-4ab6-ad70-a8f34aa04018","resolution":{"observed_at":"2026-06-26T00:11:57.763089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05527","last_updated":"2024-09-30T22:44:58Z","snapshot_observed_at":"2026-08-19T23:26:45.859034Z","submitted_at":"2024-03-08T18:48:30Z","title":"GEAR: An Efficient KV Cache Compression Recipe for Near-Lossless Generative Inference of LLM","version":4},"cited_work":{"arxiv_id":"2403.05527","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.05527","snapshot_observed_at":"2026-07-10T01:36:44.078109Z","title":"Gear: An efficient kv cache compression recipe for near-lossless generative inference of llm","venue":"cs.LG","work_id":"26d3dd66-4e37-4f27-a590-526883aef922","year":2024},"citing_paper":{"arxiv_id":"2606.24467","last_updated":"2026-06-23T11:59:46Z","snapshot_observed_at":"2026-08-18T21:03:31.332486Z","submitted_at":"2026-06-23T11:59:46Z","title":"CompressKV: Semantic-Retrieval-Guided KV-Cache Compression for Resource-Efficient Long-Context LLM Inference","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-26T00:11:57.763089Z"},"links":{"cited_paper":"/paper/2403.05527","citing_paper":"/paper/2606.24467"},"observation_digest":"sha256:c3b8e156acaf3a201e583e0c36383a67ff61d689dce12fc41899e328e133c277","observation_id":"95bb6d88-1f3e-47bd-8e44-4d6174afc6c8","resolution":{"observed_at":"2026-07-04T16:49:58.047166Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T00:11:57.763089Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.24467","last_updated":"2026-06-23T11:59:46Z","snapshot_observed_at":"2026-08-18T21:03:31.332486Z","submitted_at":"2026-06-23T11:59:46Z","title":"CompressKV: Semantic-Retrieval-Guided KV-Cache Compression for Resource-Efficient Long-Context LLM Inference","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-26T00:11:57.763089Z"},"links":{"citing_paper":"/paper/2606.24467"},"observation_digest":"sha256:61db344e97b48a8bcf9c12105abf74058ddbe78fcb50cfa28aecd3216aa8e77f","observation_id":"176e4426-a23b-4b4d-96b4-7f985a40e75f","resolution":{"observed_at":"2026-06-26T00:11:57.763089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T00:11:57.763089Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.24467","last_updated":"2026-06-23T11:59:46Z","snapshot_observed_at":"2026-08-18T21:03:31.332486Z","submitted_at":"2026-06-23T11:59:46Z","title":"CompressKV: Semantic-Retrieval-Guided KV-Cache Compression for Resource-Efficient Long-Context LLM Inference","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-26T00:11:57.763089Z"},"links":{"citing_paper":"/paper/2606.24467"},"observation_digest":"sha256:b405f4dd4ec6acaa50c84e2427e9e2203955f276ebc8eec9b431b864d868def7","observation_id":"e45f06e1-7dfe-43e0-bd94-2fe77032d648","resolution":{"observed_at":"2026-06-26T00:11:57.763089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T00:11:57.763089Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.24467","last_updated":"2026-06-23T11:59:46Z","snapshot_observed_at":"2026-08-18T21:03:31.332486Z","submitted_at":"2026-06-23T11:59:46Z","title":"CompressKV: Semantic-Retrieval-Guided KV-Cache Compression for Resource-Efficient Long-Context LLM Inference","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-26T00:11:57.763089Z"},"links":{"citing_paper":"/paper/2606.24467"},"observation_digest":"sha256:708894460fc7ef9b109b7727f5c5969c0b09d896c306c9fc1ad07bfec31c3f7b","observation_id":"59c55722-3d3e-4f8b-b4c8-15fa7c2c5b6e","resolution":{"observed_at":"2026-06-26T00:11:57.763089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T00:11:57.763089Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.24467","last_updated":"2026-06-23T11:59:46Z","snapshot_observed_at":"2026-08-18T21:03:31.332486Z","submitted_at":"2026-06-23T11:59:46Z","title":"CompressKV: Semantic-Retrieval-Guided KV-Cache Compression for Resource-Efficient Long-Context LLM Inference","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-26T00:11:57.763089Z"},"links":{"citing_paper":"/paper/2606.24467"},"observation_digest":"sha256:b3c250b73b146f164cfa3c5d3e1b6f5c01f97cd73245eb70bf130b05d4defc11","observation_id":"57f7f1be-1426-4318-968a-5fbbcaeee64d","resolution":{"observed_at":"2026-06-26T00:11:57.763089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02069","last_updated":"2025-05-15T17:18:12Z","snapshot_observed_at":"2026-08-13T04:39:30.300015Z","submitted_at":"2024-06-04T07:51:30Z","title":"PyramidKV: Dynamic KV Cache Compression based on Pyramidal Information Funneling","version":4},"cited_work":{"arxiv_id":"2406.02069","doi":"10.48550/arxiv.2406.02069","metadata_source":"pith","pith_arxiv_id":"2406.02069","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PyramidKV: Dynamic KV Cache Compression based on Pyramidal Information Funneling","venue":"cs.CL","work_id":"6317700d-f903-4ce1-8f53-b43cb146d48b","year":2024},"citing_paper":{"arxiv_id":"2606.24467","last_updated":"2026-06-23T11:59:46Z","snapshot_observed_at":"2026-08-18T21:03:31.332486Z","submitted_at":"2026-06-23T11:59:46Z","title":"CompressKV: Semantic-Retrieval-Guided KV-Cache Compression for Resource-Efficient Long-Context LLM Inference","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-26T00:11:57.763089Z"},"links":{"cited_paper":"/paper/2406.02069","citing_paper":"/paper/2606.24467"},"observation_digest":"sha256:32f7e4f36497f823760b8ad5f00275f694c5b71d6810ea41d3c97d0f946b0c3e","observation_id":"a59fb7dd-2e04-460d-8b4d-4e58d22fb382","resolution":{"observed_at":"2026-07-04T16:49:58.037140Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-05-25T13:53:26.042348+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T13:53:26.042348+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T00:11:57.763089Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.24467","last_updated":"2026-06-23T11:59:46Z","snapshot_observed_at":"2026-08-18T21:03:31.332486Z","submitted_at":"2026-06-23T11:59:46Z","title":"CompressKV: Semantic-Retrieval-Guided KV-Cache Compression for Resource-Efficient Long-Context LLM Inference","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-26T00:11:57.763089Z"},"links":{"citing_paper":"/paper/2606.24467"},"observation_digest":"sha256:9851a1956db46f17e830d10658a839bdc7dae7a73bbff62abd567c45063add03","observation_id":"b0c13995-5a76-4ded-9274-2fb9a43db4c8","resolution":{"observed_at":"2026-06-26T00:11:57.763089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T00:11:57.763089Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.24467","last_updated":"2026-06-23T11:59:46Z","snapshot_observed_at":"2026-08-18T21:03:31.332486Z","submitted_at":"2026-06-23T11:59:46Z","title":"CompressKV: Semantic-Retrieval-Guided KV-Cache Compression for Resource-Efficient Long-Context LLM Inference","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-26T00:11:57.763089Z"},"links":{"citing_paper":"/paper/2606.24467"},"observation_digest":"sha256:672050689b9cd5e1200ba499ff3c0473f451e2cff97c45bb5a4aa49144b56bc7","observation_id":"ae98eed7-e0a9-484e-b8d9-a1fe2adcd90c","resolution":{"observed_at":"2026-06-26T00:11:57.763089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T00:11:57.763089Z","title":"Ainslie, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.24467","last_updated":"2026-06-23T11:59:46Z","snapshot_observed_at":"2026-08-18T21:03:31.332486Z","submitted_at":"2026-06-23T11:59:46Z","title":"CompressKV: Semantic-Retrieval-Guided KV-Cache Compression for Resource-Efficient Long-Context LLM Inference","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-26T00:11:57.763089Z"},"links":{"citing_paper":"/paper/2606.24467"},"observation_digest":"sha256:051e900cd789b802211dc50cc94bd8775cd7733d96f738df442638320274d02b","observation_id":"6a4aec25-f8a9-4260-be27-fa2d8910f6e0","resolution":{"observed_at":"2026-06-26T00:11:57.763089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T00:11:57.763089Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.24467","last_updated":"2026-06-23T11:59:46Z","snapshot_observed_at":"2026-08-18T21:03:31.332486Z","submitted_at":"2026-06-23T11:59:46Z","title":"CompressKV: Semantic-Retrieval-Guided KV-Cache Compression for Resource-Efficient Long-Context LLM Inference","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-26T00:11:57.763089Z"},"links":{"citing_paper":"/paper/2606.24467"},"observation_digest":"sha256:c2894aa357d4cff4c696ba089e8efdf518fc02f790f5ce225d5d2c414c6d384d","observation_id":"6ca51b5c-94c1-4a51-bab3-4691d41f8f00","resolution":{"observed_at":"2026-06-26T00:11:57.763089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2410.19258","doi":"10.48550/arxiv.2410.19258","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Not all heads matter: A head-level KV cache compression method with integrated retrieval and reasoning","venue":"arXiv (Cornell University)","work_id":"fef1d60f-7438-4fe3-98bf-842ff43eac33","year":2025},"citing_paper":{"arxiv_id":"2606.24467","last_updated":"2026-06-23T11:59:46Z","snapshot_observed_at":"2026-08-18T21:03:31.332486Z","submitted_at":"2026-06-23T11:59:46Z","title":"CompressKV: Semantic-Retrieval-Guided KV-Cache Compression for Resource-Efficient Long-Context LLM Inference","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-26T00:11:57.763089Z"},"links":{"citing_paper":"/paper/2606.24467"},"observation_digest":"sha256:4a9417bade446d52f09aa31a3a3c1639fa195b8ea6963af22e8075efb61bb5ff","observation_id":"7f0c9e18-9979-4692-9235-4dffb5f47504","resolution":{"observed_at":"2026-07-04T16:49:58.042075Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-05-25T13:53:26.795347+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T13:53:26.795347+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-08-12T20:32:53.188699Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"cited_work":{"arxiv_id":"2407.11550","doi":"10.48550/arxiv.2407.11550","metadata_source":"pith","pith_arxiv_id":"2407.11550","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","venue":"cs.CL","work_id":"b41eb6db-193f-48ba-8278-6b1698524755","year":2024},"citing_paper":{"arxiv_id":"2606.24467","last_updated":"2026-06-23T11:59:46Z","snapshot_observed_at":"2026-08-18T21:03:31.332486Z","submitted_at":"2026-06-23T11:59:46Z","title":"CompressKV: Semantic-Retrieval-Guided KV-Cache Compression for Resource-Efficient Long-Context LLM Inference","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-26T00:11:57.763089Z"},"links":{"cited_paper":"/paper/2407.11550","citing_paper":"/paper/2606.24467"},"observation_digest":"sha256:a4092965a31d84adb688d23afc09a6e9c115785eda86a77047b70fbf1f65d92f","observation_id":"cdcca5e3-b201-4475-84b2-8babd76b69a8","resolution":{"observed_at":"2026-07-04T16:49:58.039510Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-05-25T13:53:26.442662+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T13:53:26.442662+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T00:11:57.763089Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.24467","last_updated":"2026-06-23T11:59:46Z","snapshot_observed_at":"2026-08-18T21:03:31.332486Z","submitted_at":"2026-06-23T11:59:46Z","title":"CompressKV: Semantic-Retrieval-Guided KV-Cache Compression for Resource-Efficient Long-Context LLM Inference","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-26T00:11:57.763089Z"},"links":{"citing_paper":"/paper/2606.24467"},"observation_digest":"sha256:9c231b0ea49cd3589540f3d6db587e5e6bf5a7b272db1e149b91c91c47b41cfd","observation_id":"2d926237-75ef-4cc0-9cd3-eaec92c1b960","resolution":{"observed_at":"2026-06-26T00:11:57.763089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T00:11:57.763089Z","title":"Zhang, Y","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.24467","last_updated":"2026-06-23T11:59:46Z","snapshot_observed_at":"2026-08-18T21:03:31.332486Z","submitted_at":"2026-06-23T11:59:46Z","title":"CompressKV: Semantic-Retrieval-Guided KV-Cache Compression for Resource-Efficient Long-Context LLM Inference","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-26T00:11:57.763089Z"},"links":{"citing_paper":"/paper/2606.24467"},"observation_digest":"sha256:61202c45d1f0267dbc2a1e2502bc8fd14a43ccd67d6243473ef912e40d4a6d20","observation_id":"4d5d0be6-e42c-4357-9e61-444de75be77d","resolution":{"observed_at":"2026-06-26T00:11:57.763089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T00:11:57.763089Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.24467","last_updated":"2026-06-23T11:59:46Z","snapshot_observed_at":"2026-08-18T21:03:31.332486Z","submitted_at":"2026-06-23T11:59:46Z","title":"CompressKV: Semantic-Retrieval-Guided KV-Cache Compression for Resource-Efficient Long-Context LLM Inference","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-26T00:11:57.763089Z"},"links":{"citing_paper":"/paper/2606.24467"},"observation_digest":"sha256:e048f88134a14dc7d93a6db1d5d1bac18fae1e6cec1e19ac0e1dc1767aafcedb","observation_id":"33567cdf-0ff6-4191-9970-d799ef3abda9","resolution":{"observed_at":"2026-06-26T00:11:57.763089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T00:11:57.763089Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.24467","last_updated":"2026-06-23T11:59:46Z","snapshot_observed_at":"2026-08-18T21:03:31.332486Z","submitted_at":"2026-06-23T11:59:46Z","title":"CompressKV: Semantic-Retrieval-Guided KV-Cache Compression for Resource-Efficient Long-Context LLM Inference","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-26T00:11:57.763089Z"},"links":{"citing_paper":"/paper/2606.24467"},"observation_digest":"sha256:19d21e77fad251db29bd53c4b772121375746f51a279d77d0dff0000e8654ec2","observation_id":"81338119-39bd-47fc-b16b-1fce231afc7f","resolution":{"observed_at":"2026-06-26T00:11:57.763089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T00:11:57.763089Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.24467","last_updated":"2026-06-23T11:59:46Z","snapshot_observed_at":"2026-08-18T21:03:31.332486Z","submitted_at":"2026-06-23T11:59:46Z","title":"CompressKV: Semantic-Retrieval-Guided KV-Cache Compression for Resource-Efficient Long-Context LLM Inference","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-26T00:11:57.763089Z"},"links":{"citing_paper":"/paper/2606.24467"},"observation_digest":"sha256:f35a4cc191eabd08701ba928fd48959f6853f37ecfa84b262a4aef9ed2201b72","observation_id":"13e049c5-6e4f-4053-8fa5-69be06fac3b9","resolution":{"observed_at":"2026-06-26T00:11:57.763089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.11895","last_updated":"2022-09-24T00:43:19Z","snapshot_observed_at":"2026-08-18T21:12:50.808922Z","submitted_at":"2022-09-24T00:43:19Z","title":"In-context Learning and Induction Heads","version":1},"cited_work":{"arxiv_id":"2209.11895","doi":"10.1145/3411763.3451760","metadata_source":"pith","pith_arxiv_id":"2209.11895","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"In-context Learning and Induction Heads","venue":"cs.LG","work_id":"db2b0911-2758-4a2a-99dc-15b14b91bd5e","year":2022},"citing_paper":{"arxiv_id":"2606.24467","last_updated":"2026-06-23T11:59:46Z","snapshot_observed_at":"2026-08-18T21:03:31.332486Z","submitted_at":"2026-06-23T11:59:46Z","title":"CompressKV: Semantic-Retrieval-Guided KV-Cache Compression for Resource-Efficient Long-Context LLM Inference","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-26T00:11:57.763089Z"},"links":{"cited_paper":"/paper/2209.11895","citing_paper":"/paper/2606.24467"},"observation_digest":"sha256:58d5b3e5e902d415ec7906f37d1683fb920c3edcbd2468b6a21e3bcc0b7dcfcb","observation_id":"24e356cb-8a28-4b84-8ee9-47151dc07cd3","resolution":{"observed_at":"2026-07-04T16:49:58.031461Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-05-23T02:23:10.795052+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T02:23:10.795052+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T00:11:57.763089Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.24467","last_updated":"2026-06-23T11:59:46Z","snapshot_observed_at":"2026-08-18T21:03:31.332486Z","submitted_at":"2026-06-23T11:59:46Z","title":"CompressKV: Semantic-Retrieval-Guided KV-Cache Compression for Resource-Efficient Long-Context LLM Inference","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-26T00:11:57.763089Z"},"links":{"citing_paper":"/paper/2606.24467"},"observation_digest":"sha256:86888e30d9eee8475f7bceb605aed497e94be3399a38aab0b83a22edd5bc6426","observation_id":"7c08a395-bf1a-49ed-838e-735220d663a0","resolution":{"observed_at":"2026-06-26T00:11:57.763089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03752","last_updated":"2024-12-23T17:57:29Z","snapshot_observed_at":"2026-08-18T13:58:15.039437Z","submitted_at":"2024-09-05T17:59:12Z","title":"Attention Heads of Large Language Models: A Survey","version":3},"cited_work":{"arxiv_id":"2409.03752","doi":"10.48550/arxiv.2409.03752","metadata_source":"arxiv_reference","pith_arxiv_id":"2409.03752","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Attention heads of large language models: A survey","venue":"arXiv (Cornell University)","work_id":"258f7d02-803f-483c-ba4e-55a1e5fd75cb","year":2024},"citing_paper":{"arxiv_id":"2606.24467","last_updated":"2026-06-23T11:59:46Z","snapshot_observed_at":"2026-08-18T21:03:31.332486Z","submitted_at":"2026-06-23T11:59:46Z","title":"CompressKV: Semantic-Retrieval-Guided KV-Cache Compression for Resource-Efficient Long-Context LLM Inference","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-26T00:11:57.763089Z"},"links":{"cited_paper":"/paper/2409.03752","citing_paper":"/paper/2606.24467"},"observation_digest":"sha256:3995b6e701b349d90db54b1a4874adf922e8aadad57c3666c1e3754b417d1d5a","observation_id":"cc7873b9-9a69-4ffb-8bf2-7ca248dcc20f","resolution":{"observed_at":"2026-07-04T16:49:58.033929Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T00:11:57.763089Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.24467","last_updated":"2026-06-23T11:59:46Z","snapshot_observed_at":"2026-08-18T21:03:31.332486Z","submitted_at":"2026-06-23T11:59:46Z","title":"CompressKV: Semantic-Retrieval-Guided KV-Cache Compression for Resource-Efficient Long-Context LLM Inference","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-26T00:11:57.763089Z"},"links":{"citing_paper":"/paper/2606.24467"},"observation_digest":"sha256:7fd0386628088a3b20cb4cd7fca636dba813ece81f7320d81fc03493cb4da06f","observation_id":"a08b16b2-a9a9-4867-a995-00fcfbe4a800","resolution":{"observed_at":"2026-06-26T00:11:57.763089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T00:11:57.763089Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.24467","last_updated":"2026-06-23T11:59:46Z","snapshot_observed_at":"2026-08-18T21:03:31.332486Z","submitted_at":"2026-06-23T11:59:46Z","title":"CompressKV: Semantic-Retrieval-Guided KV-Cache Compression for Resource-Efficient Long-Context LLM Inference","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-26T00:11:57.763089Z"},"links":{"citing_paper":"/paper/2606.24467"},"observation_digest":"sha256:355b33ee440b8a7f394350467f359633d4aec1f722de10aef796b74b9cfefdfd","observation_id":"8729ed96-5f0a-4d9b-a027-454555b9498e","resolution":{"observed_at":"2026-06-26T00:11:57.763089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T00:11:57.763089Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.24467","last_updated":"2026-06-23T11:59:46Z","snapshot_observed_at":"2026-08-18T21:03:31.332486Z","submitted_at":"2026-06-23T11:59:46Z","title":"CompressKV: Semantic-Retrieval-Guided KV-Cache Compression for Resource-Efficient Long-Context LLM Inference","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-26T00:11:57.763089Z"},"links":{"citing_paper":"/paper/2606.24467"},"observation_digest":"sha256:57b848c966d0f30cf02f0240ab7e28c0fbbdf22a3ddb36b0d995a492c191979d","observation_id":"3443cbb6-d9b8-46e5-923a-70d22af1dae9","resolution":{"observed_at":"2026-06-26T00:11:57.763089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14010","last_updated":"2025-02-19T12:25:02Z","snapshot_observed_at":"2026-08-18T13:49:57.967289Z","submitted_at":"2025-02-19T12:25:02Z","title":"Which Attention Heads Matter for In-Context Learning?","version":1},"cited_work":{"arxiv_id":"2502.14010","doi":"10.48550/arxiv.2502.14010","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.14010","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Which attention heads matter for in-context learning?","venue":"ArXiv.org","work_id":"85830f9c-3133-4082-9c86-22545b6b8f4d","year":2025},"citing_paper":{"arxiv_id":"2606.24467","last_updated":"2026-06-23T11:59:46Z","snapshot_observed_at":"2026-08-18T21:03:31.332486Z","submitted_at":"2026-06-23T11:59:46Z","title":"CompressKV: Semantic-Retrieval-Guided KV-Cache Compression for Resource-Efficient Long-Context LLM Inference","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-26T00:11:57.763089Z"},"links":{"cited_paper":"/paper/2502.14010","citing_paper":"/paper/2606.24467"},"observation_digest":"sha256:b0f15f16a650e14d0db889b057cce90808eb3c26533e9328b798c048c0bd8646","observation_id":"2f9276c2-1721-4d88-bea3-3c653ebbe4fe","resolution":{"observed_at":"2026-07-04T16:49:58.030660Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15891","last_updated":"2024-07-22T01:12:23Z","snapshot_observed_at":"2026-08-16T13:32:18.250431Z","submitted_at":"2024-07-22T01:12:23Z","title":"RazorAttention: Efficient KV Cache Compression Through Retrieval Heads","version":1},"cited_work":{"arxiv_id":"2407.15891","doi":"10.48550/arxiv.2407.15891","metadata_source":"pith","pith_arxiv_id":"2407.15891","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RazorAttention: Efficient KV cache compression through retrieval heads","venue":"cs.LG","work_id":"0e066643-af21-4206-a9bf-da8439d52d13","year":2024},"citing_paper":{"arxiv_id":"2606.24467","last_updated":"2026-06-23T11:59:46Z","snapshot_observed_at":"2026-08-18T21:03:31.332486Z","submitted_at":"2026-06-23T11:59:46Z","title":"CompressKV: Semantic-Retrieval-Guided KV-Cache Compression for Resource-Efficient Long-Context LLM Inference","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-26T00:11:57.763089Z"},"links":{"cited_paper":"/paper/2407.15891","citing_paper":"/paper/2606.24467"},"observation_digest":"sha256:fa84475678347a7079e538d5931de58acd236012526608e65c5574298ad88d57","observation_id":"da331ebc-b840-425a-af55-3348867563e3","resolution":{"observed_at":"2026-07-04T16:49:58.028076Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08825","last_updated":"2024-03-08T02:49:12Z","snapshot_observed_at":"2026-08-19T19:01:45.414641Z","submitted_at":"2023-10-13T02:41:55Z","title":"From CLIP to DINO: Visual Encoders Shout in Multi-modal Large Language Models","version":3},"cited_work":{"arxiv_id":"2310.08825","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.08825","snapshot_observed_at":"2026-07-04T16:49:58.025162Z","title":"From clip to dino: Visual encoders shout in multi-modal large language models","venue":null,"work_id":"ce828e20-c692-4f35-9def-ae30d4d8c488","year":2024},"citing_paper":{"arxiv_id":"2606.24467","last_updated":"2026-06-23T11:59:46Z","snapshot_observed_at":"2026-08-18T21:03:31.332486Z","submitted_at":"2026-06-23T11:59:46Z","title":"CompressKV: Semantic-Retrieval-Guided KV-Cache Compression for Resource-Efficient Long-Context LLM Inference","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-26T00:11:57.763089Z"},"links":{"cited_paper":"/paper/2310.08825","citing_paper":"/paper/2606.24467"},"observation_digest":"sha256:4e7c901146f43838c1a2b149688e13044f6e8c4ddff746b968b35ed34e1edf4c","observation_id":"a31b896d-ed4e-4428-8bb3-3714b9e5800b","resolution":{"observed_at":"2026-07-04T16:49:58.026479Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T00:11:57.763089Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.24467","last_updated":"2026-06-23T11:59:46Z","snapshot_observed_at":"2026-08-18T21:03:31.332486Z","submitted_at":"2026-06-23T11:59:46Z","title":"CompressKV: Semantic-Retrieval-Guided KV-Cache Compression for Resource-Efficient Long-Context LLM Inference","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-26T00:11:57.763089Z"},"links":{"citing_paper":"/paper/2606.24467"},"observation_digest":"sha256:6fb87fa1a954054f8f0c93bb85cb5daf3bb52fb8a1df029a4214fe8c0e0f5074","observation_id":"83395ff6-9e1a-478e-ad13-8686005f2d84","resolution":{"observed_at":"2026-06-26T00:11:57.763089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T00:11:57.763089Z","title":"Kamradt, Needleinahaystack, https://github.com/gkamradt/LLMTest_NeedleInAHaystack, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.24467","last_updated":"2026-06-23T11:59:46Z","snapshot_observed_at":"2026-08-18T21:03:31.332486Z","submitted_at":"2026-06-23T11:59:46Z","title":"CompressKV: Semantic-Retrieval-Guided KV-Cache Compression for Resource-Efficient Long-Context LLM Inference","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-26T00:11:57.763089Z"},"links":{"citing_paper":"/paper/2606.24467"},"observation_digest":"sha256:a9272d7934f3c8e518df57a043024888c62f287e5aa82e979e9e73da5ecd6b5b","observation_id":"18816ac6-2b77-4c89-9f59-bcd679dc6ff6","resolution":{"observed_at":"2026-06-26T00:11:57.763089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T00:11:57.763089Z","title":"Dao, Flashattention-2: Faster attention with better parallelism and work partitioning, in: The Twelfth International Conference on Learning Representations, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.24467","last_updated":"2026-06-23T11:59:46Z","snapshot_observed_at":"2026-08-18T21:03:31.332486Z","submitted_at":"2026-06-23T11:59:46Z","title":"CompressKV: Semantic-Retrieval-Guided KV-Cache Compression for Resource-Efficient Long-Context LLM Inference","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-26T00:11:57.763089Z"},"links":{"citing_paper":"/paper/2606.24467"},"observation_digest":"sha256:70d334f823ebdefbfa0bcd4399248fc985f7527931e27817c32b2eb0fa5b49b5","observation_id":"5787d02d-c279-4a55-9d16-fb257ad763a3","resolution":{"observed_at":"2026-06-26T00:11:57.763089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T00:11:57.763089Z","title":"Jiang, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.24467","last_updated":"2026-06-23T11:59:46Z","snapshot_observed_at":"2026-08-18T21:03:31.332486Z","submitted_at":"2026-06-23T11:59:46Z","title":"CompressKV: Semantic-Retrieval-Guided KV-Cache Compression for Resource-Efficient Long-Context LLM Inference","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-26T00:11:57.763089Z"},"links":{"citing_paper":"/paper/2606.24467"},"observation_digest":"sha256:b6183b9c1cfca4130232796e49e2a5b9305c69d90a3440d9669d8dc55fbeea57","observation_id":"5f655f36-06c5-4b15-895a-e09ed15f658f","resolution":{"observed_at":"2026-06-26T00:11:57.763089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T00:11:57.763089Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.24467","last_updated":"2026-06-23T11:59:46Z","snapshot_observed_at":"2026-08-18T21:03:31.332486Z","submitted_at":"2026-06-23T11:59:46Z","title":"CompressKV: Semantic-Retrieval-Guided KV-Cache Compression for Resource-Efficient Long-Context LLM Inference","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-26T00:11:57.763089Z"},"links":{"citing_paper":"/paper/2606.24467"},"observation_digest":"sha256:0625038800757ba99a819840ed8777efc8783fe338147c4f179d20beedb51e93","observation_id":"38333a1e-4bf2-4285-8410-eb6961e9fada","resolution":{"observed_at":"2026-06-26T00:11:57.763089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.24467","last_updated":"2026-06-23T11:59:46Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-18T21:03:31.332486Z","submitted_at":"2026-06-23T11:59:46Z","title":"CompressKV: Semantic-Retrieval-Guided KV-Cache Compression for Resource-Efficient Long-Context LLM Inference"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":12,"verified_fuzzy":0},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 1 inbound Pith citation observation for arXiv:2606.24467."}