{"as_of":"2026-08-06T23:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ab0b5112d4edadc032d703f55c986559e858faed0a58f259416fc763b232996e","coverage":[{"denominator":81,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":81,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-16T05:21:04.555356Z","state":"measured"},{"denominator":81,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":81,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2602.09725/citation-record","integrity":"/paper/2602.09725/integrity","json":"/paper/2602.09725/citation-record.json","paper":"/paper/2602.09725"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"https://github.com/vllm-project/aibrix","venue":null,"work_id":"d4a00236-b844-4ede-85ea-ca9f8e2c02b4","year":null},"citing_paper":{"arxiv_id":"2602.09725","last_updated":"2026-05-12T14:12:11Z","snapshot_observed_at":"2026-07-06T22:45:15.978102Z","submitted_at":"2026-02-10T12:29:02Z","title":"Efficient Remote KV Cache Reuse with GPU-native Video Codec","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-16T05:21:04.555356Z"},"links":{"citing_paper":"/paper/2602.09725"},"observation_digest":"sha256:c0cbd1cb07fae05e6c627d65e916a334adb09c9f330e98784d695a84bfdb9eaa","observation_id":"16b0dc06-25ab-4d1a-af35-6aa1eb66a78d","resolution":{"observed_at":"2026-05-16T05:22:23.173618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"https://aws.amazon.com/ec2/ instance-types/?nc1=h_ls","venue":null,"work_id":"ea10e8f6-a84e-4631-81c2-5c7dc9090abc","year":null},"citing_paper":{"arxiv_id":"2602.09725","last_updated":"2026-05-12T14:12:11Z","snapshot_observed_at":"2026-07-06T22:45:15.978102Z","submitted_at":"2026-02-10T12:29:02Z","title":"Efficient Remote KV Cache Reuse with GPU-native Video Codec","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-16T05:21:04.555356Z"},"links":{"citing_paper":"/paper/2602.09725"},"observation_digest":"sha256:172974c696a5a7f6e14f515c951088fd21b9a3b5be06fe095122ebfc0c33d176","observation_id":"dea069a6-609e-418c-b942-1c74fd2ee5b4","resolution":{"observed_at":"2026-05-16T05:22:23.124589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"https://gpuopen.com/ advanced-media-framework/","venue":null,"work_id":"56682b7b-4c09-4236-81b1-ed4523068d76","year":null},"citing_paper":{"arxiv_id":"2602.09725","last_updated":"2026-05-12T14:12:11Z","snapshot_observed_at":"2026-07-06T22:45:15.978102Z","submitted_at":"2026-02-10T12:29:02Z","title":"Efficient Remote KV Cache Reuse with GPU-native Video Codec","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-16T05:21:04.555356Z"},"links":{"citing_paper":"/paper/2602.09725"},"observation_digest":"sha256:6dcc4b3091f8ee6a1b269ad64c18b7cce4b7a798a1b4dc91cb67400ebe77f4b9","observation_id":"e3fd3335-166e-499c-a5c8-a064a61f4a71","resolution":{"observed_at":"2026-05-16T05:22:23.206723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"https://www.intel.com/content/ www/us/en/architecture-and-technology/quick-sync-video/ quick-sync-video-installation.html?wapkw=quick%20sync%20video","venue":null,"work_id":"a063cc38-33dd-46c7-a6e0-397572645d7e","year":null},"citing_paper":{"arxiv_id":"2602.09725","last_updated":"2026-05-12T14:12:11Z","snapshot_observed_at":"2026-07-06T22:45:15.978102Z","submitted_at":"2026-02-10T12:29:02Z","title":"Efficient Remote KV Cache Reuse with GPU-native Video Codec","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-16T05:21:04.555356Z"},"links":{"citing_paper":"/paper/2602.09725"},"observation_digest":"sha256:f97051edc35de96ed089205210bc064d2bed640c8fb643be07ef048590c2c1fa","observation_id":"886ed6d6-4035-4621-9a94-d7ccb1d15925","resolution":{"observed_at":"2026-05-16T05:22:23.167702Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"https://developer.nvidia.com/video-codec-sdk","venue":null,"work_id":"acd777e8-1d76-4b5d-b088-c63e90a15aee","year":null},"citing_paper":{"arxiv_id":"2602.09725","last_updated":"2026-05-12T14:12:11Z","snapshot_observed_at":"2026-07-06T22:45:15.978102Z","submitted_at":"2026-02-10T12:29:02Z","title":"Efficient Remote KV Cache Reuse with GPU-native Video Codec","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-16T05:21:04.555356Z"},"links":{"citing_paper":"/paper/2602.09725"},"observation_digest":"sha256:20be4fd7b0278961394c1143d68d4d9efcf88c81c59cddc5a18036236b73e303","observation_id":"daa9268c-7b3b-4f93-a83a-e6ae688ae5e3","resolution":{"observed_at":"2026-05-16T05:22:23.149402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"https://huggingface.co/01-ai/Yi-34B, (Accessed on 02/04/2026)","venue":null,"work_id":"71da7d41-aec8-44d4-ae40-bdb6ddd3e0e9","year":2026},"citing_paper":{"arxiv_id":"2602.09725","last_updated":"2026-05-12T14:12:11Z","snapshot_observed_at":"2026-07-06T22:45:15.978102Z","submitted_at":"2026-02-10T12:29:02Z","title":"Efficient Remote KV Cache Reuse with GPU-native Video Codec","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-16T05:21:04.555356Z"},"links":{"citing_paper":"/paper/2602.09725"},"observation_digest":"sha256:3a58e3d11d961018ff29800e7e1c77eb0656078557b954ce3a10c988e1e74047","observation_id":"145b81ba-1ffa-4656-a596-1f94928ea03e","resolution":{"observed_at":"2026-05-16T05:22:23.164373Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"https://cursor.com, (Accessed on 02/04/2026)","venue":null,"work_id":"ead8509d-2d56-431a-8a33-8664e5c38b88","year":2026},"citing_paper":{"arxiv_id":"2602.09725","last_updated":"2026-05-12T14:12:11Z","snapshot_observed_at":"2026-07-06T22:45:15.978102Z","submitted_at":"2026-02-10T12:29:02Z","title":"Efficient Remote KV Cache Reuse with GPU-native Video Codec","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-16T05:21:04.555356Z"},"links":{"citing_paper":"/paper/2602.09725"},"observation_digest":"sha256:88557b8a912e0536abf97e6fda5e2d1b13c5c62b8b5ad032fcac3c6c7d9d9ddf","observation_id":"bfe42054-dd66-4c44-9eda-48d30fefb8db","resolution":{"observed_at":"2026-05-16T05:22:23.139553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"https://www.ffmpeg.org/, (Accessed on 02/04/2026)","venue":null,"work_id":"da4f4069-61de-4b48-9e77-afbd312c49f5","year":2026},"citing_paper":{"arxiv_id":"2602.09725","last_updated":"2026-05-12T14:12:11Z","snapshot_observed_at":"2026-07-06T22:45:15.978102Z","submitted_at":"2026-02-10T12:29:02Z","title":"Efficient Remote KV Cache Reuse with GPU-native Video Codec","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-16T05:21:04.555356Z"},"links":{"citing_paper":"/paper/2602.09725"},"observation_digest":"sha256:610a293bb80b7eed05d9ce51d3993214ef55143b01b1b1ed4b89b3f6b8c3d964","observation_id":"88544977-f3ca-4af4-9bf7-8cc0fd9c43b4","resolution":{"observed_at":"2026-05-16T05:22:23.152280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"https://gstreamer","venue":null,"work_id":"f455a6d7-b01c-47d7-89e3-aae29415af94","year":2026},"citing_paper":{"arxiv_id":"2602.09725","last_updated":"2026-05-12T14:12:11Z","snapshot_observed_at":"2026-07-06T22:45:15.978102Z","submitted_at":"2026-02-10T12:29:02Z","title":"Efficient Remote KV Cache Reuse with GPU-native Video Codec","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-16T05:21:04.555356Z"},"links":{"citing_paper":"/paper/2602.09725"},"observation_digest":"sha256:f469a745390ebb7f352431a38f1af1c9e907a7f807b55d39d1fabd42627ce1f3","observation_id":"b9f18ed9-c9fb-4629-a897-9235ef199702","resolution":{"observed_at":"2026-05-16T05:22:23.121443Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"https://huggingface.co/ LargeWorldModel/LWM-Text-Chat-1M, (Accessed on 02/04/2026)","venue":null,"work_id":"f83f859a-9344-496e-9eb9-db0d8c98205c","year":2026},"citing_paper":{"arxiv_id":"2602.09725","last_updated":"2026-05-12T14:12:11Z","snapshot_observed_at":"2026-07-06T22:45:15.978102Z","submitted_at":"2026-02-10T12:29:02Z","title":"Efficient Remote KV Cache Reuse with GPU-native Video Codec","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-16T05:21:04.555356Z"},"links":{"citing_paper":"/paper/2602.09725"},"observation_digest":"sha256:7e42264138987ecb5f0b668296d8f7a806c768ec026f0a1145d8c02d3493618e","observation_id":"5a267a88-acd9-4a4e-b9ad-51c31eb0d472","resolution":{"observed_at":"2026-05-16T05:22:23.213402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"https://huggingface.co/ meta-llama/Llama-3.3-70B-Instruct, (Accessed on 02/04/2026)","venue":null,"work_id":"bda5594d-36ae-455d-b925-b9d62c4bb4c8","year":2026},"citing_paper":{"arxiv_id":"2602.09725","last_updated":"2026-05-12T14:12:11Z","snapshot_observed_at":"2026-07-06T22:45:15.978102Z","submitted_at":"2026-02-10T12:29:02Z","title":"Efficient Remote KV Cache Reuse with GPU-native Video Codec","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-16T05:21:04.555356Z"},"links":{"citing_paper":"/paper/2602.09725"},"observation_digest":"sha256:bc2429ec0e4ba968127a53b62e1734f479a1d709dc1e0bf465e2f87ed866791c","observation_id":"50341256-09f7-457f-b0e1-513aeb9ed437","resolution":{"observed_at":"2026-05-16T05:22:23.133594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"https://www.anthropic.com/news/claude-4, (Ac- cessed on 07/14/2025)","venue":null,"work_id":"401b465c-07cf-4867-b4dd-f539166b19a6","year":2025},"citing_paper":{"arxiv_id":"2602.09725","last_updated":"2026-05-12T14:12:11Z","snapshot_observed_at":"2026-07-06T22:45:15.978102Z","submitted_at":"2026-02-10T12:29:02Z","title":"Efficient Remote KV Cache Reuse with GPU-native Video Codec","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-16T05:21:04.555356Z"},"links":{"citing_paper":"/paper/2602.09725"},"observation_digest":"sha256:7c37df44d2940232b3281ff0ef1cd77c304040f492c4ff21b418270f3753ca7a","observation_id":"70d88b88-8b0e-400d-8b5c-543093e823c3","resolution":{"observed_at":"2026-05-16T05:22:23.216595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"https://github.com/LMCache/LMCache, (Accessed on 07/14/2025)","venue":null,"work_id":"0c2edace-23ab-4342-ac29-4d200dff39a6","year":2025},"citing_paper":{"arxiv_id":"2602.09725","last_updated":"2026-05-12T14:12:11Z","snapshot_observed_at":"2026-07-06T22:45:15.978102Z","submitted_at":"2026-02-10T12:29:02Z","title":"Efficient Remote KV Cache Reuse with GPU-native Video Codec","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-16T05:21:04.555356Z"},"links":{"citing_paper":"/paper/2602.09725"},"observation_digest":"sha256:0aad11aac1176bb2ba0d64cdb58b1ce9868e807684a168328268f44385f514fd","observation_id":"7463500e-f9f6-4f72-a982-5daa2a272365","resolution":{"observed_at":"2026-05-16T05:22:23.081024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"https://docs.anthropic.com/ en/release-notes/system-prompts#august-5-2025, (Accessed on 08/05/2025)","venue":null,"work_id":"94349c39-607f-4b0b-a5d6-b5f00ad9f400","year":2025},"citing_paper":{"arxiv_id":"2602.09725","last_updated":"2026-05-12T14:12:11Z","snapshot_observed_at":"2026-07-06T22:45:15.978102Z","submitted_at":"2026-02-10T12:29:02Z","title":"Efficient Remote KV Cache Reuse with GPU-native Video Codec","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-16T05:21:04.555356Z"},"links":{"citing_paper":"/paper/2602.09725"},"observation_digest":"sha256:421043364b600c5740c66155aa882687b63756e20bcefb1d44f1bb27aac5fdc2","observation_id":"f28bebbf-25ab-450e-a47c-bbbc2120d215","resolution":{"observed_at":"2026-05-16T05:22:23.142812Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Taming {Throughput-Latency} tradeoff in {LLM} inference with {Sarathi-Serve}","venue":null,"work_id":"31846b43-6dfd-4e1d-b254-87a59856af24","year":2024},"citing_paper":{"arxiv_id":"2602.09725","last_updated":"2026-05-12T14:12:11Z","snapshot_observed_at":"2026-07-06T22:45:15.978102Z","submitted_at":"2026-02-10T12:29:02Z","title":"Efficient Remote KV Cache Reuse with GPU-native Video Codec","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-16T05:21:04.555356Z"},"links":{"citing_paper":"/paper/2602.09725"},"observation_digest":"sha256:a02982e07bfae637312c29de0b207764bd7dec14b368071bf50233628dedf14b","observation_id":"a332ce39-8548-49f3-ac42-e366a32fd4fe","resolution":{"observed_at":"2026-05-16T05:22:23.136650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"L-eval: Instituting standard- ized evaluation for long context language models","venue":null,"work_id":"1b99868e-174c-4bfc-8748-e040541e06e5","year":2024},"citing_paper":{"arxiv_id":"2602.09725","last_updated":"2026-05-12T14:12:11Z","snapshot_observed_at":"2026-07-06T22:45:15.978102Z","submitted_at":"2026-02-10T12:29:02Z","title":"Efficient Remote KV Cache Reuse with GPU-native Video Codec","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-16T05:21:04.555356Z"},"links":{"citing_paper":"/paper/2602.09725"},"observation_digest":"sha256:28ac3cf95a62591081b4169f15da4cedf7e352a40dc5c26c342fffcdd400f90f","observation_id":"16bb9141-1fe6-4ac9-86c1-ea184d8d94b6","resolution":{"observed_at":"2026-05-16T05:22:23.088146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Longbench v2: Towards deeper understanding and reasoning on realistic long-context multitasks","venue":null,"work_id":"317e85f5-80ab-4247-aa08-9c83e1350edb","year":2025},"citing_paper":{"arxiv_id":"2602.09725","last_updated":"2026-05-12T14:12:11Z","snapshot_observed_at":"2026-07-06T22:45:15.978102Z","submitted_at":"2026-02-10T12:29:02Z","title":"Efficient Remote KV Cache Reuse with GPU-native Video Codec","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-16T05:21:04.555356Z"},"links":{"citing_paper":"/paper/2602.09725"},"observation_digest":"sha256:12591cae58321a0b24838b88e00d10376fb43cd36cf9e00599a545c7ae7ccd86","observation_id":"1a04a44e-f524-4d10-bf81-3e756d3149e6","resolution":{"observed_at":"2026-05-16T05:22:23.241311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":"2004.05150","doi":"10.48550/arxiv.2004.05150","metadata_source":"pith","pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Longformer: The Long-Document Transformer","venue":"cs.CL","work_id":"abea7a44-6668-4de7-aab6-f53a6e5aa088","year":2020},"citing_paper":{"arxiv_id":"2602.09725","last_updated":"2026-05-12T14:12:11Z","snapshot_observed_at":"2026-07-06T22:45:15.978102Z","submitted_at":"2026-02-10T12:29:02Z","title":"Efficient Remote KV Cache Reuse with GPU-native Video Codec","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-16T05:21:04.555356Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2602.09725"},"observation_digest":"sha256:4c51c9f9a5c92a466f8e71e317150fa56cd9dc7ee5229e908934ab948131003f","observation_id":"2d24e5df-0909-4e2e-8829-4b1b957dfb21","resolution":{"observed_at":"2026-05-16T05:22:22.793916Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-12T21:49:59.161233+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T21:49:59.161233+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improving lan- guage models by retrieving from trillions of tokens","venue":null,"work_id":"f49e4f99-960e-49d4-8b23-f08a4ce0cafd","year":2022},"citing_paper":{"arxiv_id":"2602.09725","last_updated":"2026-05-12T14:12:11Z","snapshot_observed_at":"2026-07-06T22:45:15.978102Z","submitted_at":"2026-02-10T12:29:02Z","title":"Efficient Remote KV Cache Reuse with GPU-native Video Codec","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-16T05:21:04.555356Z"},"links":{"citing_paper":"/paper/2602.09725"},"observation_digest":"sha256:6a0d33678e605eb742c6833cea70ac9480e6102a8fd520204f98c7915e40d2fd","observation_id":"30c4df66-ecdd-4a14-a62f-51cd8acff193","resolution":{"observed_at":"2026-05-16T05:22:23.180036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Moe- lightning: High-throughput moe inference on memory-constrained gpus","venue":null,"work_id":"0f06df81-abfe-4220-bd46-dbcb3670e28f","year":2025},"citing_paper":{"arxiv_id":"2602.09725","last_updated":"2026-05-12T14:12:11Z","snapshot_observed_at":"2026-07-06T22:45:15.978102Z","submitted_at":"2026-02-10T12:29:02Z","title":"Efficient Remote KV Cache Reuse with GPU-native Video Codec","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-16T05:21:04.555356Z"},"links":{"citing_paper":"/paper/2602.09725"},"observation_digest":"sha256:bad2d7350e7873537b9a9f335bea916e3648c9dab87c34daa20c17e2a5d42663","observation_id":"95241c4d-399d-412f-baec-58c58ebd7c46","resolution":{"observed_at":"2026-05-16T05:22:23.091507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14312","last_updated":"2025-01-24T08:12:47Z","snapshot_observed_at":"2026-08-05T07:51:51.048261Z","submitted_at":"2025-01-24T08:12:47Z","title":"Locality-aware Fair Scheduling in LLM Serving","version":1},"cited_work":{"arxiv_id":"2501.14312","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.14312","snapshot_observed_at":"2026-07-04T07:29:39.047838Z","title":"Locality-aware fair scheduling in llm serving","venue":null,"work_id":"5062f5cf-3a0d-40d2-90ae-0a968d1c5258","year":2025},"citing_paper":{"arxiv_id":"2602.09725","last_updated":"2026-05-12T14:12:11Z","snapshot_observed_at":"2026-07-06T22:45:15.978102Z","submitted_at":"2026-02-10T12:29:02Z","title":"Efficient Remote KV Cache Reuse with GPU-native Video Codec","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-16T05:21:04.555356Z"},"links":{"cited_paper":"/paper/2501.14312","citing_paper":"/paper/2602.09725"},"observation_digest":"sha256:48f7210970be4968fce52419047d90ab8c47b1fceb7d83ef69fc3dbfafcb53b5","observation_id":"ec7be858-6faa-44cd-9403-22f9a60797da","resolution":{"observed_at":"2026-05-16T05:22:22.829821Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":"2107.03374","doi":"10.48550/arxiv.2107.03374","metadata_source":"pith","pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Evaluating Large Language Models Trained on Code","venue":"cs.LG","work_id":"042493e9-b26f-4b4e-bbde-382072ca9b08","year":2021},"citing_paper":{"arxiv_id":"2602.09725","last_updated":"2026-05-12T14:12:11Z","snapshot_observed_at":"2026-07-06T22:45:15.978102Z","submitted_at":"2026-02-10T12:29:02Z","title":"Efficient Remote KV Cache Reuse with GPU-native Video Codec","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-16T05:21:04.555356Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2602.09725"},"observation_digest":"sha256:615e014b6457764c1921aa7fdba2887190e25c35f87691305f84eac2a6e84602","observation_id":"567c1bd2-f5fa-4467-8056-805f3bbbc3e1","resolution":{"observed_at":"2026-05-16T05:22:22.887472Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":"2507.06261","doi":"10.48550/arxiv.2503.19","metadata_source":"pith","pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-07-11T03:17:51.364436Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","venue":"cs.CL","work_id":"008df105-2fdd-45d8-857a-8e35868aecb6","year":2025},"citing_paper":{"arxiv_id":"2602.09725","last_updated":"2026-05-12T14:12:11Z","snapshot_observed_at":"2026-07-06T22:45:15.978102Z","submitted_at":"2026-02-10T12:29:02Z","title":"Efficient Remote KV Cache Reuse with GPU-native Video Codec","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-16T05:21:04.555356Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2602.09725"},"observation_digest":"sha256:98f699d04fd44dc7eda8bf0b144041f6df48f67a3cdcff977fd1aa3fb31d97f6","observation_id":"614ea6f7-c76e-4745-a97e-a29f13cde320","resolution":{"observed_at":"2026-05-16T05:22:22.892859Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dynamo distributed kv cache manager (nvidia dynamo sdk v0.2.0)","venue":null,"work_id":"bcd97917-dc0b-40ac-b59b-0e1c43f300a4","year":2025},"citing_paper":{"arxiv_id":"2602.09725","last_updated":"2026-05-12T14:12:11Z","snapshot_observed_at":"2026-07-06T22:45:15.978102Z","submitted_at":"2026-02-10T12:29:02Z","title":"Efficient Remote KV Cache Reuse with GPU-native Video Codec","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-16T05:21:04.555356Z"},"links":{"citing_paper":"/paper/2602.09725"},"observation_digest":"sha256:e75307d88a28fb4a631acdf8c719db8b61eb568768a68586079f5a1b1b737110","observation_id":"a648d72c-3d0a-4e5b-b6d0-a0ffe05a45bb","resolution":{"observed_at":"2026-05-16T05:22:23.225697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llm.int8(): 8-bit matrix multiplication for transformers at scale.Ad- vances in neural information processing systems (NeurIPS)","venue":null,"work_id":"b8494c2a-01b8-4cf1-8ff1-74cc176da529","year":2022},"citing_paper":{"arxiv_id":"2602.09725","last_updated":"2026-05-12T14:12:11Z","snapshot_observed_at":"2026-07-06T22:45:15.978102Z","submitted_at":"2026-02-10T12:29:02Z","title":"Efficient Remote KV Cache Reuse with GPU-native Video Codec","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-16T05:21:04.555356Z"},"links":{"citing_paper":"/paper/2602.09725"},"observation_digest":"sha256:ddc90e0dc5f71a74a14e63fc14b7f1e899f06afc211d6effbbaed51b2a3fe30f","observation_id":"2fa5b435-5951-4660-9e16-1018a5ce1714","resolution":{"observed_at":"2026-05-16T05:22:23.210391Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.03215","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T16:48:40.587128Z","title":"arXiv preprint arXiv:2510.03215 (2025)","venue":null,"work_id":"0cfef184-0247-46c6-8538-d059fd0e87b4","year":2025},"citing_paper":{"arxiv_id":"2602.09725","last_updated":"2026-05-12T14:12:11Z","snapshot_observed_at":"2026-07-06T22:45:15.978102Z","submitted_at":"2026-02-10T12:29:02Z","title":"Efficient Remote KV Cache Reuse with GPU-native Video Codec","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-16T05:21:04.555356Z"},"links":{"citing_paper":"/paper/2602.09725"},"observation_digest":"sha256:9161425bea1913bc70ba8eccbfe3d5906f84b6c695233743064ec80bf00d542c","observation_id":"e3f58898-ff02-4e6d-93a3-2df863fba275","resolution":{"observed_at":"2026-05-16T05:22:22.787925Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In18th USENIX Sym- posium on Operating Systems Design and Implementation (OSDI 24), pages 135–153","venue":null,"work_id":"62fae770-530a-4138-bc0c-ffa450927656","year":2024},"citing_paper":{"arxiv_id":"2602.09725","last_updated":"2026-05-12T14:12:11Z","snapshot_observed_at":"2026-07-06T22:45:15.978102Z","submitted_at":"2026-02-10T12:29:02Z","title":"Efficient Remote KV Cache Reuse with GPU-native Video Codec","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-16T05:21:04.555356Z"},"links":{"citing_paper":"/paper/2602.09725"},"observation_digest":"sha256:f059c5e412efe7efc6b68b7b9f4c5baa73f76379473fec96f2a0f4107bbe06a6","observation_id":"eaa49f0c-d138-4300-83cf-0a5869018229","resolution":{"observed_at":"2026-05-16T05:22:23.228885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"{Cost- Efficient} large language model serving for multi-turn conversations with {CachedAttention}","venue":null,"work_id":"c5141def-52e9-4b73-81f4-e52c63fbb9b5","year":2024},"citing_paper":{"arxiv_id":"2602.09725","last_updated":"2026-05-12T14:12:11Z","snapshot_observed_at":"2026-07-06T22:45:15.978102Z","submitted_at":"2026-02-10T12:29:02Z","title":"Efficient Remote KV Cache Reuse with GPU-native Video Codec","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-16T05:21:04.555356Z"},"links":{"citing_paper":"/paper/2602.09725"},"observation_digest":"sha256:3053d3ef06355af3fc2561bcd0c8cea6a4fedae9f9f828b70bb0a834c5e5e4ab","observation_id":"7e51f887-4df5-4016-950a-705822ccc5d7","resolution":{"observed_at":"2026-05-16T05:22:23.183327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fast state restoration in llm serving with hcache","venue":null,"work_id":"4cbc9ace-976a-4d24-b538-51846b2bb1a1","year":2025},"citing_paper":{"arxiv_id":"2602.09725","last_updated":"2026-05-12T14:12:11Z","snapshot_observed_at":"2026-07-06T22:45:15.978102Z","submitted_at":"2026-02-10T12:29:02Z","title":"Efficient Remote KV Cache Reuse with GPU-native Video Codec","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-16T05:21:04.555356Z"},"links":{"citing_paper":"/paper/2602.09725"},"observation_digest":"sha256:83378d2332c0d8134403f5ffc80f3358c77b704369082f45a83febd814049962","observation_id":"a53159e2-8608-4db6-bf4a-446ddfc79123","resolution":{"observed_at":"2026-05-16T05:22:23.170680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04934","last_updated":"2024-04-25T15:45:19Z","snapshot_observed_at":"2026-07-06T16:44:55.494764Z","submitted_at":"2023-11-07T18:17:05Z","title":"Prompt Cache: Modular Attention Reuse for Low-Latency Inference","version":2},"cited_work":{"arxiv_id":"2311.04934","doi":"10.48550/arxiv.2311.04934","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.04934","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Prompt cache: Modular attention reuse for low-latency inference","venue":"arXiv (Cornell University)","work_id":"afbbfafd-6a60-4022-83bf-378314908161","year":2024},"citing_paper":{"arxiv_id":"2602.09725","last_updated":"2026-05-12T14:12:11Z","snapshot_observed_at":"2026-07-06T22:45:15.978102Z","submitted_at":"2026-02-10T12:29:02Z","title":"Efficient Remote KV Cache Reuse with GPU-native Video Codec","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-16T05:21:04.555356Z"},"links":{"cited_paper":"/paper/2311.04934","citing_paper":"/paper/2602.09725"},"observation_digest":"sha256:c99011bd5ff6f20c766bf6a110fcbb332675543c77e158b21c43d7cda6e7dab7","observation_id":"0963909e-d08c-4d8d-a699-ec5caa12d701","resolution":{"observed_at":"2026-05-16T05:22:22.751793Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14527","last_updated":"2024-07-22T10:56:19Z","snapshot_observed_at":"2026-07-06T18:04:00.217896Z","submitted_at":"2024-04-22T18:56:18Z","title":"M\\'elange: Cost Efficient Large Language Model Serving by Exploiting GPU Heterogeneity","version":4},"cited_work":{"arxiv_id":"2404.14527","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.14527","snapshot_observed_at":"2026-07-03T12:48:11.776825Z","title":"M \\’elange: Cost efficient large language model serving by exploiting gpu heterogeneity","venue":null,"work_id":"bc062082-bb69-4c79-9bda-625aac03fada","year":2024},"citing_paper":{"arxiv_id":"2602.09725","last_updated":"2026-05-12T14:12:11Z","snapshot_observed_at":"2026-07-06T22:45:15.978102Z","submitted_at":"2026-02-10T12:29:02Z","title":"Efficient Remote KV Cache Reuse with GPU-native Video Codec","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-16T05:21:04.555356Z"},"links":{"cited_paper":"/paper/2404.14527","citing_paper":"/paper/2602.09725"},"observation_digest":"sha256:39ea2adf4e02f4b9156bf429949737a51976672fe165222d5d39acd4f505b545","observation_id":"c0a2eecc-af91-47a5-88c0-6e4ffbf90283","resolution":{"observed_at":"2026-05-16T05:22:22.819213Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14196","last_updated":"2024-01-26T09:23:11Z","snapshot_observed_at":"2026-08-06T22:40:28.707813Z","submitted_at":"2024-01-25T14:17:53Z","title":"DeepSeek-Coder: When the Large Language Model Meets Programming -- The Rise of Code Intelligence","version":2},"cited_work":{"arxiv_id":"2401.14196","doi":"10.48550/arxiv.2401.14196","metadata_source":"pith","pith_arxiv_id":"2401.14196","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-Coder: When the Large Language Model Meets Programming -- The Rise of Code Intelligence","venue":"cs.SE","work_id":"f22dae5a-27e2-41d0-a061-c4286418dee3","year":2024},"citing_paper":{"arxiv_id":"2602.09725","last_updated":"2026-05-12T14:12:11Z","snapshot_observed_at":"2026-07-06T22:45:15.978102Z","submitted_at":"2026-02-10T12:29:02Z","title":"Efficient Remote KV Cache Reuse with GPU-native Video Codec","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-16T05:21:04.555356Z"},"links":{"cited_paper":"/paper/2401.14196","citing_paper":"/paper/2602.09725"},"observation_digest":"sha256:55dcd046a142ad6e5a377c1537d5be69fc17e50466789266d363991cf9277175","observation_id":"eeda7cff-0e9c-496d-8e8c-669ae375bfd2","resolution":{"observed_at":"2026-05-16T05:22:22.813297Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-11T06:20:38.664414+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T06:20:38.664414+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Metagpt: Meta programming for a multi-agent collab- orative framework","venue":null,"work_id":"ce40acf8-e7ae-478f-ba08-bb4e768724ac","year":2023},"citing_paper":{"arxiv_id":"2602.09725","last_updated":"2026-05-12T14:12:11Z","snapshot_observed_at":"2026-07-06T22:45:15.978102Z","submitted_at":"2026-02-10T12:29:02Z","title":"Efficient Remote KV Cache Reuse with GPU-native Video Codec","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-16T05:21:04.555356Z"},"links":{"citing_paper":"/paper/2602.09725"},"observation_digest":"sha256:d833fe9ca89a6c6312dcb288c42d8d3f40b996d9ea588896420d64bc16d643e9","observation_id":"45f92272-9686-4023-b9f4-62d136b0e0bf","resolution":{"observed_at":"2026-05-16T05:22:23.102436Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kvquant: Towards 10 million context length llm inference with kv cache quanti- zation.Advances in Neural Information Processing Systems (NeurIPS), 37:1270–1303","venue":null,"work_id":"b549353a-13e1-427d-a79e-2c287aff00db","year":2024},"citing_paper":{"arxiv_id":"2602.09725","last_updated":"2026-05-12T14:12:11Z","snapshot_observed_at":"2026-07-06T22:45:15.978102Z","submitted_at":"2026-02-10T12:29:02Z","title":"Efficient Remote KV Cache Reuse with GPU-native Video Codec","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-16T05:21:04.555356Z"},"links":{"citing_paper":"/paper/2602.09725"},"observation_digest":"sha256:b90f30ad68f9d46b246ae2315723992c50a0eb7f2b05879685c2a6af107987c1","observation_id":"8974ef50-d1c1-4ec2-8af2-5059d1492dfc","resolution":{"observed_at":"2026-05-16T05:22:23.193754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17565","last_updated":"2024-12-21T13:55:49Z","snapshot_observed_at":"2026-07-06T18:36:42.830927Z","submitted_at":"2024-06-25T14:02:08Z","title":"MemServe: Context Caching for Disaggregated LLM Serving with Elastic Memory Pool","version":3},"cited_work":{"arxiv_id":"2406.17565","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.17565","snapshot_observed_at":"2026-07-04T09:39:46.803577Z","title":"Memserve: Con- text caching for disaggregated llm serving with elastic memory pool.arXiv preprint arXiv:2406.17565","venue":null,"work_id":"51c7ec72-def3-42da-9410-c0152debc67f","year":2024},"citing_paper":{"arxiv_id":"2602.09725","last_updated":"2026-05-12T14:12:11Z","snapshot_observed_at":"2026-07-06T22:45:15.978102Z","submitted_at":"2026-02-10T12:29:02Z","title":"Efficient Remote KV Cache Reuse with GPU-native Video Codec","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-16T05:21:04.555356Z"},"links":{"cited_paper":"/paper/2406.17565","citing_paper":"/paper/2602.09725"},"observation_digest":"sha256:59c424704a87d718aca05dde36456196a6db2f7b48bb681e6d734946beeb77c9","observation_id":"47bd091b-30b8-416a-a99f-bbff14be2f8f","resolution":{"observed_at":"2026-05-16T05:22:22.835574Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Accelerating llm serving for multi- turn dialogues with efficient resource management","venue":null,"work_id":"c46e64af-31e0-42ad-b16f-836e3fecfffe","year":2025},"citing_paper":{"arxiv_id":"2602.09725","last_updated":"2026-05-12T14:12:11Z","snapshot_observed_at":"2026-07-06T22:45:15.978102Z","submitted_at":"2026-02-10T12:29:02Z","title":"Efficient Remote KV Cache Reuse with GPU-native Video Codec","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-16T05:21:04.555356Z"},"links":{"citing_paper":"/paper/2602.09725"},"observation_digest":"sha256:8ee448dff3a19d1e91dfe1003d70d90cbe1565372b1ba5bcc46bf17154ab4fc1","observation_id":"589b64f2-1f67-4ac8-a289-76ca53d075eb","resolution":{"observed_at":"2026-05-16T05:22:23.130640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Efficient kv cache spillover management on memory-constrained gpu for llm inference.IEEE Transactions on Parallel and Distributed Systems, 37(1):90–105","venue":null,"work_id":"a081e953-65cc-41c5-8795-e3ee3d686c95","year":2025},"citing_paper":{"arxiv_id":"2602.09725","last_updated":"2026-05-12T14:12:11Z","snapshot_observed_at":"2026-07-06T22:45:15.978102Z","submitted_at":"2026-02-10T12:29:02Z","title":"Efficient Remote KV Cache Reuse with GPU-native Video Codec","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-16T05:21:04.555356Z"},"links":{"citing_paper":"/paper/2602.09725"},"observation_digest":"sha256:7ec4eef2940f6b3371b766db4ec0686249c80ae35cd8bb0abc8f883e1eaaa234","observation_id":"d444ba08-02db-4664-8dfd-df17a1634937","resolution":{"observed_at":"2026-05-16T05:22:23.105825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"De- mystifying cost-efficiency in llm serving over heterogeneous gpus","venue":null,"work_id":"5154cd9b-edc4-413a-97c1-9171efce530d","year":2025},"citing_paper":{"arxiv_id":"2602.09725","last_updated":"2026-05-12T14:12:11Z","snapshot_observed_at":"2026-07-06T22:45:15.978102Z","submitted_at":"2026-02-10T12:29:02Z","title":"Efficient Remote KV Cache Reuse with GPU-native Video Codec","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-16T05:21:04.555356Z"},"links":{"citing_paper":"/paper/2602.09725"},"observation_digest":"sha256:ac415e7800e335526387d203197ae0639379da7438fa885144c8fa225e60434b","observation_id":"a5d1a4ba-4053-429c-9b86-4183c040b589","resolution":{"observed_at":"2026-05-16T05:22:23.127724Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12457","last_updated":"2024-04-25T06:47:57Z","snapshot_observed_at":"2026-08-04T11:37:57.333392Z","submitted_at":"2024-04-18T18:32:30Z","title":"RAGCache: Efficient Knowledge Caching for Retrieval-Augmented Generation","version":2},"cited_work":{"arxiv_id":"2404.12457","doi":"10.48550/arxiv.2404.12457","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.12457","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ragcache: Efficient knowledge caching for retrieval-augmented generation","venue":"arXiv (Cornell University)","work_id":"523a200c-2c73-4aa8-ba74-008f0cb52fa2","year":2024},"citing_paper":{"arxiv_id":"2602.09725","last_updated":"2026-05-12T14:12:11Z","snapshot_observed_at":"2026-07-06T22:45:15.978102Z","submitted_at":"2026-02-10T12:29:02Z","title":"Efficient Remote KV Cache Reuse with GPU-native Video Codec","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-16T05:21:04.555356Z"},"links":{"cited_paper":"/paper/2404.12457","citing_paper":"/paper/2602.09725"},"observation_digest":"sha256:b1b48cdafee0474e021a0bab15ed097ae0bb488c13c818c4940469d27cf63759","observation_id":"aaef1185-2944-46aa-a466-43a06277731e","resolution":{"observed_at":"2026-05-16T05:22:22.800333Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":"72606afa-6999-4b05-9ba1-30c8ebc19895","year":2023},"citing_paper":{"arxiv_id":"2602.09725","last_updated":"2026-05-12T14:12:11Z","snapshot_observed_at":"2026-07-06T22:45:15.978102Z","submitted_at":"2026-02-10T12:29:02Z","title":"Efficient Remote KV Cache Reuse with GPU-native Video Codec","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-16T05:21:04.555356Z"},"links":{"citing_paper":"/paper/2602.09725"},"observation_digest":"sha256:4287997f85375af86e14bfb8acedfe0587d4fe0d8bfe420f3c5f4c3c73c0402f","observation_id":"444be752-dc4d-438e-80ba-f0b259a576f9","resolution":{"observed_at":"2026-05-16T05:22:23.155312Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Robomemory: A brain-inspired multi-memory agentic framework for lifelong learning in physical embodied systems","venue":null,"work_id":"9146b278-b3c2-4237-9d0f-becd2098e34a","year":2025},"citing_paper":{"arxiv_id":"2602.09725","last_updated":"2026-05-12T14:12:11Z","snapshot_observed_at":"2026-07-06T22:45:15.978102Z","submitted_at":"2026-02-10T12:29:02Z","title":"Efficient Remote KV Cache Reuse with GPU-native Video Codec","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-16T05:21:04.555356Z"},"links":{"citing_paper":"/paper/2602.09725"},"observation_digest":"sha256:912c85309adcb42d946d64ab394c470f3d202b9466d1e801ab60fff2a683f5d7","observation_id":"f0efd002-92e0-498a-89f4-640e8b124f82","resolution":{"observed_at":"2026-05-16T05:22:23.095917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.27656","last_updated":"2026-04-13T17:38:54Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-31T17:28:22Z","title":"fabric-lib: RDMA Point-to-Point Communication for LLM Systems","version":2},"cited_work":{"arxiv_id":"2510.27656","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.27656","snapshot_observed_at":"2026-07-01T21:56:15.741851Z","title":"fabric-lib: RDMA Point-to-Point Communication for LLM Systems","venue":"cs.DC","work_id":"826f48b9-c7d3-4ce6-aa7f-41cc479ba92e","year":2025},"citing_paper":{"arxiv_id":"2602.09725","last_updated":"2026-05-12T14:12:11Z","snapshot_observed_at":"2026-07-06T22:45:15.978102Z","submitted_at":"2026-02-10T12:29:02Z","title":"Efficient Remote KV Cache Reuse with GPU-native Video Codec","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-16T05:21:04.555356Z"},"links":{"cited_paper":"/paper/2510.27656","citing_paper":"/paper/2602.09725"},"observation_digest":"sha256:22ca01899e59f5e6e780f6c04f686a6d0a741e67d87285caacd89e39d35f6bc4","observation_id":"2ba173be-c2d4-4f9f-9a69-969fbc338cac","resolution":{"observed_at":"2026-05-16T05:22:22.734761Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02669","last_updated":"2024-07-04T15:12:54Z","snapshot_observed_at":"2026-07-06T17:11:55.112404Z","submitted_at":"2024-01-05T06:53:00Z","title":"Infinite-LLM: Efficient LLM Service for Long Context with DistAttention and Distributed KVCache","version":2},"cited_work":{"arxiv_id":"2401.02669","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.02669","snapshot_observed_at":"2026-07-04T09:39:46.796077Z","title":"Infinite-llm: Efficient llm service for long context with distattention and distributed kvcache","venue":null,"work_id":"e075e559-850d-40cb-9934-6995d4bf4c06","year":2024},"citing_paper":{"arxiv_id":"2602.09725","last_updated":"2026-05-12T14:12:11Z","snapshot_observed_at":"2026-07-06T22:45:15.978102Z","submitted_at":"2026-02-10T12:29:02Z","title":"Efficient Remote KV Cache Reuse with GPU-native Video Codec","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-16T05:21:04.555356Z"},"links":{"cited_paper":"/paper/2401.02669","citing_paper":"/paper/2602.09725"},"observation_digest":"sha256:67e5878e51148ef252dd29c24d8a4ef70bedfea839d76dd5efe5f73f7e1a4db6","observation_id":"da0b93bd-fe80-43ac-b4df-b32a3ef2febc","resolution":{"observed_at":"2026-05-16T05:22:22.746402Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Parrot: Efficient serving of {LLM- based} applications with semantic variable","venue":null,"work_id":"754eb658-b569-498c-b949-97c162897a90","year":2024},"citing_paper":{"arxiv_id":"2602.09725","last_updated":"2026-05-12T14:12:11Z","snapshot_observed_at":"2026-07-06T22:45:15.978102Z","submitted_at":"2026-02-10T12:29:02Z","title":"Efficient Remote KV Cache Reuse with GPU-native Video Codec","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-16T05:21:04.555356Z"},"links":{"citing_paper":"/paper/2602.09725"},"observation_digest":"sha256:ad01a4aba24f51596f7507f07fd0f6a7773697b1502956790b18c09437d2edb2","observation_id":"9931bd86-5c74-4e87-a399-d56e8b1d0925","resolution":{"observed_at":"2026-05-16T05:22:23.238170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.11917","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T03:06:43.707322Z","title":"Onetwovla: A unified vision-language-action model with adaptive reasoning","venue":null,"work_id":"97bcd591-f890-454c-94ea-62b1d81cf31e","year":2025},"citing_paper":{"arxiv_id":"2602.09725","last_updated":"2026-05-12T14:12:11Z","snapshot_observed_at":"2026-07-06T22:45:15.978102Z","submitted_at":"2026-02-10T12:29:02Z","title":"Efficient Remote KV Cache Reuse with GPU-native Video Codec","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-16T05:21:04.555356Z"},"links":{"citing_paper":"/paper/2602.09725"},"observation_digest":"sha256:40667580faeab6535e584718ddefcbf04d6f04fc50a0b12e891ddc26d6de269f","observation_id":"3d4b8d82-e24c-43cf-b841-26eb029c6102","resolution":{"observed_at":"2026-05-16T05:22:22.870988Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cachegen: Kv cache compression and streaming for fast large language model serving","venue":null,"work_id":"057289d3-6867-49e4-a798-2f054b8c19b3","year":2024},"citing_paper":{"arxiv_id":"2602.09725","last_updated":"2026-05-12T14:12:11Z","snapshot_observed_at":"2026-07-06T22:45:15.978102Z","submitted_at":"2026-02-10T12:29:02Z","title":"Efficient Remote KV Cache Reuse with GPU-native Video Codec","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-16T05:21:04.555356Z"},"links":{"citing_paper":"/paper/2602.09725"},"observation_digest":"sha256:a41dbf337840435e095f0a1dd83d09a41a9ead9fe6caf660daa8fb7999d0ddb7","observation_id":"3b1c03a8-84d9-4c24-b10a-2dad4910ebb4","resolution":{"observed_at":"2026-05-16T05:22:23.203197Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02750","last_updated":"2024-07-25T09:16:05Z","snapshot_observed_at":"2026-07-06T17:25:18.238343Z","submitted_at":"2024-02-05T06:06:47Z","title":"KIVI: A Tuning-Free Asymmetric 2bit Quantization for KV Cache","version":2},"cited_work":{"arxiv_id":"2402.02750","doi":"10.48550/arxiv.2402.02750","metadata_source":"pith","pith_arxiv_id":"2402.02750","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"KIVI: A Tuning-Free Asymmetric 2bit Quantization for KV Cache","venue":"cs.CL","work_id":"735737c3-24e5-41c3-ab4f-04edcb36731c","year":2024},"citing_paper":{"arxiv_id":"2602.09725","last_updated":"2026-05-12T14:12:11Z","snapshot_observed_at":"2026-07-06T22:45:15.978102Z","submitted_at":"2026-02-10T12:29:02Z","title":"Efficient Remote KV Cache Reuse with GPU-native Video Codec","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-16T05:21:04.555356Z"},"links":{"cited_paper":"/paper/2402.02750","citing_paper":"/paper/2602.09725"},"observation_digest":"sha256:a0f612d59ac914245e2c2ef4376f67050a42783943349be5832fb88da921b8df","observation_id":"40db504b-8c33-481f-954a-cbad20b45977","resolution":{"observed_at":"2026-05-16T05:22:22.806239Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sky- serve: Serving ai models across regions and clouds with spot instances","venue":null,"work_id":"748bc890-05ab-40e5-9d91-6283eb8104f4","year":2025},"citing_paper":{"arxiv_id":"2602.09725","last_updated":"2026-05-12T14:12:11Z","snapshot_observed_at":"2026-07-06T22:45:15.978102Z","submitted_at":"2026-02-10T12:29:02Z","title":"Efficient Remote KV Cache Reuse with GPU-native Video Codec","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-16T05:21:04.555356Z"},"links":{"citing_paper":"/paper/2602.09725"},"observation_digest":"sha256:df8b8eb8c1d674a24145c83ab633264a9660735f8cff0ec09000e7b6c5a1aab2","observation_id":"de4ab9a6-4c5d-4870-967f-76bf61ebfb02","resolution":{"observed_at":"2026-05-16T05:22:23.112260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Helix: Serving large language models over heterogeneous gpus and network via max-flow","venue":null,"work_id":"5a726fe6-bd41-4d61-aace-a9e17901b323","year":2025},"citing_paper":{"arxiv_id":"2602.09725","last_updated":"2026-05-12T14:12:11Z","snapshot_observed_at":"2026-07-06T22:45:15.978102Z","submitted_at":"2026-02-10T12:29:02Z","title":"Efficient Remote KV Cache Reuse with GPU-native Video Codec","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-16T05:21:04.555356Z"},"links":{"citing_paper":"/paper/2602.09725"},"observation_digest":"sha256:6114f7a831321b2b4a3f34b2a34b2f58684993c7ef3d58339651017a2da92797","observation_id":"88b1fc74-c64e-4e3d-b7ed-56c0522653bf","resolution":{"observed_at":"2026-05-16T05:22:23.186493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Spotserve: Serving generative large language models on preemptible instances","venue":null,"work_id":"d6a64671-3f82-4c88-99ba-c64de3a79246","year":2024},"citing_paper":{"arxiv_id":"2602.09725","last_updated":"2026-05-12T14:12:11Z","snapshot_observed_at":"2026-07-06T22:45:15.978102Z","submitted_at":"2026-02-10T12:29:02Z","title":"Efficient Remote KV Cache Reuse with GPU-native Video Codec","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-16T05:21:04.555356Z"},"links":{"citing_paper":"/paper/2602.09725"},"observation_digest":"sha256:233909e7c7eb5825bfdd6f01391046a45467a9b8c21486e699724ba66b140da8","observation_id":"0b396630-4092-4376-8719-aa3068bd1fbc","resolution":{"observed_at":"2026-05-16T05:22:23.244109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04992","last_updated":"2024-09-08T06:06:44Z","snapshot_observed_at":"2026-08-03T16:41:00.102590Z","submitted_at":"2024-09-08T06:06:44Z","title":"InstInfer: In-Storage Attention Offloading for Cost-Effective Long-Context LLM Inference","version":1},"cited_work":{"arxiv_id":"2409.04992","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.04992","snapshot_observed_at":"2026-07-03T15:08:33.737665Z","title":"Instinfer: In-storage at- tention offloading for cost-effective long-context llm inference","venue":null,"work_id":"fe50b7f0-ebe7-4b19-a1f6-3acb32599f28","year":2024},"citing_paper":{"arxiv_id":"2602.09725","last_updated":"2026-05-12T14:12:11Z","snapshot_observed_at":"2026-07-06T22:45:15.978102Z","submitted_at":"2026-02-10T12:29:02Z","title":"Efficient Remote KV Cache Reuse with GPU-native Video Codec","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-16T05:21:04.555356Z"},"links":{"cited_paper":"/paper/2409.04992","citing_paper":"/paper/2602.09725"},"observation_digest":"sha256:0b6a25b4a167cfb249eb9e1040c29e09b4227bf9a794372081d80d65fa25a822","observation_id":"da8dd679-23b6-47f7-b5a0-7e1daeef5325","resolution":{"observed_at":"2026-05-16T05:22:22.775393Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llmlingua-2: Data distillation for efficient and faithful task-agnostic prompt compression","venue":null,"work_id":"fc607d86-9d9b-4408-b50e-5336ef7e9bd1","year":2024},"citing_paper":{"arxiv_id":"2602.09725","last_updated":"2026-05-12T14:12:11Z","snapshot_observed_at":"2026-07-06T22:45:15.978102Z","submitted_at":"2026-02-10T12:29:02Z","title":"Efficient Remote KV Cache Reuse with GPU-native Video Codec","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-16T05:21:04.555356Z"},"links":{"citing_paper":"/paper/2602.09725"},"observation_digest":"sha256:7e00f2dbaa1ff05f53b0e9c3da269a5cc52e03a0ef8dc8aa18be5457c5cd57f8","observation_id":"b1be52ca-d1ad-4165-aa3d-c9a04788717f","resolution":{"observed_at":"2026-05-16T05:22:23.196968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.07924","last_updated":"2024-06-05T13:23:49Z","snapshot_observed_at":"2026-07-06T15:54:28.831510Z","submitted_at":"2023-07-16T02:11:34Z","title":"ChatDev: Communicative Agents for Software Development","version":5},"cited_work":{"arxiv_id":"2307.07924","doi":"10.48550/arxiv.2307.07924","metadata_source":"pith","pith_arxiv_id":"2307.07924","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ChatDev: Communicative Agents for Software Development","venue":"cs.SE","work_id":"5d8a3650-ab78-4991-b0d3-5309b59c690f","year":2023},"citing_paper":{"arxiv_id":"2602.09725","last_updated":"2026-05-12T14:12:11Z","snapshot_observed_at":"2026-07-06T22:45:15.978102Z","submitted_at":"2026-02-10T12:29:02Z","title":"Efficient Remote KV Cache Reuse with GPU-native Video Codec","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-16T05:21:04.555356Z"},"links":{"cited_paper":"/paper/2307.07924","citing_paper":"/paper/2602.09725"},"observation_digest":"sha256:d457c0ac9008ac3be43defa6c7840e1cec88a875cb6e372129277620ae378c40","observation_id":"04a6d11d-bb54-4a54-b13d-b5accdc00b3a","resolution":{"observed_at":"2026-05-16T05:22:22.876576Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mooncake: Trading more storage for less computation — a KVCache-centric ar- chitecture for serving LLM chatbot","venue":null,"work_id":"97106434-db76-4dd2-8ed5-2e849eba6961","year":2025},"citing_paper":{"arxiv_id":"2602.09725","last_updated":"2026-05-12T14:12:11Z","snapshot_observed_at":"2026-07-06T22:45:15.978102Z","submitted_at":"2026-02-10T12:29:02Z","title":"Efficient Remote KV Cache Reuse with GPU-native Video Codec","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-16T05:21:04.555356Z"},"links":{"citing_paper":"/paper/2602.09725"},"observation_digest":"sha256:563b78b6a95d97a7e6d1f1f189f0daf1c9dc61beda4d7abea945bb8c84ec9246","observation_id":"d196fdc6-70d5-4ee0-b1cb-d0396b260e33","resolution":{"observed_at":"2026-05-16T05:22:23.222898Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12950","last_updated":"2024-01-31T19:47:26Z","snapshot_observed_at":"2026-07-06T16:10:07.931347Z","submitted_at":"2023-08-24T17:39:13Z","title":"Code Llama: Open Foundation Models for Code","version":3},"cited_work":{"arxiv_id":"2308.12950","doi":"10.48550/arxiv.2308.12950","metadata_source":"pith","pith_arxiv_id":"2308.12950","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Code Llama: Open Foundation Models for Code","venue":"cs.CL","work_id":"e73bffa4-7620-47ac-9327-259a60db52ca","year":2023},"citing_paper":{"arxiv_id":"2602.09725","last_updated":"2026-05-12T14:12:11Z","snapshot_observed_at":"2026-07-06T22:45:15.978102Z","submitted_at":"2026-02-10T12:29:02Z","title":"Efficient Remote KV Cache Reuse with GPU-native Video Codec","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-16T05:21:04.555356Z"},"links":{"cited_paper":"/paper/2308.12950","citing_paper":"/paper/2602.09725"},"observation_digest":"sha256:27359b2d347e25e78a2281a59d9d23ebba14239b8b5a831a3218b03d7e943cd7","observation_id":"0776aa80-46d5-430c-9654-fecfcdbe81d7","resolution":{"observed_at":"2026-05-16T05:22:22.853630Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-09T08:48:36.742994+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T08:48:36.742994+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19236","last_updated":"2026-01-30T13:36:22Z","snapshot_observed_at":"2026-07-06T22:19:00.152099Z","submitted_at":"2025-08-26T17:57:16Z","title":"MemoryVLA: Perceptual-Cognitive Memory in Vision-Language-Action Models for Robotic Manipulation","version":2},"cited_work":{"arxiv_id":"2508.19236","doi":"10.48550/arxiv.2508.19236","metadata_source":"pith","pith_arxiv_id":"2508.19236","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MemoryVLA: Perceptual-Cognitive Memory in Vision-Language-Action Models for Robotic Manipulation","venue":"cs.RO","work_id":"921d4c77-1e8b-489d-987a-1c0c990e5ce8","year":2025},"citing_paper":{"arxiv_id":"2602.09725","last_updated":"2026-05-12T14:12:11Z","snapshot_observed_at":"2026-07-06T22:45:15.978102Z","submitted_at":"2026-02-10T12:29:02Z","title":"Efficient Remote KV Cache Reuse with GPU-native Video Codec","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-16T05:21:04.555356Z"},"links":{"cited_paper":"/paper/2508.19236","citing_paper":"/paper/2602.09725"},"observation_digest":"sha256:de768cd6989728a0c95e51b3ddd864f6520be8cfb8025b891096c9f9d32b4919","observation_id":"edaeb9ba-f87c-40b8-843d-63fab71702a7","resolution":{"observed_at":"2026-05-16T05:22:22.847893Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00023","last_updated":"2024-10-03T17:50:33Z","snapshot_observed_at":"2026-08-03T09:39:42.593902Z","submitted_at":"2024-05-08T06:30:58Z","title":"Preble: Efficient Distributed Prompt Scheduling for LLM Serving","version":2},"cited_work":{"arxiv_id":"2407.00023","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.00023","snapshot_observed_at":"2026-07-04T07:29:39.037995Z","title":"Preble: Efficient distributed prompt scheduling for llm serving","venue":null,"work_id":"45a8cada-404f-4cf6-9898-5ebe00e923af","year":2024},"citing_paper":{"arxiv_id":"2602.09725","last_updated":"2026-05-12T14:12:11Z","snapshot_observed_at":"2026-07-06T22:45:15.978102Z","submitted_at":"2026-02-10T12:29:02Z","title":"Efficient Remote KV Cache Reuse with GPU-native Video Codec","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-16T05:21:04.555356Z"},"links":{"cited_paper":"/paper/2407.00023","citing_paper":"/paper/2602.09725"},"observation_digest":"sha256:9e3167e63ef9d025cb9612e25580629a104a2150333f4e5e8f1f4f67e8311d86","observation_id":"80d92b4e-2a3b-48e4-896d-9da1d4791dab","resolution":{"observed_at":"2026-05-16T05:22:22.865185Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Déjàvu: Kv-cache streaming for fast, fault-tolerant generative llm serving","venue":null,"work_id":"7c40541b-efef-42d0-a9f9-b1f1308fff67","year":2024},"citing_paper":{"arxiv_id":"2602.09725","last_updated":"2026-05-12T14:12:11Z","snapshot_observed_at":"2026-07-06T22:45:15.978102Z","submitted_at":"2026-02-10T12:29:02Z","title":"Efficient Remote KV Cache Reuse with GPU-native Video Codec","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-16T05:21:04.555356Z"},"links":{"citing_paper":"/paper/2602.09725"},"observation_digest":"sha256:fbf9fe055afc3e40b2e371dee4f6613b1b8eaa612340bb5adbcf9ad4625bef1b","observation_id":"73f9dbaf-db55-4583-a641-b1285cbd8d41","resolution":{"observed_at":"2026-05-16T05:22:23.109078Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Overview of the high efficiency video coding (hevc) standard.IEEE Transactions on circuits and systems for video technology, 22(12):1649– 1668","venue":null,"work_id":"05284449-1734-4cf4-8499-5c0bba0c7b17","year":2012},"citing_paper":{"arxiv_id":"2602.09725","last_updated":"2026-05-12T14:12:11Z","snapshot_observed_at":"2026-07-06T22:45:15.978102Z","submitted_at":"2026-02-10T12:29:02Z","title":"Efficient Remote KV Cache Reuse with GPU-native Video Codec","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-16T05:21:04.555356Z"},"links":{"citing_paper":"/paper/2602.09725"},"observation_digest":"sha256:ecf951d3195b34d094c8a73524bd7a51ed9e966e89030854d93ab5511ebff93f","observation_id":"c467e934-24af-45f1-bda0-9945043202ea","resolution":{"observed_at":"2026-05-16T05:22:23.115279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llumnix: Dynamic scheduling for large language model serving","venue":null,"work_id":"3f1df2ff-4ee5-4926-98c9-019d66eb8e0d","year":2024},"citing_paper":{"arxiv_id":"2602.09725","last_updated":"2026-05-12T14:12:11Z","snapshot_observed_at":"2026-07-06T22:45:15.978102Z","submitted_at":"2026-02-10T12:29:02Z","title":"Efficient Remote KV Cache Reuse with GPU-native Video Codec","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-16T05:21:04.555356Z"},"links":{"citing_paper":"/paper/2602.09725"},"observation_digest":"sha256:0e7682a0db940f6af2f42973eb0aff41558f900f2251befff22d568c309961db","observation_id":"e09c6b35-6379-405f-bd33-d46117d8d38b","resolution":{"observed_at":"2026-05-16T05:22:23.235126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Quest: Query-aware sparsity for efficient long-context llm inference","venue":null,"work_id":"f9a48ca8-545e-4699-a7c9-94bdc974671c","year":2024},"citing_paper":{"arxiv_id":"2602.09725","last_updated":"2026-05-12T14:12:11Z","snapshot_observed_at":"2026-07-06T22:45:15.978102Z","submitted_at":"2026-02-10T12:29:02Z","title":"Efficient Remote KV Cache Reuse with GPU-native Video Codec","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-16T05:21:04.555356Z"},"links":{"citing_paper":"/paper/2602.09725"},"observation_digest":"sha256:8db54728d7a2d268738f56f4cb16f7adea3aa6f9e65b4950cedd349113600c53","observation_id":"c50e5ae4-3a50-491d-bba8-d258b56d7e75","resolution":{"observed_at":"2026-05-16T05:22:23.099299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tetrisched: global reschedul- ing with adaptive plan-ahead in dynamic heterogeneous clusters","venue":null,"work_id":"d3f7285e-ad91-4c47-b2f6-bc808ae78364","year":2016},"citing_paper":{"arxiv_id":"2602.09725","last_updated":"2026-05-12T14:12:11Z","snapshot_observed_at":"2026-07-06T22:45:15.978102Z","submitted_at":"2026-02-10T12:29:02Z","title":"Efficient Remote KV Cache Reuse with GPU-native Video Codec","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-16T05:21:04.555356Z"},"links":{"citing_paper":"/paper/2602.09725"},"observation_digest":"sha256:f9e7699dbd350b6be33bd92ef0a49c14d29e346eca4b0797b5ab617bc7682d7b","observation_id":"f2c86f34-1ba7-4c0f-81ca-23777a0c8d1c","resolution":{"observed_at":"2026-05-16T05:22:23.176878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18666","last_updated":"2025-07-31T04:00:48Z","snapshot_observed_at":"2026-07-06T20:57:47.748881Z","submitted_at":"2025-03-24T13:31:48Z","title":"AgentSpec: Customizable Runtime Enforcement for Safe and Reliable LLM Agents","version":3},"cited_work":{"arxiv_id":"2503.18666","doi":"10.48550/arxiv.2503.18666","metadata_source":"pith","pith_arxiv_id":"2503.18666","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AgentSpec: Customizable Runtime Enforcement for Safe and Reliable LLM Agents","venue":"cs.AI","work_id":"2d265b31-7dcb-4ab3-8c83-e13bd5598435","year":2025},"citing_paper":{"arxiv_id":"2602.09725","last_updated":"2026-05-12T14:12:11Z","snapshot_observed_at":"2026-07-06T22:45:15.978102Z","submitted_at":"2026-02-10T12:29:02Z","title":"Efficient Remote KV Cache Reuse with GPU-native Video Codec","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-16T05:21:04.555356Z"},"links":{"cited_paper":"/paper/2503.18666","citing_paper":"/paper/2602.09725"},"observation_digest":"sha256:c85e52703340dde6c6b03bf0956ed73f4b457d84c8ffebca4ae9e2ada95c6681","observation_id":"0f27d7c7-cf12-4e89-9ce8-86d4dd62538e","resolution":{"observed_at":"2026-05-16T05:22:22.780975Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-03T00:38:11.552641+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T00:38:11.552641+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kvcache cache in the wild: Characterizing and optimizing kvcache cache at a large cloud provider","venue":null,"work_id":"7e3f9b2c-6d70-4764-90ab-364b1948af52","year":2025},"citing_paper":{"arxiv_id":"2602.09725","last_updated":"2026-05-12T14:12:11Z","snapshot_observed_at":"2026-07-06T22:45:15.978102Z","submitted_at":"2026-02-10T12:29:02Z","title":"Efficient Remote KV Cache Reuse with GPU-native Video Codec","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-16T05:21:04.555356Z"},"links":{"citing_paper":"/paper/2602.09725"},"observation_digest":"sha256:46e08d75e1c4b74015fd09695a6fdc6ed404924c66e8b156b4db2aceeb21f39d","observation_id":"b26a37f7-def2-4cd3-a671-072a01779de7","resolution":{"observed_at":"2026-05-16T05:22:23.145957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Loongserve: Efficiently serving long-context large lan- guage models with elastic sequence parallelism","venue":null,"work_id":"a54f3a9f-e266-4ac1-9970-e02644b833b2","year":2024},"citing_paper":{"arxiv_id":"2602.09725","last_updated":"2026-05-12T14:12:11Z","snapshot_observed_at":"2026-07-06T22:45:15.978102Z","submitted_at":"2026-02-10T12:29:02Z","title":"Efficient Remote KV Cache Reuse with GPU-native Video Codec","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-16T05:21:04.555356Z"},"links":{"citing_paper":"/paper/2602.09725"},"observation_digest":"sha256:efc694695e3b0d04f4955445878232ce2b22f44f5c507a39a01b6c4bd774f083","observation_id":"a4e3188a-afa1-4c01-bbf3-d72c1fdd7935","resolution":{"observed_at":"2026-05-16T05:22:23.158763Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.05920","last_updated":"2024-09-25T05:57:51Z","snapshot_observed_at":"2026-07-06T15:25:24.491136Z","submitted_at":"2023-05-10T06:17:50Z","title":"Fast Distributed Inference Serving for Large Language Models","version":3},"cited_work":{"arxiv_id":"2305.05920","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.05920","snapshot_observed_at":"2026-07-04T08:39:41.965931Z","title":"Fast Distributed Inference Serving for Large Language Models","venue":"cs.LG","work_id":"30a55970-0187-4540-943d-f310a5414413","year":2023},"citing_paper":{"arxiv_id":"2602.09725","last_updated":"2026-05-12T14:12:11Z","snapshot_observed_at":"2026-07-06T22:45:15.978102Z","submitted_at":"2026-02-10T12:29:02Z","title":"Efficient Remote KV Cache Reuse with GPU-native Video Codec","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-16T05:21:04.555356Z"},"links":{"cited_paper":"/paper/2305.05920","citing_paper":"/paper/2602.09725"},"observation_digest":"sha256:454820c59b38d7867968ad140186cd876bb7ad58d55fbd78381e2af0dcf937b3","observation_id":"6c1e2dd8-680a-4307-8f16-834f8f853e2d","resolution":{"observed_at":"2026-05-17T11:23:46.844514Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04644","last_updated":"2025-07-14T20:06:23Z","snapshot_observed_at":"2026-07-06T20:32:39.321377Z","submitted_at":"2025-02-07T04:08:46Z","title":"Agentic Reasoning: A Streamlined Framework for Enhancing LLM Reasoning with Agentic Tools","version":2},"cited_work":{"arxiv_id":"2502.04644","doi":"10.48550/arxiv.2502.04644","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04644","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Agentic reasoning: A streamlined framework for enhancing llm reasoning with agentic tools","venue":"ArXiv.org","work_id":"d19e268e-47d0-4de1-9fcd-8e1610bcc89d","year":2025},"citing_paper":{"arxiv_id":"2602.09725","last_updated":"2026-05-12T14:12:11Z","snapshot_observed_at":"2026-07-06T22:45:15.978102Z","submitted_at":"2026-02-10T12:29:02Z","title":"Efficient Remote KV Cache Reuse with GPU-native Video Codec","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-16T05:21:04.555356Z"},"links":{"cited_paper":"/paper/2502.04644","citing_paper":"/paper/2602.09725"},"observation_digest":"sha256:272b5720303016a0dd5de2768c3e3c36878b8e3c5b7500be5ea7e30ff3d41a99","observation_id":"6e298152-0a0d-4908-bb18-ff496d1783b6","resolution":{"observed_at":"2026-05-16T05:22:22.762421Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.16857","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Shadowserve: Interference-free kv cache fetching for distributed prefix caching","venue":null,"work_id":"d2d3fd2a-f3c8-4893-9308-599e54772cca","year":2025},"citing_paper":{"arxiv_id":"2602.09725","last_updated":"2026-05-12T14:12:11Z","snapshot_observed_at":"2026-07-06T22:45:15.978102Z","submitted_at":"2026-02-10T12:29:02Z","title":"Efficient Remote KV Cache Reuse with GPU-native Video Codec","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-16T05:21:04.555356Z"},"links":{"citing_paper":"/paper/2602.09725"},"observation_digest":"sha256:4ddbd1bf44533dc757fe84a5b54335f5917f4805e7c068bea89a75686c29c612","observation_id":"5b77d895-1f23-4596-a1d4-94bcc2ecce8a","resolution":{"observed_at":"2026-05-16T05:22:22.859844Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Efficient streaming language models with attention sinks","venue":null,"work_id":"1e007558-11c9-4923-8dfb-6654eec1adb8","year":2024},"citing_paper":{"arxiv_id":"2602.09725","last_updated":"2026-05-12T14:12:11Z","snapshot_observed_at":"2026-07-06T22:45:15.978102Z","submitted_at":"2026-02-10T12:29:02Z","title":"Efficient Remote KV Cache Reuse with GPU-native Video Codec","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-16T05:21:04.555356Z"},"links":{"citing_paper":"/paper/2602.09725"},"observation_digest":"sha256:b9e195fe7b47d6ac7515d57097efc552b5c075ed1ae9f67d5bafe6ba1890279d","observation_id":"c64de8e7-7e33-486b-9c10-1ef52947c9d3","resolution":{"observed_at":"2026-05-16T05:22:23.231938Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00428","last_updated":"2024-10-09T11:40:31Z","snapshot_observed_at":"2026-07-06T19:25:06.162911Z","submitted_at":"2024-10-01T06:23:17Z","title":"LayerKV: Optimizing Large Language Model Serving with Layer-wise KV Cache Management","version":3},"cited_work":{"arxiv_id":"2410.00428","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.00428","snapshot_observed_at":"2026-06-30T17:24:56.959321Z","title":"Layerkv: Optimizing large language model serving with layer-wise kv cache management","venue":null,"work_id":"7e52dd1f-0450-4444-b4c0-b7724d2618af","year":2024},"citing_paper":{"arxiv_id":"2602.09725","last_updated":"2026-05-12T14:12:11Z","snapshot_observed_at":"2026-07-06T22:45:15.978102Z","submitted_at":"2026-02-10T12:29:02Z","title":"Efficient Remote KV Cache Reuse with GPU-native Video Codec","version":3},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-16T05:21:04.555356Z"},"links":{"cited_paper":"/paper/2410.00428","citing_paper":"/paper/2602.09725"},"observation_digest":"sha256:74efd642da874358211477c39b4ed52f46ba3d3b7f3b76963dbc2137aca2b5c0","observation_id":"bca2aa03-58fd-45a2-adcc-31e71317e029","resolution":{"observed_at":"2026-05-16T05:22:22.824323Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"34bbffd9-ae77-4c65-80c3-976055a96442","year":2025},"citing_paper":{"arxiv_id":"2602.09725","last_updated":"2026-05-12T14:12:11Z","snapshot_observed_at":"2026-07-06T22:45:15.978102Z","submitted_at":"2026-02-10T12:29:02Z","title":"Efficient Remote KV Cache Reuse with GPU-native Video Codec","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-16T05:21:04.555356Z"},"links":{"citing_paper":"/paper/2602.09725"},"observation_digest":"sha256:5df702288b6b852542e5c34cd4d51c9c5e3aa67fa2e7fadac2bb363338a390de","observation_id":"e45a3712-8758-4215-9544-bccd879a65a2","resolution":{"observed_at":"2026-05-16T05:22:23.161625Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T13:24:54.955583Z","title":"Swe-agent: Agent-computer interfaces enable automated software engineering.Advances in Neural Information Processing Systems, 37:50528–50652","venue":null,"work_id":"0621aa9d-3c5d-4171-ba59-3d6fb78d570d","year":2024},"citing_paper":{"arxiv_id":"2602.09725","last_updated":"2026-05-12T14:12:11Z","snapshot_observed_at":"2026-07-06T22:45:15.978102Z","submitted_at":"2026-02-10T12:29:02Z","title":"Efficient Remote KV Cache Reuse with GPU-native Video Codec","version":3},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-16T05:21:04.555356Z"},"links":{"citing_paper":"/paper/2602.09725"},"observation_digest":"sha256:4f9c98049ac73fb4e559f54fd64e788f669aa93cc4098712d1e2dbebeb6655dd","observation_id":"242b5473-934b-455b-ada8-44d2fc4aa2d4","resolution":{"observed_at":"2026-05-16T05:22:23.190414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15220","last_updated":"2024-08-01T07:51:25Z","snapshot_observed_at":"2026-08-04T06:24:10.295170Z","submitted_at":"2024-02-23T09:29:19Z","title":"ChunkAttention: Efficient Self-Attention with Prefix-Aware KV Cache and Two-Phase Partition","version":4},"cited_work":{"arxiv_id":"2402.15220","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.15220","snapshot_observed_at":"2026-07-01T08:15:32.438184Z","title":"Chunkattention: Efficient self-attention with prefix-aware kv cache and two-phase partition","venue":null,"work_id":"f555b084-a556-4195-9106-ada09956a485","year":2024},"citing_paper":{"arxiv_id":"2602.09725","last_updated":"2026-05-12T14:12:11Z","snapshot_observed_at":"2026-07-06T22:45:15.978102Z","submitted_at":"2026-02-10T12:29:02Z","title":"Efficient Remote KV Cache Reuse with GPU-native Video Codec","version":3},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-16T05:21:04.555356Z"},"links":{"cited_paper":"/paper/2402.15220","citing_paper":"/paper/2602.09725"},"observation_digest":"sha256:bbb19dc5a291995c26a64212baa506f43ebbfade28d276dc76c8fb2f1704ceb8","observation_id":"bc12ec78-6281-4597-b4d6-568c6019802a","resolution":{"observed_at":"2026-05-16T05:22:22.841918Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04652","last_updated":"2025-01-21T10:12:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-07T16:52:49Z","title":"Yi: Open Foundation Models by 01.AI","version":3},"cited_work":{"arxiv_id":"2403.04652","doi":"10.48550/arxiv.2403.04652","metadata_source":"pith","pith_arxiv_id":"2403.04652","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Yi: Open Foundation Models by 01.AI","venue":"cs.CL","work_id":"8efee8a1-5e3c-4851-9c65-18e3d1d9e769","year":2024},"citing_paper":{"arxiv_id":"2602.09725","last_updated":"2026-05-12T14:12:11Z","snapshot_observed_at":"2026-07-06T22:45:15.978102Z","submitted_at":"2026-02-10T12:29:02Z","title":"Efficient Remote KV Cache Reuse with GPU-native Video Codec","version":3},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-16T05:21:04.555356Z"},"links":{"cited_paper":"/paper/2403.04652","citing_paper":"/paper/2602.09725"},"observation_digest":"sha256:cf63250702cbf5673a3fd7a6914565decfe5f0c1ddcca097960411423f20c995","observation_id":"39fd06e3-2d01-4f35-bfcf-2a712a50c161","resolution":{"observed_at":"2026-05-16T05:22:22.740147Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Orca: A distributed serving system for transformer- based generative models","venue":null,"work_id":"0ce04f43-2435-4c3a-981b-d4bd3a43d0c6","year":2022},"citing_paper":{"arxiv_id":"2602.09725","last_updated":"2026-05-12T14:12:11Z","snapshot_observed_at":"2026-07-06T22:45:15.978102Z","submitted_at":"2026-02-10T12:29:02Z","title":"Efficient Remote KV Cache Reuse with GPU-native Video Codec","version":3},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-16T05:21:04.555356Z"},"links":{"citing_paper":"/paper/2602.09725"},"observation_digest":"sha256:5fde10889a8c2056ac9e3c979842cf16d952d73ff9ce2a9922f484493fbe4770","observation_id":"1b010bf1-3a32-4ea7-aec2-f73cacb8ecd6","resolution":{"observed_at":"2026-05-16T05:22:23.118468Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Stateful large language model serving with pensieve","venue":null,"work_id":"9e3194af-9caa-4081-bd20-2410f49b5233","year":2025},"citing_paper":{"arxiv_id":"2602.09725","last_updated":"2026-05-12T14:12:11Z","snapshot_observed_at":"2026-07-06T22:45:15.978102Z","submitted_at":"2026-02-10T12:29:02Z","title":"Efficient Remote KV Cache Reuse with GPU-native Video Codec","version":3},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-16T05:21:04.555356Z"},"links":{"citing_paper":"/paper/2602.09725"},"observation_digest":"sha256:f1be795160dbf25cc4f4aa14fdc1fd5e95c6eb2911bcd8f349c72edf666d9968","observation_id":"eb0bfdc0-1eb3-4a0e-bd04-26d3a55565fb","resolution":{"observed_at":"2026-05-16T05:22:23.219727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2402.05136","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T15:25:48.110956Z","title":"LV-Eval: A balanced long-context benchmark with 5 length levels up to 256K","venue":null,"work_id":"f9d0736d-ad1a-4059-aaec-2fde79a17bb8","year":2024},"citing_paper":{"arxiv_id":"2602.09725","last_updated":"2026-05-12T14:12:11Z","snapshot_observed_at":"2026-07-06T22:45:15.978102Z","submitted_at":"2026-02-10T12:29:02Z","title":"Efficient Remote KV Cache Reuse with GPU-native Video Codec","version":3},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-16T05:21:04.555356Z"},"links":{"citing_paper":"/paper/2602.09725"},"observation_digest":"sha256:cf17cae82ffae4e557ed68540e6d01312941c3b9a2bd3d0ed259d366830e6e14","observation_id":"72cd7fc8-7cd6-4738-900c-4226315e166c","resolution":{"observed_at":"2026-05-16T05:22:22.757266Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"H2o: Heavy-hitter oracle for efficient generative infer- ence of large language models","venue":null,"work_id":"5ddd6c27-81b0-4213-b94e-e3a35a46a9e7","year":2023},"citing_paper":{"arxiv_id":"2602.09725","last_updated":"2026-05-12T14:12:11Z","snapshot_observed_at":"2026-07-06T22:45:15.978102Z","submitted_at":"2026-02-10T12:29:02Z","title":"Efficient Remote KV Cache Reuse with GPU-native Video Codec","version":3},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-16T05:21:04.555356Z"},"links":{"citing_paper":"/paper/2602.09725"},"observation_digest":"sha256:aae84cb991a2748bedc3f17ce3ba77d0f69da841e5b233532a386315e31f4a7a","observation_id":"d0fdf0c6-27a8-4d76-89dc-bbace123bdfc","resolution":{"observed_at":"2026-05-16T05:22:23.200124Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gonzalez, Clark Barrett, and Ying Sheng","venue":null,"work_id":"7b04f8c0-3c0e-44f8-a33c-fb0e6536bd96","year":2024},"citing_paper":{"arxiv_id":"2602.09725","last_updated":"2026-05-12T14:12:11Z","snapshot_observed_at":"2026-07-06T22:45:15.978102Z","submitted_at":"2026-02-10T12:29:02Z","title":"Efficient Remote KV Cache Reuse with GPU-native Video Codec","version":3},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-16T05:21:04.555356Z"},"links":{"citing_paper":"/paper/2602.09725"},"observation_digest":"sha256:c77b232ec3e54cc039339c88a577758fbdcdc2bd3d68602610ed6742bdbf80a7","observation_id":"5d00a158-4ba2-461e-90b7-2779c067af74","resolution":{"observed_at":"2026-05-16T05:22:23.249632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Distserve: Disaggregating prefill and decoding for goodput-optimized large language model serving","venue":null,"work_id":"d1e9139f-7954-4d59-8b32-116c0c757f68","year":2024},"citing_paper":{"arxiv_id":"2602.09725","last_updated":"2026-05-12T14:12:11Z","snapshot_observed_at":"2026-07-06T22:45:15.978102Z","submitted_at":"2026-02-10T12:29:02Z","title":"Efficient Remote KV Cache Reuse with GPU-native Video Codec","version":3},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-16T05:21:04.555356Z"},"links":{"citing_paper":"/paper/2602.09725"},"observation_digest":"sha256:bd745a1a94c296ac268232f270719ea0fa995c9ca9146fed515cedf015130e2e","observation_id":"7c227fd4-2eef-4924-987d-240212455ccd","resolution":{"observed_at":"2026-05-16T05:22:23.246944Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.15920","last_updated":"2025-05-28T02:15:07Z","snapshot_observed_at":"2026-08-04T06:00:49.870821Z","submitted_at":"2025-02-21T20:29:36Z","title":"Self-Taught Agentic Long Context Understanding","version":2},"cited_work":{"arxiv_id":"2502.15920","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.15920","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Self-taught agentic long context understanding","venue":null,"work_id":"24e950ea-72af-47ac-8aeb-44fb43586080","year":2025},"citing_paper":{"arxiv_id":"2602.09725","last_updated":"2026-05-12T14:12:11Z","snapshot_observed_at":"2026-07-06T22:45:15.978102Z","submitted_at":"2026-02-10T12:29:02Z","title":"Efficient Remote KV Cache Reuse with GPU-native Video Codec","version":3},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-16T05:21:04.555356Z"},"links":{"cited_paper":"/paper/2502.15920","citing_paper":"/paper/2602.09725"},"observation_digest":"sha256:6e7ee3f01d82d4aee85b4e4ab6371e50b4d15dd6febdda44bbef35e8a5192a47","observation_id":"38174ce9-9863-439c-8ea3-8e0e9220c8d3","resolution":{"observed_at":"2026-05-16T05:22:22.882351Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2602.09725","last_updated":"2026-05-12T14:12:11Z","latest_version":3,"primary_category":"cs.DC","snapshot_observed_at":"2026-07-06T22:45:15.978102Z","submitted_at":"2026-02-10T12:29:02Z","title":"Efficient Remote KV Cache Reuse with GPU-native Video Codec"},"reference_resolution":{"displayed":81,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":1,"verified_exact":28,"verified_fuzzy":52},"total_outbound_references":81},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 81 of 81 outbound references and 0 inbound Pith citation observations for arXiv:2602.09725."}