{"as_of":"2026-08-16T19:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:128455197d6d6652c6dc97fbc2053deb1b358a5cbe69a370fe421cab47e8868b","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T20:58:08.498820Z","state":"measured"},{"denominator":48,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":48,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T23:45:32.847427Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.06709","last_updated":"2025-01-12T04:29:39Z","snapshot_observed_at":"2026-08-16T10:50:40.853881Z","submitted_at":"2025-01-12T04:29:39Z","title":"Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.06709","snapshot_observed_at":"2026-08-11T00:38:49.523271Z","title":"Mell: Memory-efficient large language model serving via multi-gpu kv cache management,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2412.19442","last_updated":"2025-07-30T05:24:46Z","snapshot_observed_at":"2026-08-15T13:24:51.697670Z","submitted_at":"2024-12-27T04:17:57Z","title":"A Survey on Large Language Model Acceleration based on KV Cache Management","version":3},"reference_index":260,"source":"pdf_text","source_observed_at":"2026-08-11T00:38:49.523271Z"},"links":{"cited_paper":"/paper/2501.06709","citing_paper":"/paper/2412.19442"},"observation_digest":"sha256:ad1e6910c657bfd6ba91d96e8c3956f694da70498d9745464d783c56c7eb6e6e","observation_id":"01ad7691-2c93-438b-9311-2acf41d527b1","resolution":{"observed_at":"2026-08-11T00:38:49.523271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06709","last_updated":"2025-01-12T04:29:39Z","snapshot_observed_at":"2026-08-16T10:50:40.853881Z","submitted_at":"2025-01-12T04:29:39Z","title":"Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.06709","snapshot_observed_at":"2026-08-15T23:45:32.847427Z","title":"Qianli, H","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.04021","last_updated":"2026-06-10T23:04:53Z","snapshot_observed_at":"2026-08-15T23:37:29.776535Z","submitted_at":"2025-05-06T23:38:33Z","title":"Prism: Cost-Efficient Multi-LLM Serving via GPU Memory Ballooning","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T23:45:32.847427Z"},"links":{"cited_paper":"/paper/2501.06709","citing_paper":"/paper/2505.04021"},"observation_digest":"sha256:885c15accb84400f7adaa725d1416e37e74e8d28e80d682542b9427790f1b854","observation_id":"80459404-6387-4874-b2a6-aef638b43d33","resolution":{"observed_at":"2026-08-15T23:45:32.847427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06709","last_updated":"2025-01-12T04:29:39Z","snapshot_observed_at":"2026-08-16T10:50:40.853881Z","submitted_at":"2025-01-12T04:29:39Z","title":"Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management","version":1},"cited_work":{"arxiv_id":"2501.06709","doi":"10.48550/arxiv.2501.06709","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.06709","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":"arXiv (Cornell University)","work_id":"3a5377c6-8e21-42fc-930b-39fd97462c75","year":2025},"citing_paper":{"arxiv_id":"2604.06370","last_updated":"2026-04-07T18:52:25Z","snapshot_observed_at":"2026-08-15T13:00:48.586034Z","submitted_at":"2026-04-07T18:52:25Z","title":"ForkKV: Scaling Multi-LoRA Agent Serving via Copy-on-Write Disaggregated KV Cache","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-10T18:16:49.292491Z"},"links":{"cited_paper":"/paper/2501.06709","citing_paper":"/paper/2604.06370"},"observation_digest":"sha256:7d9140bb685c3e2107605afa7d004a718ee1795292c1a85ad145a92e627df49d","observation_id":"0b31f61f-9a83-4899-bc23-8de4f04438e7","resolution":{"observed_at":"2026-05-10T20:25:46.874022Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06709","last_updated":"2025-01-12T04:29:39Z","snapshot_observed_at":"2026-08-16T10:50:40.853881Z","submitted_at":"2025-01-12T04:29:39Z","title":"Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.06709","snapshot_observed_at":"2026-08-15T14:55:56.631328Z","title":"Mell: Memory-efficient large language model serving via multi-gpu kv cache management,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03036","last_updated":"2026-08-04T02:33:16Z","snapshot_observed_at":"2026-08-16T05:34:24.767054Z","submitted_at":"2026-08-04T02:33:16Z","title":"LLM Serving in the Wild: An Empirical Study of Frameworks, Methods, and System Designs","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-15T14:55:56.631328Z"},"links":{"cited_paper":"/paper/2501.06709","citing_paper":"/paper/2608.03036"},"observation_digest":"sha256:df204d64874d0747141dfb626a5ea9807f37717b119ebf7983c82865f62d0141","observation_id":"87c72b18-1423-4970-92e9-e9b572cdfcb1","resolution":{"observed_at":"2026-08-15T14:55:56.631328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2501.06709/citation-record","integrity":"/paper/2501.06709/integrity","json":"/paper/2501.06709/citation-record.json","paper":"/paper/2501.06709"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:09.646596Z","title":"Brown, B","venue":null,"work_id":"b9edf9dd-8977-4749-a5a9-54c20fcf3f86","year":2020},"citing_paper":{"arxiv_id":"2501.06709","last_updated":"2025-01-12T04:29:39Z","snapshot_observed_at":"2026-08-16T10:50:40.853881Z","submitted_at":"2025-01-12T04:29:39Z","title":"Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:08.213684Z"},"links":{"citing_paper":"/paper/2501.06709"},"observation_digest":"sha256:9573cdfb959a0d8a1827d6fd20f5f4c82d8fea41ce1a38a9c771eb5beeaf6061","observation_id":"70838d38-4447-49df-a558-80af7a61cc6b","resolution":{"observed_at":"2026-08-10T20:58:09.653172Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-10T20:58:08.221119Z","title":"Gpt-4 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.06709","last_updated":"2025-01-12T04:29:39Z","snapshot_observed_at":"2026-08-16T10:50:40.853881Z","submitted_at":"2025-01-12T04:29:39Z","title":"Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:08.221119Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2501.06709"},"observation_digest":"sha256:ea46e19938dd18cdfc46d00f3368f841c8776d281922df3e42386ef1a11f0a29","observation_id":"e9b3d3ab-052a-46ce-b479-6114c41f6f03","resolution":{"observed_at":"2026-08-10T20:58:08.221119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-10T20:58:08.227140Z","title":"Llama: Open and efficient foundation language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.06709","last_updated":"2025-01-12T04:29:39Z","snapshot_observed_at":"2026-08-16T10:50:40.853881Z","submitted_at":"2025-01-12T04:29:39Z","title":"Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:08.227140Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2501.06709"},"observation_digest":"sha256:8eefafbe72b11307467cbe8ee7ea1862f31ae04188a702aac3fc5732b77503e6","observation_id":"2642f22a-d560-412d-a3b7-041a69b91997","resolution":{"observed_at":"2026-08-10T20:58:08.227140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:09.613807Z","title":"Characterization of large language model development in the datacenter,","venue":null,"work_id":"c497ca14-d488-471e-8123-f877a7ad2696","year":2024},"citing_paper":{"arxiv_id":"2501.06709","last_updated":"2025-01-12T04:29:39Z","snapshot_observed_at":"2026-08-16T10:50:40.853881Z","submitted_at":"2025-01-12T04:29:39Z","title":"Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:08.234544Z"},"links":{"citing_paper":"/paper/2501.06709"},"observation_digest":"sha256:ca6b5ac5657bd6ff0697140c3b5cf2a496db86531a6dd16d26361a65fa685629","observation_id":"c8b27bae-ca69-4c32-aab8-045993c3a9e1","resolution":{"observed_at":"2026-08-10T20:58:09.623471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:09.591757Z","title":"Orca: A distributed serving system for Transformer-Based generative models,","venue":null,"work_id":"2f4bad8c-acf7-46f7-997e-febe67bcf744","year":2022},"citing_paper":{"arxiv_id":"2501.06709","last_updated":"2025-01-12T04:29:39Z","snapshot_observed_at":"2026-08-16T10:50:40.853881Z","submitted_at":"2025-01-12T04:29:39Z","title":"Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:08.240643Z"},"links":{"citing_paper":"/paper/2501.06709"},"observation_digest":"sha256:0d1502ccde59641c9faf31b8719ab09e4e026e2b00b55702fbc0f45f7a2af46a","observation_id":"a9b7d5f8-4f80-4113-9703-d45e9911c44a","resolution":{"observed_at":"2026-08-10T20:58:09.600018Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:09.570194Z","title":"Splitwise: Efficient generative llm inference using phase splitting,","venue":null,"work_id":"d86285b9-0039-4067-bc14-15c12a98bd77","year":2024},"citing_paper":{"arxiv_id":"2501.06709","last_updated":"2025-01-12T04:29:39Z","snapshot_observed_at":"2026-08-16T10:50:40.853881Z","submitted_at":"2025-01-12T04:29:39Z","title":"Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:08.248315Z"},"links":{"citing_paper":"/paper/2501.06709"},"observation_digest":"sha256:8cc723063169bc1ad1ec858029f5ed8ce86b9605ad1e3cc34ef0b12841a57500","observation_id":"5a53d823-1a65-4e4a-859f-72126ad12211","resolution":{"observed_at":"2026-08-10T20:58:09.576977Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:09.542380Z","title":"Optimus: Warming serverless ml inference via inter-function model transformation,","venue":null,"work_id":"9f9d0fc4-4ddd-4d99-ac6a-18d8453057a1","year":2024},"citing_paper":{"arxiv_id":"2501.06709","last_updated":"2025-01-12T04:29:39Z","snapshot_observed_at":"2026-08-16T10:50:40.853881Z","submitted_at":"2025-01-12T04:29:39Z","title":"Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:08.254850Z"},"links":{"citing_paper":"/paper/2501.06709"},"observation_digest":"sha256:d2e3acac810972f6f9088ff47f0a91daa8fe71f2a8f787688063a92f5496face","observation_id":"d3401967-7f6b-4079-82e4-878eb18686a4","resolution":{"observed_at":"2026-08-10T20:58:09.552481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:09.522576Z","title":"Otas: An elastic transformer serving system via token adaptation,","venue":null,"work_id":"9d260880-57e1-4464-b561-41ecb81d299f","year":2024},"citing_paper":{"arxiv_id":"2501.06709","last_updated":"2025-01-12T04:29:39Z","snapshot_observed_at":"2026-08-16T10:50:40.853881Z","submitted_at":"2025-01-12T04:29:39Z","title":"Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:08.262315Z"},"links":{"citing_paper":"/paper/2501.06709"},"observation_digest":"sha256:d3815bbd6fdfd1099e25013d28ec75f0785699b49851d7be56acd8ecee9f1c16","observation_id":"995dcd7f-b0f1-4a81-8ef3-f9f7b29ef31b","resolution":{"observed_at":"2026-08-10T20:58:09.528062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:09.499829Z","title":"Galaxy: A resource-efficient collaborative edge ai system for in-situ transformer inference,","venue":null,"work_id":"0a1880b4-2d68-49a2-b404-f67e0392fbf8","year":2024},"citing_paper":{"arxiv_id":"2501.06709","last_updated":"2025-01-12T04:29:39Z","snapshot_observed_at":"2026-08-16T10:50:40.853881Z","submitted_at":"2025-01-12T04:29:39Z","title":"Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:08.267931Z"},"links":{"citing_paper":"/paper/2501.06709"},"observation_digest":"sha256:c2f24b5fac1e0114b94654cbaa7fc27a78ead0a46ea4ede2d9acc0f9eed10b01","observation_id":"c51ead8a-cd79-482f-9ad7-581802a112da","resolution":{"observed_at":"2026-08-10T20:58:09.507764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:09.476962Z","title":"Efficiently scaling transformer inference,","venue":null,"work_id":"30a1b858-7508-4b93-a995-eacd5808be1c","year":2023},"citing_paper":{"arxiv_id":"2501.06709","last_updated":"2025-01-12T04:29:39Z","snapshot_observed_at":"2026-08-16T10:50:40.853881Z","submitted_at":"2025-01-12T04:29:39Z","title":"Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:08.276900Z"},"links":{"citing_paper":"/paper/2501.06709"},"observation_digest":"sha256:e87debb334d97c53cdfb84329bc93751cfb3f74f571c581324a773ef4ee55c31","observation_id":"49e0f30b-0397-499f-9da2-81df2420cc4a","resolution":{"observed_at":"2026-08-10T20:58:09.484082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:09.454230Z","title":"LongloRA: Efficient fine-tuning of long-context large language models,","venue":null,"work_id":"fb5cc8ea-dd03-44e7-8f22-9f662bf2b36a","year":2024},"citing_paper":{"arxiv_id":"2501.06709","last_updated":"2025-01-12T04:29:39Z","snapshot_observed_at":"2026-08-16T10:50:40.853881Z","submitted_at":"2025-01-12T04:29:39Z","title":"Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:08.287438Z"},"links":{"citing_paper":"/paper/2501.06709"},"observation_digest":"sha256:dafae2b577052e8ce96269cdb08956a4cb53a68f32df54e5d0b252377cb096a0","observation_id":"b98744f7-ea30-4b0f-8c29-375784e0e37e","resolution":{"observed_at":"2026-08-10T20:58:09.461417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:09.423395Z","title":"Efficient memory management for large lan- guage model serving with pagedattention,","venue":null,"work_id":"16223fe2-c22e-4016-8c73-d2e73f77e857","year":2023},"citing_paper":{"arxiv_id":"2501.06709","last_updated":"2025-01-12T04:29:39Z","snapshot_observed_at":"2026-08-16T10:50:40.853881Z","submitted_at":"2025-01-12T04:29:39Z","title":"Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:08.293309Z"},"links":{"citing_paper":"/paper/2501.06709"},"observation_digest":"sha256:ca189621dd223d05da21a075dba72cb6745bd7db6351659d4a635978878733e6","observation_id":"c4a6f511-e017-42b4-aa5f-014cac17659c","resolution":{"observed_at":"2026-08-10T20:58:09.433817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:09.400666Z","title":"Keyformer: Kv cache reduction through key tokens selection for efficient generative inference,","venue":null,"work_id":"c7cbad49-4eff-4814-9348-6e7d016289c7","year":2024},"citing_paper":{"arxiv_id":"2501.06709","last_updated":"2025-01-12T04:29:39Z","snapshot_observed_at":"2026-08-16T10:50:40.853881Z","submitted_at":"2025-01-12T04:29:39Z","title":"Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:08.298553Z"},"links":{"citing_paper":"/paper/2501.06709"},"observation_digest":"sha256:07f07f05a6909fc55f579b620a194303d6f05eaab394e70414f5f6dc0107596f","observation_id":"36fe6834-c623-4a4a-b6ee-baf3aa39282c","resolution":{"observed_at":"2026-08-10T20:58:09.408044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:09.378271Z","title":"H2o: Heavy-hitter oracle for efficient generative inference of large language models,","venue":null,"work_id":"61d47fe9-49cf-4c57-9d2d-1f6ea7aa934d","year":2023},"citing_paper":{"arxiv_id":"2501.06709","last_updated":"2025-01-12T04:29:39Z","snapshot_observed_at":"2026-08-16T10:50:40.853881Z","submitted_at":"2025-01-12T04:29:39Z","title":"Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:08.305038Z"},"links":{"citing_paper":"/paper/2501.06709"},"observation_digest":"sha256:bc51567e4900430d39c29450eb82cfe215c0ee0de9c84941f3866f63bde904cd","observation_id":"d00bb195-ef32-4aaa-85a2-30ee35428d73","resolution":{"observed_at":"2026-08-10T20:58:09.386345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:09.351778Z","title":"Efficient streaming language models with attention sinks,","venue":null,"work_id":"68d2465c-53e6-48fd-9c22-4a45c669879f","year":2024},"citing_paper":{"arxiv_id":"2501.06709","last_updated":"2025-01-12T04:29:39Z","snapshot_observed_at":"2026-08-16T10:50:40.853881Z","submitted_at":"2025-01-12T04:29:39Z","title":"Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:08.312308Z"},"links":{"citing_paper":"/paper/2501.06709"},"observation_digest":"sha256:d7bbdf1042423ca8e24b5a272220744dc78baa15c7d9f719989f33d59083f829","observation_id":"f871c23b-05d6-4ad8-9056-f3344e591c07","resolution":{"observed_at":"2026-08-10T20:58:09.359107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:09.333995Z","title":"Scissorhands: Exploiting the persistence of importance hypothesis for LLM KV cache compression at test time,","venue":null,"work_id":"58daef13-e2a7-44b0-8bf4-7cd0667f1773","year":2023},"citing_paper":{"arxiv_id":"2501.06709","last_updated":"2025-01-12T04:29:39Z","snapshot_observed_at":"2026-08-16T10:50:40.853881Z","submitted_at":"2025-01-12T04:29:39Z","title":"Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:08.317601Z"},"links":{"citing_paper":"/paper/2501.06709"},"observation_digest":"sha256:a805f47349506a5ecdfb1f07a9c7bebaeeac13984cab2409ec12aab70bc245f3","observation_id":"c370e43a-eb65-47c6-908d-b817162cd06d","resolution":{"observed_at":"2026-08-10T20:58:09.339682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02750","last_updated":"2024-07-25T09:16:05Z","snapshot_observed_at":"2026-08-12T17:03:50.984887Z","submitted_at":"2024-02-05T06:06:47Z","title":"KIVI: A Tuning-Free Asymmetric 2bit Quantization for KV Cache","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02750","snapshot_observed_at":"2026-08-10T20:58:08.323613Z","title":"Kivi: A tuning-free asymmetric 2bit quantization for kv cache,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.06709","last_updated":"2025-01-12T04:29:39Z","snapshot_observed_at":"2026-08-16T10:50:40.853881Z","submitted_at":"2025-01-12T04:29:39Z","title":"Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:08.323613Z"},"links":{"cited_paper":"/paper/2402.02750","citing_paper":"/paper/2501.06709"},"observation_digest":"sha256:a9d50c8caab26337993ad2763244ec6940a5954e8cac6fabe364a77ee04777ac","observation_id":"f6791e28-2a64-42b7-901d-bd756b1bba73","resolution":{"observed_at":"2026-08-10T20:58:08.323613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:09.307668Z","title":"Model tells you what to discard: Adaptive KV cache compression for LLMs,","venue":null,"work_id":"6f67a291-0e27-4d6c-826c-8e186eeff548","year":2024},"citing_paper":{"arxiv_id":"2501.06709","last_updated":"2025-01-12T04:29:39Z","snapshot_observed_at":"2026-08-16T10:50:40.853881Z","submitted_at":"2025-01-12T04:29:39Z","title":"Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:08.335736Z"},"links":{"citing_paper":"/paper/2501.06709"},"observation_digest":"sha256:fbd6dcb908042c40d0262f2105387c3be16f4251dcd5caa1d556b21765e1074f","observation_id":"d7d8c44a-c3e6-421b-9e35-83e93800a937","resolution":{"observed_at":"2026-08-10T20:58:09.320919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:09.282029Z","title":"Flexgen: high-throughput generative inference of large language models with a single gpu,","venue":null,"work_id":"864d3fcc-260d-4166-a9cd-748d86753ea4","year":2023},"citing_paper":{"arxiv_id":"2501.06709","last_updated":"2025-01-12T04:29:39Z","snapshot_observed_at":"2026-08-16T10:50:40.853881Z","submitted_at":"2025-01-12T04:29:39Z","title":"Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:08.342949Z"},"links":{"citing_paper":"/paper/2501.06709"},"observation_digest":"sha256:931d86f73a46f2e7a67ef9949f1a931c223f68a86311ebb45ec365d8e6db44a3","observation_id":"92d5fa76-fd6b-45b5-8513-c5cddeeb8fac","resolution":{"observed_at":"2026-08-10T20:58:09.289777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:09.257689Z","title":"Infinigen: Efficient generative in- ference of large language models with dynamic kv cache management,","venue":null,"work_id":"e5a17aa4-df23-415b-a172-2c53a607331e","year":2024},"citing_paper":{"arxiv_id":"2501.06709","last_updated":"2025-01-12T04:29:39Z","snapshot_observed_at":"2026-08-16T10:50:40.853881Z","submitted_at":"2025-01-12T04:29:39Z","title":"Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:08.349106Z"},"links":{"citing_paper":"/paper/2501.06709"},"observation_digest":"sha256:0c01ef72e57d228dc3ef992706796e88e585033b45717e317e77719e76a11396","observation_id":"21a3dae1-09ea-4da9-9f75-686ecf9d61e7","resolution":{"observed_at":"2026-08-10T20:58:09.265498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:09.232829Z","title":"Cost-Efficient large language model serving for multi-turn conversations with CachedAttention,","venue":null,"work_id":"87917f8c-76c4-4b95-82c0-ee0f464d1567","year":2024},"citing_paper":{"arxiv_id":"2501.06709","last_updated":"2025-01-12T04:29:39Z","snapshot_observed_at":"2026-08-16T10:50:40.853881Z","submitted_at":"2025-01-12T04:29:39Z","title":"Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:08.356264Z"},"links":{"citing_paper":"/paper/2501.06709"},"observation_digest":"sha256:680f56ef086350d832de8bde0ee5225767b0f8877affb2adb3d6851b3c6ea091","observation_id":"1668b1ff-fff7-482d-9975-177f6099fe7d","resolution":{"observed_at":"2026-08-10T20:58:09.241225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:09.211513Z","title":"Deepspeed- inference: enabling efficient inference of transformer models at unprece- dented scale,","venue":null,"work_id":"33177218-d3e4-4b40-bd6e-a7526d8eb0e1","year":2022},"citing_paper":{"arxiv_id":"2501.06709","last_updated":"2025-01-12T04:29:39Z","snapshot_observed_at":"2026-08-16T10:50:40.853881Z","submitted_at":"2025-01-12T04:29:39Z","title":"Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:08.363065Z"},"links":{"citing_paper":"/paper/2501.06709"},"observation_digest":"sha256:ef4cd0b57ae2a729ac3aeace13ad8f8d9bbde0f5f1f83b2e98880d1ed2842095","observation_id":"17a3a078-f1d3-4e2a-a5b9-b39cccd494d5","resolution":{"observed_at":"2026-08-10T20:58:09.218362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:09.187230Z","title":"Llumnix: Dynamic scheduling for large language model serving,","venue":null,"work_id":"32c1325c-b5ab-4b85-b607-2b077a0d7678","year":2024},"citing_paper":{"arxiv_id":"2501.06709","last_updated":"2025-01-12T04:29:39Z","snapshot_observed_at":"2026-08-16T10:50:40.853881Z","submitted_at":"2025-01-12T04:29:39Z","title":"Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:08.369100Z"},"links":{"citing_paper":"/paper/2501.06709"},"observation_digest":"sha256:b5e9c25248bf7d0ce348d3a560c3f208dae763e2518e0d667419aed4e3212bee","observation_id":"e7f660de-3832-4453-8725-a33dbb518132","resolution":{"observed_at":"2026-08-10T20:58:09.193397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:09.166339Z","title":"Serverlessllm: Low-latency serverless inference for large language models,","venue":null,"work_id":"d3c06352-eb25-4970-b405-0044fac1143f","year":2024},"citing_paper":{"arxiv_id":"2501.06709","last_updated":"2025-01-12T04:29:39Z","snapshot_observed_at":"2026-08-16T10:50:40.853881Z","submitted_at":"2025-01-12T04:29:39Z","title":"Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:08.374194Z"},"links":{"citing_paper":"/paper/2501.06709"},"observation_digest":"sha256:6258a9c38c50ebc4d55203b9c032ffa30886a0b4e7d34b5d628077a4c8eb4bb6","observation_id":"9057a506-236a-438c-90e5-4d64452995a6","resolution":{"observed_at":"2026-08-10T20:58:09.173370Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:09.139862Z","title":"Turbotransformers: an efficient gpu serving system for transformer models,","venue":null,"work_id":"af5d4a00-0a8f-4bdd-a976-4620b0fc14fb","year":2021},"citing_paper":{"arxiv_id":"2501.06709","last_updated":"2025-01-12T04:29:39Z","snapshot_observed_at":"2026-08-16T10:50:40.853881Z","submitted_at":"2025-01-12T04:29:39Z","title":"Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:08.379805Z"},"links":{"citing_paper":"/paper/2501.06709"},"observation_digest":"sha256:5bdb7ea00c00a4af2bdfb8fb2e2a7d04d569d5d50c94d069984a253a8a52f884","observation_id":"19df26f4-727a-4b8a-b54f-a3a7326ff70c","resolution":{"observed_at":"2026-08-10T20:58:09.146756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:09.107459Z","title":"Taming throughput-latency tradeoff in llm inference with sarathi-serve,","venue":null,"work_id":"b74639ea-fac4-4a46-8941-173685d9f747","year":2024},"citing_paper":{"arxiv_id":"2501.06709","last_updated":"2025-01-12T04:29:39Z","snapshot_observed_at":"2026-08-16T10:50:40.853881Z","submitted_at":"2025-01-12T04:29:39Z","title":"Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:08.385167Z"},"links":{"citing_paper":"/paper/2501.06709"},"observation_digest":"sha256:e8fcf5d28ce7455285d16d6fb69f7874c5580a180c29eb86a3808ab2859ff3e6","observation_id":"7e83071a-3a68-4526-94d9-b8d3d42306be","resolution":{"observed_at":"2026-08-10T20:58:09.122150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:09.079487Z","title":"Distserve: Disaggregating prefill and decoding for goodput-optimized large language model serving,","venue":null,"work_id":"e6e4c96a-4f70-4a31-a74b-a2ddf550411b","year":2024},"citing_paper":{"arxiv_id":"2501.06709","last_updated":"2025-01-12T04:29:39Z","snapshot_observed_at":"2026-08-16T10:50:40.853881Z","submitted_at":"2025-01-12T04:29:39Z","title":"Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:08.394284Z"},"links":{"citing_paper":"/paper/2501.06709"},"observation_digest":"sha256:6f32cf1c5eb0d35e901ffa6868296b4b25e147ff862bf1e1443d1dd9afacb9b1","observation_id":"3cc9f462-3e53-4d19-876a-a09fa998e019","resolution":{"observed_at":"2026-08-10T20:58:09.086283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.11181","last_updated":"2024-01-20T09:43:36Z","snapshot_observed_at":"2026-08-16T14:25:57.735259Z","submitted_at":"2024-01-20T09:43:36Z","title":"Inference without Interference: Disaggregate LLM Inference for Mixed Downstream Workloads","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.11181","snapshot_observed_at":"2026-08-10T20:58:08.401041Z","title":"Inference without interference: Disaggregate llm inference for mixed downstream workloads,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.06709","last_updated":"2025-01-12T04:29:39Z","snapshot_observed_at":"2026-08-16T10:50:40.853881Z","submitted_at":"2025-01-12T04:29:39Z","title":"Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:08.401041Z"},"links":{"cited_paper":"/paper/2401.11181","citing_paper":"/paper/2501.06709"},"observation_digest":"sha256:445834e4dfa2553fd6863596211b8f68d837e959fced9ade5abbc610bae29094","observation_id":"a9042608-ac4d-4cde-97b3-35f7cd5fc350","resolution":{"observed_at":"2026-08-10T20:58:08.401041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:09.050196Z","title":"dLoRA: Dynam- ically orchestrating requests and adapters for LoRA LLM serving,","venue":null,"work_id":"a1f884d5-007e-403c-b037-0213331cb62a","year":2024},"citing_paper":{"arxiv_id":"2501.06709","last_updated":"2025-01-12T04:29:39Z","snapshot_observed_at":"2026-08-16T10:50:40.853881Z","submitted_at":"2025-01-12T04:29:39Z","title":"Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:08.406766Z"},"links":{"citing_paper":"/paper/2501.06709"},"observation_digest":"sha256:ff8c06943e5d8bedb5e2bc826bed491160db7f6e10e2c18172598c7737e09418","observation_id":"3405f68f-6281-44eb-ba11-2d40878f4747","resolution":{"observed_at":"2026-08-10T20:58:09.061030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:09.026973Z","title":"LMSYS- chat-1m: A large-scale real-world LLM conversation dataset,","venue":null,"work_id":"db1afe38-7f0a-4cb8-bf78-451bcf32f627","year":2024},"citing_paper":{"arxiv_id":"2501.06709","last_updated":"2025-01-12T04:29:39Z","snapshot_observed_at":"2026-08-16T10:50:40.853881Z","submitted_at":"2025-01-12T04:29:39Z","title":"Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:08.411772Z"},"links":{"citing_paper":"/paper/2501.06709"},"observation_digest":"sha256:bcadded8cf74fb3368fa36a3a8a127e34cd51726b914b729db132d0ffe800b2a","observation_id":"7546fca3-7b42-40bd-9489-c5b6ea9e92ce","resolution":{"observed_at":"2026-08-10T20:58:09.033618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:09.009407Z","title":"Wildchat: 1m chatGPT interaction logs in the wild,","venue":null,"work_id":"7918c284-59e7-4470-b1ae-2ab051830d1f","year":2024},"citing_paper":{"arxiv_id":"2501.06709","last_updated":"2025-01-12T04:29:39Z","snapshot_observed_at":"2026-08-16T10:50:40.853881Z","submitted_at":"2025-01-12T04:29:39Z","title":"Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:08.417714Z"},"links":{"citing_paper":"/paper/2501.06709"},"observation_digest":"sha256:1be4e6e2619a31123348aa30624377f42e0dfb71b8f3998dc7ba4c308608bc0b","observation_id":"2f10efc9-75f1-4584-8455-1b3a8a0032fb","resolution":{"observed_at":"2026-08-10T20:58:09.014848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:08.990139Z","title":"Judging LLM-as-a-judge with MT-bench and chatbot arena,","venue":null,"work_id":"b2eeb4ce-6995-4e25-b4a6-1920ba4699b8","year":2023},"citing_paper":{"arxiv_id":"2501.06709","last_updated":"2025-01-12T04:29:39Z","snapshot_observed_at":"2026-08-16T10:50:40.853881Z","submitted_at":"2025-01-12T04:29:39Z","title":"Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:08.423055Z"},"links":{"citing_paper":"/paper/2501.06709"},"observation_digest":"sha256:6df64b3fb526547552488d380aed79aec19ef250fa59d18da3474fb38e767e38","observation_id":"207f5195-686a-466c-a0d1-ae5395559b42","resolution":{"observed_at":"2026-08-10T20:58:08.995713Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:08.429322Z","title":"Koala: A dialogue model for academic research,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.06709","last_updated":"2025-01-12T04:29:39Z","snapshot_observed_at":"2026-08-16T10:50:40.853881Z","submitted_at":"2025-01-12T04:29:39Z","title":"Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:08.429322Z"},"links":{"citing_paper":"/paper/2501.06709"},"observation_digest":"sha256:19467275c9ccf6167add96d7c1227c04076a54027068151230a5c7e21bb7af70","observation_id":"7b768cf5-06c4-4aab-8dc5-4266b15924aa","resolution":{"observed_at":"2026-08-10T20:58:08.429322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:08.959430Z","title":"Response length perception and sequence scheduling: An LLM-empowered LLM inference pipeline,","venue":null,"work_id":"b08948e1-5391-4c73-a470-209f31cdeed9","year":2023},"citing_paper":{"arxiv_id":"2501.06709","last_updated":"2025-01-12T04:29:39Z","snapshot_observed_at":"2026-08-16T10:50:40.853881Z","submitted_at":"2025-01-12T04:29:39Z","title":"Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:08.435506Z"},"links":{"citing_paper":"/paper/2501.06709"},"observation_digest":"sha256:f531e2b58b72e802efc978d75030c9414a96313b150ce11b28468dbde3083496","observation_id":"37831d52-d151-4bfd-b0d0-10ecd0a38cdc","resolution":{"observed_at":"2026-08-10T20:58:08.965068Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:08.940933Z","title":null,"venue":null,"work_id":"a76d6939-7c90-41b2-a7ef-d913c287f47f","year":1972},"citing_paper":{"arxiv_id":"2501.06709","last_updated":"2025-01-12T04:29:39Z","snapshot_observed_at":"2026-08-16T10:50:40.853881Z","submitted_at":"2025-01-12T04:29:39Z","title":"Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:08.442068Z"},"links":{"citing_paper":"/paper/2501.06709"},"observation_digest":"sha256:e446557ee9cd6d5a83f79c1c16ca92a246732f98bc17f9bc7ad7e16112e8d885","observation_id":"53e40a07-cfdc-4642-8716-f2bc105a4cce","resolution":{"observed_at":"2026-08-10T20:58:08.946688Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:08.922158Z","title":"Adaptive resource provi- sioning for the cloud using online bin packing,","venue":null,"work_id":"891e31d6-5ee8-4591-a06b-f7a7b0d82eca","year":2014},"citing_paper":{"arxiv_id":"2501.06709","last_updated":"2025-01-12T04:29:39Z","snapshot_observed_at":"2026-08-16T10:50:40.853881Z","submitted_at":"2025-01-12T04:29:39Z","title":"Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:08.448959Z"},"links":{"citing_paper":"/paper/2501.06709"},"observation_digest":"sha256:9f300801b2397d15b9343c1d0bc8bf9ae91fb0a8efa8b97e824f5d671987997f","observation_id":"f145516f-1315-48cf-b63d-90fa4948dcbb","resolution":{"observed_at":"2026-08-10T20:58:08.928833Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:08.902236Z","title":"Efficient online strategies for renting servers in the cloud,","venue":null,"work_id":"6db3e78a-3ed8-4577-8a67-d66be6f92645","year":2015},"citing_paper":{"arxiv_id":"2501.06709","last_updated":"2025-01-12T04:29:39Z","snapshot_observed_at":"2026-08-16T10:50:40.853881Z","submitted_at":"2025-01-12T04:29:39Z","title":"Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:08.454685Z"},"links":{"citing_paper":"/paper/2501.06709"},"observation_digest":"sha256:392094893c5f8b352939bfde0a040e7709e337d1bf63e0d90697a530a2b544c7","observation_id":"4abe209a-994f-41df-9d29-5bf5a9aac970","resolution":{"observed_at":"2026-08-10T20:58:08.908341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:08.460910Z","title":"Powernap: eliminating server idle power,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2501.06709","last_updated":"2025-01-12T04:29:39Z","snapshot_observed_at":"2026-08-16T10:50:40.853881Z","submitted_at":"2025-01-12T04:29:39Z","title":"Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:08.460910Z"},"links":{"citing_paper":"/paper/2501.06709"},"observation_digest":"sha256:a8ddfc71d13900ff36d58c4f440d5ebd2d3da06957fea09e5d433a4e93ffff73","observation_id":"71d93163-586b-4e8f-8e20-fef44de7b11d","resolution":{"observed_at":"2026-08-10T20:58:08.460910Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:08.875119Z","title":"Easy, fast, and cheap llm serving for everyone,","venue":null,"work_id":"1955e038-66be-4cf6-aed7-0096c7c8a022","year":2024},"citing_paper":{"arxiv_id":"2501.06709","last_updated":"2025-01-12T04:29:39Z","snapshot_observed_at":"2026-08-16T10:50:40.853881Z","submitted_at":"2025-01-12T04:29:39Z","title":"Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:08.466106Z"},"links":{"citing_paper":"/paper/2501.06709"},"observation_digest":"sha256:4e17eca88c95e502b2ab213842ae9641660435d57c29cd79f4785d1a85e8a592","observation_id":"99c54bf0-4ef5-498b-9932-3f39f792bc10","resolution":{"observed_at":"2026-08-10T20:58:08.885991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:08.853701Z","title":"Ray: a unified framework for scaling ai and python applications,","venue":null,"work_id":"07b9aeb7-415e-4068-818c-7b86d4dcec8c","year":null},"citing_paper":{"arxiv_id":"2501.06709","last_updated":"2025-01-12T04:29:39Z","snapshot_observed_at":"2026-08-16T10:50:40.853881Z","submitted_at":"2025-01-12T04:29:39Z","title":"Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:08.474077Z"},"links":{"citing_paper":"/paper/2501.06709"},"observation_digest":"sha256:2f096b1c0ac7c73522165cddbf9a8fc0a9a4e784a69f76df863a2ddb2e890221","observation_id":"e58c2e49-e9eb-416a-a8f6-336b99cdc3ec","resolution":{"observed_at":"2026-08-10T20:58:08.859845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:08.803441Z","title":"Gloo: Collective communications library with various primitives for multi-machine training,","venue":null,"work_id":"dae3d649-9550-4ede-9556-e1265b1b32b8","year":2024},"citing_paper":{"arxiv_id":"2501.06709","last_updated":"2025-01-12T04:29:39Z","snapshot_observed_at":"2026-08-16T10:50:40.853881Z","submitted_at":"2025-01-12T04:29:39Z","title":"Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:08.486606Z"},"links":{"citing_paper":"/paper/2501.06709"},"observation_digest":"sha256:d7cf1938e1c67e34af962fd2e64a8701d3829b1157524aeea200b2af51b394be","observation_id":"8ecb158a-0e6c-4f84-a2c1-6053038575de","resolution":{"observed_at":"2026-08-10T20:58:08.810006Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:08.784105Z","title":"Openai platform document,","venue":null,"work_id":"9bc027d9-248b-4dc0-be8b-02c3a081bc4c","year":2024},"citing_paper":{"arxiv_id":"2501.06709","last_updated":"2025-01-12T04:29:39Z","snapshot_observed_at":"2026-08-16T10:50:40.853881Z","submitted_at":"2025-01-12T04:29:39Z","title":"Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:08.491510Z"},"links":{"citing_paper":"/paper/2501.06709"},"observation_digest":"sha256:ece0818c232c6888551f3234569fbbd820cbe55cbc018fe1c9820c6ba22a69e5","observation_id":"a36461d3-72c8-4209-b669-8f95285db950","resolution":{"observed_at":"2026-08-10T20:58:08.790533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:08.761323Z","title":"Anthropic platform document,","venue":null,"work_id":"6d6306be-e3c6-41ea-a7be-8d2dcc074827","year":2024},"citing_paper":{"arxiv_id":"2501.06709","last_updated":"2025-01-12T04:29:39Z","snapshot_observed_at":"2026-08-16T10:50:40.853881Z","submitted_at":"2025-01-12T04:29:39Z","title":"Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:08.498820Z"},"links":{"citing_paper":"/paper/2501.06709"},"observation_digest":"sha256:60cf9165d7285d5561cb15871552e53e13fdd829d65e3a1f515304f12ee92178","observation_id":"8f967afb-874f-4d4b-957e-8dee2255b2e4","resolution":{"observed_at":"2026-08-10T20:58:08.769470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:08.829320Z","title":"Available: https://github.com/ray-project/ray","venue":null,"work_id":"1a62ebd2-dc2e-4944-a9a5-5c21e12af5b5","year":null},"citing_paper":{"arxiv_id":"2501.06709","last_updated":"2025-01-12T04:29:39Z","snapshot_observed_at":"2026-08-16T10:50:40.853881Z","submitted_at":"2025-01-12T04:29:39Z","title":"Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:08.479825Z"},"links":{"citing_paper":"/paper/2501.06709"},"observation_digest":"sha256:7891cd5c179fc80c60b0c1e443c9e6e40c6775dc2c233daf11069345b7d0d8fc","observation_id":"4a2d838e-b267-4d3b-8d9e-a7e1500860a8","resolution":{"observed_at":"2026-08-10T20:58:08.836802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.06709","last_updated":"2025-01-12T04:29:39Z","latest_version":1,"primary_category":"cs.DC","snapshot_observed_at":"2026-08-16T10:50:40.853881Z","submitted_at":"2025-01-12T04:29:39Z","title":"Mell: Memory-Efficient Large Language Model Serving via Multi-GPU KV Cache Management"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":2,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":5,"verified_exact":0,"verified_fuzzy":37},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 4 inbound Pith citation observations for arXiv:2501.06709."}