{"as_of":"2026-08-09T23:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7d157f1ddf32e4aa8459b2df8d9810296810a0793e01d8b8ab532ed8a5e4fafc","coverage":[{"denominator":87,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":87,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T16:21:19.946822Z","state":"measured"},{"denominator":87,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":87,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.28150/citation-record","integrity":"/paper/2607.28150/integrity","json":"/paper/2607.28150/citation-record.json","paper":"/paper/2607.28150"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.21318","last_updated":"2025-04-30T05:05:09Z","snapshot_observed_at":"2026-08-08T08:43:53.657438Z","submitted_at":"2025-04-30T05:05:09Z","title":"Phi-4-reasoning Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.21318","snapshot_observed_at":"2026-07-31T16:21:12.065335Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28150","last_updated":"2026-07-30T12:56:05Z","snapshot_observed_at":"2026-08-06T19:16:15.787392Z","submitted_at":"2026-07-30T12:56:05Z","title":"SmartGen: Seamless Disaggregated LLM Inference with Selective KV Cache Transfer","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-31T16:21:12.065335Z"},"links":{"cited_paper":"/paper/2504.21318","citing_paper":"/paper/2607.28150"},"observation_digest":"sha256:4d2ccbffa4476fad73d1e85ac72fd43d8f5bfab8ab4390c542a8c6d21725cfe0","observation_id":"5a1b21e5-e5f4-4521-aeb6-f6de3eb6b26f","resolution":{"observed_at":"2026-07-31T16:21:12.065335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:21:12.156641Z","title":"Gulavani, Alexey Tumanov, and Ramachandran Ramjee","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28150","last_updated":"2026-07-30T12:56:05Z","snapshot_observed_at":"2026-08-06T19:16:15.787392Z","submitted_at":"2026-07-30T12:56:05Z","title":"SmartGen: Seamless Disaggregated LLM Inference with Selective KV Cache Transfer","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-31T16:21:12.156641Z"},"links":{"citing_paper":"/paper/2607.28150"},"observation_digest":"sha256:488667a7b9d7af2b669b4633b2a420830cc408fc4fdcc27297da124244f01bbf","observation_id":"36e1e90f-7664-46b6-9f7b-327600ed9d06","resolution":{"observed_at":"2026-07-31T16:21:12.156641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:21:12.216603Z","title":"Infiniband architecture specification volume 1 release 1.8.https://www.infini bandta.org/ibta-specification, Accessed: 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28150","last_updated":"2026-07-30T12:56:05Z","snapshot_observed_at":"2026-08-06T19:16:15.787392Z","submitted_at":"2026-07-30T12:56:05Z","title":"SmartGen: Seamless Disaggregated LLM Inference with Selective KV Cache Transfer","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-31T16:21:12.216603Z"},"links":{"citing_paper":"/paper/2607.28150"},"observation_digest":"sha256:046a63823d2926f1454a033f476c8a7dee95f97e7bbb4cea1f9d03c9d34c55ba","observation_id":"92ea6a80-45d0-4643-a3d6-1f1627dbc47a","resolution":{"observed_at":"2026-07-31T16:21:12.216603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:21:12.259742Z","title":"LongBench: A bilingual, multitask benchmark for long context understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28150","last_updated":"2026-07-30T12:56:05Z","snapshot_observed_at":"2026-08-06T19:16:15.787392Z","submitted_at":"2026-07-30T12:56:05Z","title":"SmartGen: Seamless Disaggregated LLM Inference with Selective KV Cache Transfer","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-31T16:21:12.259742Z"},"links":{"citing_paper":"/paper/2607.28150"},"observation_digest":"sha256:dd44d715090bcff4261b3bd07daedefcefa88909d46a05999ad16fbb1c51f013","observation_id":"b1bd9d1a-57e5-47ab-a13b-5e2095273bfe","resolution":{"observed_at":"2026-07-31T16:21:12.259742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:21:12.360134Z","title":"TokenFlow: Responsive LLM text stream- ing serving under request burst via preemptive schedul- ing","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28150","last_updated":"2026-07-30T12:56:05Z","snapshot_observed_at":"2026-08-06T19:16:15.787392Z","submitted_at":"2026-07-30T12:56:05Z","title":"SmartGen: Seamless Disaggregated LLM Inference with Selective KV Cache Transfer","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-31T16:21:12.360134Z"},"links":{"citing_paper":"/paper/2607.28150"},"observation_digest":"sha256:affd1e67c48234423b7849d9f7c487a303a484e1ce00e51b7436268234c322cb","observation_id":"90f88231-f561-42ce-b31d-034983fb7af3","resolution":{"observed_at":"2026-07-31T16:21:12.360134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-07-31T16:21:12.479848Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.28150","last_updated":"2026-07-30T12:56:05Z","snapshot_observed_at":"2026-08-06T19:16:15.787392Z","submitted_at":"2026-07-30T12:56:05Z","title":"SmartGen: Seamless Disaggregated LLM Inference with Selective KV Cache Transfer","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-31T16:21:12.479848Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2607.28150"},"observation_digest":"sha256:5a822b01da0b5d0f1f0cd284a1e9df34cca259daeea1e45c8b4320a94321525b","observation_id":"acceb86b-4b7c-4af9-9190-945eabe05800","resolution":{"observed_at":"2026-07-31T16:21:12.479848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:21:12.584938Z","title":"Retroinfer: A vector storage engine for scalable long-context LLM inference","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28150","last_updated":"2026-07-30T12:56:05Z","snapshot_observed_at":"2026-08-06T19:16:15.787392Z","submitted_at":"2026-07-30T12:56:05Z","title":"SmartGen: Seamless Disaggregated LLM Inference with Selective KV Cache Transfer","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-31T16:21:12.584938Z"},"links":{"citing_paper":"/paper/2607.28150"},"observation_digest":"sha256:3e04a35ccd85a177224081ce6b3a945c5255b1bab90a9528521c144290e3c536","observation_id":"20c871b3-a6b3-431d-bc2a-69a82736f6ea","resolution":{"observed_at":"2026-07-31T16:21:12.584938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:21:12.721313Z","title":"Elastic GPU service instance families","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28150","last_updated":"2026-07-30T12:56:05Z","snapshot_observed_at":"2026-08-06T19:16:15.787392Z","submitted_at":"2026-07-30T12:56:05Z","title":"SmartGen: Seamless Disaggregated LLM Inference with Selective KV Cache Transfer","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-31T16:21:12.721313Z"},"links":{"citing_paper":"/paper/2607.28150"},"observation_digest":"sha256:3b774b7472802263b4bd534a8933bd1f3b0762d694ee73bec263be6bc90ca0ad","observation_id":"16178e22-2491-464b-88e5-19fd8f266fd0","resolution":{"observed_at":"2026-07-31T16:21:12.721313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:21:12.833863Z","title":"eRDMA.https://www.alibabacloud .com/help/en/ecs/user-guide/elastic-rdma-erdma, Accessed: 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28150","last_updated":"2026-07-30T12:56:05Z","snapshot_observed_at":"2026-08-06T19:16:15.787392Z","submitted_at":"2026-07-30T12:56:05Z","title":"SmartGen: Seamless Disaggregated LLM Inference with Selective KV Cache Transfer","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-31T16:21:12.833863Z"},"links":{"citing_paper":"/paper/2607.28150"},"observation_digest":"sha256:e0fcdfdf550395b189ce26d3148eaeccfe84af99e1f9fb326ecbb38a5d0d3fa5","observation_id":"18c0429d-1695-4288-acce-c52a2a710416","resolution":{"observed_at":"2026-07-31T16:21:12.833863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:21:12.959928Z","title":"A2 ultra machine types.https://docs.c loud.google.com/compute/docs/accelerator-optimiz ed-machines#a2-ultra-vms, Accessed: 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28150","last_updated":"2026-07-30T12:56:05Z","snapshot_observed_at":"2026-08-06T19:16:15.787392Z","submitted_at":"2026-07-30T12:56:05Z","title":"SmartGen: Seamless Disaggregated LLM Inference with Selective KV Cache Transfer","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-31T16:21:12.959928Z"},"links":{"citing_paper":"/paper/2607.28150"},"observation_digest":"sha256:c49010a1b078e6c063adc15bb35c823e8d6a04eec38f0eefbb9ebc1e58c1fc08","observation_id":"bd7a11f3-3dd1-4e26-8a27-dbf2bf135df9","resolution":{"observed_at":"2026-07-31T16:21:12.959928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:21:13.064781Z","title":"Computing instance.https://www.te ncentcloud.com/document/product/560/19701#GT4, Accessed: 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28150","last_updated":"2026-07-30T12:56:05Z","snapshot_observed_at":"2026-08-06T19:16:15.787392Z","submitted_at":"2026-07-30T12:56:05Z","title":"SmartGen: Seamless Disaggregated LLM Inference with Selective KV Cache Transfer","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-31T16:21:13.064781Z"},"links":{"citing_paper":"/paper/2607.28150"},"observation_digest":"sha256:f893e506b2cf19188e2e583432c2813e1bb449f64ea44e6f8ef108e8794da5c5","observation_id":"c50a4781-be92-40b3-a776-e8fc18801422","resolution":{"observed_at":"2026-07-31T16:21:13.064781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:21:13.135063Z","title":"NVIDIA dynamo platform.https: //developer.nvidia.com/dynamo, Accessed: 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28150","last_updated":"2026-07-30T12:56:05Z","snapshot_observed_at":"2026-08-06T19:16:15.787392Z","submitted_at":"2026-07-30T12:56:05Z","title":"SmartGen: Seamless Disaggregated LLM Inference with Selective KV Cache Transfer","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-31T16:21:13.135063Z"},"links":{"citing_paper":"/paper/2607.28150"},"observation_digest":"sha256:10301bfb8193e91e6f012fb168ff073dc60fa3bdca563ea3d0702c9cdf999315","observation_id":"5257c786-1809-4850-8017-37a35a81bf17","resolution":{"observed_at":"2026-07-31T16:21:13.135063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:21:13.200993Z","title":"Fu, Stefano Ermon, Atri Rudra, and Christopher Ré","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.28150","last_updated":"2026-07-30T12:56:05Z","snapshot_observed_at":"2026-08-06T19:16:15.787392Z","submitted_at":"2026-07-30T12:56:05Z","title":"SmartGen: Seamless Disaggregated LLM Inference with Selective KV Cache Transfer","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-31T16:21:13.200993Z"},"links":{"citing_paper":"/paper/2607.28150"},"observation_digest":"sha256:a13e9fb2585dfc84376fd27785a04ae02aa9074dbba6878885296e482c9f2461","observation_id":"b9706a4c-a753-493a-aaba-c22ae4175ac1","resolution":{"observed_at":"2026-07-31T16:21:13.200993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:21:13.262681Z","title":"Deepseek-v3.2-exp: Boosting long- context efficiency with deepseek sparse attention.https: //github.com/deepseek-ai/DeepSeek-V3.2-Exp/blob/ main/DeepSeek_V3_2.pdf, Accessed: 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28150","last_updated":"2026-07-30T12:56:05Z","snapshot_observed_at":"2026-08-06T19:16:15.787392Z","submitted_at":"2026-07-30T12:56:05Z","title":"SmartGen: Seamless Disaggregated LLM Inference with Selective KV Cache Transfer","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-31T16:21:13.262681Z"},"links":{"citing_paper":"/paper/2607.28150"},"observation_digest":"sha256:ee63034209f514026b0e2a5e04f3cf36dd609218dead483c38f2b91ac137b568","observation_id":"16a4b3a7-8577-4ef3-9b2a-abe8b57b95cf","resolution":{"observed_at":"2026-07-31T16:21:13.262681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-07-31T16:21:13.321893Z","title":"Zhang, Han Bao, Hanwei Xu, Haocheng Wang, Haowei Zhang, Honghui Ding, Huajian Xin, Huazuo Gao, Hui Li, Hui Qu, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28150","last_updated":"2026-07-30T12:56:05Z","snapshot_observed_at":"2026-08-06T19:16:15.787392Z","submitted_at":"2026-07-30T12:56:05Z","title":"SmartGen: Seamless Disaggregated LLM Inference with Selective KV Cache Transfer","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-31T16:21:13.321893Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2607.28150"},"observation_digest":"sha256:c05e6820c2e95cbe25be46882b94e36f70bd7d821e6e71b22347a98bc19e10fc","observation_id":"7ef8f0b6-e997-48f8-89f3-4205d6870e1e","resolution":{"observed_at":"2026-07-31T16:21:13.321893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:21:13.361409Z","title":"Pre- fillOnly: An inference engine for prefill-only workloads in large language model applications","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28150","last_updated":"2026-07-30T12:56:05Z","snapshot_observed_at":"2026-08-06T19:16:15.787392Z","submitted_at":"2026-07-30T12:56:05Z","title":"SmartGen: Seamless Disaggregated LLM Inference with Selective KV Cache Transfer","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-31T16:21:13.361409Z"},"links":{"citing_paper":"/paper/2607.28150"},"observation_digest":"sha256:3c8aab99c2fdad87376d9a953d368eece84c80f6597c44308058176f45b4a1ad","observation_id":"ab829f9a-1c01-4adf-9ac4-70e779731ecc","resolution":{"observed_at":"2026-07-31T16:21:13.361409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:21:13.412761Z","title":"The design and operation of CloudLab","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.28150","last_updated":"2026-07-30T12:56:05Z","snapshot_observed_at":"2026-08-06T19:16:15.787392Z","submitted_at":"2026-07-30T12:56:05Z","title":"SmartGen: Seamless Disaggregated LLM Inference with Selective KV Cache Transfer","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-31T16:21:13.412761Z"},"links":{"citing_paper":"/paper/2607.28150"},"observation_digest":"sha256:fc43852f612c204f84fd21d5da726d37ffd99c6da6aee08a189722acceccd747","observation_id":"8eeae7a4-03c7-47c3-9a1c-e632c27c51a4","resolution":{"observed_at":"2026-07-31T16:21:13.412761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:21:13.463354Z","title":"Graham, Artem Y","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.28150","last_updated":"2026-07-30T12:56:05Z","snapshot_observed_at":"2026-08-06T19:16:15.787392Z","submitted_at":"2026-07-30T12:56:05Z","title":"SmartGen: Seamless Disaggregated LLM Inference with Selective KV Cache Transfer","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-31T16:21:13.463354Z"},"links":{"citing_paper":"/paper/2607.28150"},"observation_digest":"sha256:6a3c8235869327144b26ee0ff214e9cb16cb6889de817226d8d5c248477ae100","observation_id":"7f4ba4ca-34bf-4642-ae95-a4168b81eb4e","resolution":{"observed_at":"2026-07-31T16:21:13.463354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:21:13.530574Z","title":"Cost-efficient large language model serving for multi-turn conversations with CachedAtten- tion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28150","last_updated":"2026-07-30T12:56:05Z","snapshot_observed_at":"2026-08-06T19:16:15.787392Z","submitted_at":"2026-07-30T12:56:05Z","title":"SmartGen: Seamless Disaggregated LLM Inference with Selective KV Cache Transfer","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-31T16:21:13.530574Z"},"links":{"citing_paper":"/paper/2607.28150"},"observation_digest":"sha256:fcccc6b1adf4bc8c2b14d317d21fa2388ff5356000ce75addb1771cbc9ec009b","observation_id":"68f34fcd-5a60-45f1-81f3-51f9404a14e6","resolution":{"observed_at":"2026-07-31T16:21:13.530574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:21:13.606072Z","title":"Fast state restoration in LLM serving with HCache","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28150","last_updated":"2026-07-30T12:56:05Z","snapshot_observed_at":"2026-08-06T19:16:15.787392Z","submitted_at":"2026-07-30T12:56:05Z","title":"SmartGen: Seamless Disaggregated LLM Inference with Selective KV Cache Transfer","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-31T16:21:13.606072Z"},"links":{"citing_paper":"/paper/2607.28150"},"observation_digest":"sha256:8b6b1ffc905a476b5ab9db37e5c6b1d172939dbf5c56fb03de3604fe332035b5","observation_id":"bdfec739-9496-4adb-8558-49c9238dc7a1","resolution":{"observed_at":"2026-07-31T16:21:13.606072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:21:13.665888Z","title":"Weaver: Efficient multi-llm serving with attention offloading","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28150","last_updated":"2026-07-30T12:56:05Z","snapshot_observed_at":"2026-08-06T19:16:15.787392Z","submitted_at":"2026-07-30T12:56:05Z","title":"SmartGen: Seamless Disaggregated LLM Inference with Selective KV Cache Transfer","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-31T16:21:13.665888Z"},"links":{"citing_paper":"/paper/2607.28150"},"observation_digest":"sha256:c73f5782779f3bad94eba0d2e63310229cefb6f0e0e027a36da3fd04e0c3bf60","observation_id":"91e69d8b-16b4-4014-adb1-f4fafcaa5a53","resolution":{"observed_at":"2026-07-31T16:21:13.665888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:21:13.762133Z","title":"Hybrid multi- document summarization using pre-trained language models.Expert Syst","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.28150","last_updated":"2026-07-30T12:56:05Z","snapshot_observed_at":"2026-08-06T19:16:15.787392Z","submitted_at":"2026-07-30T12:56:05Z","title":"SmartGen: Seamless Disaggregated LLM Inference with Selective KV Cache Transfer","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-31T16:21:13.762133Z"},"links":{"citing_paper":"/paper/2607.28150"},"observation_digest":"sha256:7d62483bb9a34ed5fe1de1ab4366cba915fc794f8bffa004c3e7fe32a69d1cbf","observation_id":"f8146844-e22f-4abb-8533-1663cabdc776","resolution":{"observed_at":"2026-07-31T16:21:13.762133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.12237","last_updated":"2019-11-29T09:55:22Z","snapshot_observed_at":"2026-08-06T13:50:27.106878Z","submitted_at":"2019-11-27T15:54:55Z","title":"SAMSum Corpus: A Human-annotated Dialogue Dataset for Abstractive Summarization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.12237","snapshot_observed_at":"2026-07-31T16:21:13.813892Z","title":"SAMSum corpus: A human-annotated dialogue dataset for abstractive summarization.CoRR, abs/1911.12237, 2019","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2607.28150","last_updated":"2026-07-30T12:56:05Z","snapshot_observed_at":"2026-08-06T19:16:15.787392Z","submitted_at":"2026-07-30T12:56:05Z","title":"SmartGen: Seamless Disaggregated LLM Inference with Selective KV Cache Transfer","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-31T16:21:13.813892Z"},"links":{"cited_paper":"/paper/1911.12237","citing_paper":"/paper/2607.28150"},"observation_digest":"sha256:0706df0a9fe65c80e3dbf56c3e9b9f2e099748dde7ff0b85f4f7e882dc155110","observation_id":"c050fe89-1eab-40a2-805b-e11282e526ba","resolution":{"observed_at":"2026-07-31T16:21:13.813892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:21:13.882652Z","title":"HATA: trainable and hardware-efficient hash-aware top-k at- tention for scalable large model inference","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28150","last_updated":"2026-07-30T12:56:05Z","snapshot_observed_at":"2026-08-06T19:16:15.787392Z","submitted_at":"2026-07-30T12:56:05Z","title":"SmartGen: Seamless Disaggregated LLM Inference with Selective KV Cache Transfer","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-31T16:21:13.882652Z"},"links":{"citing_paper":"/paper/2607.28150"},"observation_digest":"sha256:875c5f0a2d715b83c9471af368e9565e2be7375155d57b0672420a325e80102e","observation_id":"219f1b3b-220d-4a35-92e8-f0d330fcdfa8","resolution":{"observed_at":"2026-07-31T16:21:13.882652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:21:14.049340Z","title":"Olive: Accelerating large language models via hardware-friendly outlier-victim pair quantization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28150","last_updated":"2026-07-30T12:56:05Z","snapshot_observed_at":"2026-08-06T19:16:15.787392Z","submitted_at":"2026-07-30T12:56:05Z","title":"SmartGen: Seamless Disaggregated LLM Inference with Selective KV Cache Transfer","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-31T16:21:14.049340Z"},"links":{"citing_paper":"/paper/2607.28150"},"observation_digest":"sha256:a50ba304b2ec8b95dc5d54e5a5f780fb2abbeca24b6aabbc0f4a9a8b5d60ce29","observation_id":"db2f6316-a3f1-415c-84ab-0a00d025d108","resolution":{"observed_at":"2026-07-31T16:21:14.049340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:21:14.163297Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28150","last_updated":"2026-07-30T12:56:05Z","snapshot_observed_at":"2026-08-06T19:16:15.787392Z","submitted_at":"2026-07-30T12:56:05Z","title":"SmartGen: Seamless Disaggregated LLM Inference with Selective KV Cache Transfer","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-31T16:21:14.163297Z"},"links":{"citing_paper":"/paper/2607.28150"},"observation_digest":"sha256:ac59470348199164eb034c6bb0ace4585494937e3ecc551d5231f836e635fcf9","observation_id":"ec1bfb5d-b426-49a8-90d9-e39889c655cf","resolution":{"observed_at":"2026-07-31T16:21:14.163297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:21:14.336284Z","title":"OmniKV: Dynamic context selection for efficient long-context LLMs","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28150","last_updated":"2026-07-30T12:56:05Z","snapshot_observed_at":"2026-08-06T19:16:15.787392Z","submitted_at":"2026-07-30T12:56:05Z","title":"SmartGen: Seamless Disaggregated LLM Inference with Selective KV Cache Transfer","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-31T16:21:14.336284Z"},"links":{"citing_paper":"/paper/2607.28150"},"observation_digest":"sha256:ccb9737fc92d5d6027e752707f90004a185904cca82f5e5ae2187b43ced40d37","observation_id":"768defe2-4ffd-475a-85c2-35e87c35f7f0","resolution":{"observed_at":"2026-07-31T16:21:14.336284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:21:14.452112Z","title":"WaferLLM: Large language model inference at wafer scale","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28150","last_updated":"2026-07-30T12:56:05Z","snapshot_observed_at":"2026-08-06T19:16:15.787392Z","submitted_at":"2026-07-30T12:56:05Z","title":"SmartGen: Seamless Disaggregated LLM Inference with Selective KV Cache Transfer","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-31T16:21:14.452112Z"},"links":{"citing_paper":"/paper/2607.28150"},"observation_digest":"sha256:ed8671ec6de5be1bd61e06ea9e21525547c1062f79aeff8b71dabd9381077e8a","observation_id":"e3109b47-3e74-44ff-8ce5-7f54b51ffd9e","resolution":{"observed_at":"2026-07-31T16:21:14.452112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:21:14.600544Z","title":"Constructing A multi-hop QA dataset for comprehensive evaluation of reasoning steps","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.28150","last_updated":"2026-07-30T12:56:05Z","snapshot_observed_at":"2026-08-06T19:16:15.787392Z","submitted_at":"2026-07-30T12:56:05Z","title":"SmartGen: Seamless Disaggregated LLM Inference with Selective KV Cache Transfer","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-31T16:21:14.600544Z"},"links":{"citing_paper":"/paper/2607.28150"},"observation_digest":"sha256:87623c38406261dbae66068dc0b6c8494ba695aae5243677e72d70b038983b70","observation_id":"3c1493b0-fd7f-4b3e-9cfd-d922e82bcefc","resolution":{"observed_at":"2026-07-31T16:21:14.600544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:21:14.757015Z","title":"Mahoney, Yakun Sophia Shao, Kurt Keutzer, and Amir Gholami","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28150","last_updated":"2026-07-30T12:56:05Z","snapshot_observed_at":"2026-08-06T19:16:15.787392Z","submitted_at":"2026-07-30T12:56:05Z","title":"SmartGen: Seamless Disaggregated LLM Inference with Selective KV Cache Transfer","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-31T16:21:14.757015Z"},"links":{"citing_paper":"/paper/2607.28150"},"observation_digest":"sha256:045efbc3709c0036d32004538d77bc79473d137cf65f7982fbca46090343e5c1","observation_id":"a198e9ad-aeb4-4d46-9291-79305597b009","resolution":{"observed_at":"2026-07-31T16:21:14.757015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.11181","last_updated":"2024-01-20T09:43:36Z","snapshot_observed_at":"2026-08-05T23:35:16.350557Z","submitted_at":"2024-01-20T09:43:36Z","title":"Inference without Interference: Disaggregate LLM Inference for Mixed Downstream Workloads","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.11181","snapshot_observed_at":"2026-07-31T16:21:14.862617Z","title":"Inference without interference: Disaggregate LLM in- ference for mixed downstream workloads.CoRR, abs/2401.11181, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28150","last_updated":"2026-07-30T12:56:05Z","snapshot_observed_at":"2026-08-06T19:16:15.787392Z","submitted_at":"2026-07-30T12:56:05Z","title":"SmartGen: Seamless Disaggregated LLM Inference with Selective KV Cache Transfer","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-31T16:21:14.862617Z"},"links":{"cited_paper":"/paper/2401.11181","citing_paper":"/paper/2607.28150"},"observation_digest":"sha256:db327048d4a31beb38ed992ba841939bc96a6155b08c848c3c9c1e253c8e7aa0","observation_id":"88f9298f-b660-4f3d-8b42-61c58cd035e9","resolution":{"observed_at":"2026-07-31T16:21:14.862617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:21:14.985128Z","title":"Efficient attentions for long document summarization","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.28150","last_updated":"2026-07-30T12:56:05Z","snapshot_observed_at":"2026-08-06T19:16:15.787392Z","submitted_at":"2026-07-30T12:56:05Z","title":"SmartGen: Seamless Disaggregated LLM Inference with Selective KV Cache Transfer","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-31T16:21:14.985128Z"},"links":{"citing_paper":"/paper/2607.28150"},"observation_digest":"sha256:8dd5dacb1df913651c01be738d0e02310f4fcde20df6ebe26c604423a481070d","observation_id":"d39c685a-19f3-414b-8a27-6b841a53c3f4","resolution":{"observed_at":"2026-07-31T16:21:14.985128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:21:15.132083Z","title":"Kamath, Ramya Prabhu, Jayashree Mohan, Si- mon Peter, Ramachandran Ramjee, and Ashish Panwar","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28150","last_updated":"2026-07-30T12:56:05Z","snapshot_observed_at":"2026-08-06T19:16:15.787392Z","submitted_at":"2026-07-30T12:56:05Z","title":"SmartGen: Seamless Disaggregated LLM Inference with Selective KV Cache Transfer","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-31T16:21:15.132083Z"},"links":{"citing_paper":"/paper/2607.28150"},"observation_digest":"sha256:d87cf407e3e5bc1409116f94eb0e97267909c4fc1968eb9aa44762a6b86983ff","observation_id":"b40def8a-c8e6-42a3-a7f2-cc4873d9822f","resolution":{"observed_at":"2026-07-31T16:21:15.132083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:21:15.245943Z","title":"Oaken: Fast and efficient LLM serving with online-offline hybrid KV cache quantization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28150","last_updated":"2026-07-30T12:56:05Z","snapshot_observed_at":"2026-08-06T19:16:15.787392Z","submitted_at":"2026-07-30T12:56:05Z","title":"SmartGen: Seamless Disaggregated LLM Inference with Selective KV Cache Transfer","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-31T16:21:15.245943Z"},"links":{"citing_paper":"/paper/2607.28150"},"observation_digest":"sha256:d9b2531b4b71c0216aa99351b0fba67a0b969d723b46bb0fcdab846dc597f26e","observation_id":"8fa02f65-eb89-4e6b-bea6-7c9341a4a8a8","resolution":{"observed_at":"2026-07-31T16:21:15.245943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:21:15.349109Z","title":"Aqua: Network-accelerated memory offloading for llms in scale-up GPU domains","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28150","last_updated":"2026-07-30T12:56:05Z","snapshot_observed_at":"2026-08-06T19:16:15.787392Z","submitted_at":"2026-07-30T12:56:05Z","title":"SmartGen: Seamless Disaggregated LLM Inference with Selective KV Cache Transfer","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-31T16:21:15.349109Z"},"links":{"citing_paper":"/paper/2607.28150"},"observation_digest":"sha256:17fba8b9b9fb424d390ee60bf222436dffe8e29b3e6fc76f2194ab036b3f031f","observation_id":"f7ba4d0b-9423-4b9d-913c-c231645e266c","resolution":{"observed_at":"2026-07-31T16:21:15.349109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:21:15.510728Z","title":"Efficient memory management for large language model serving with PagedAttention","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28150","last_updated":"2026-07-30T12:56:05Z","snapshot_observed_at":"2026-08-06T19:16:15.787392Z","submitted_at":"2026-07-30T12:56:05Z","title":"SmartGen: Seamless Disaggregated LLM Inference with Selective KV Cache Transfer","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-31T16:21:15.510728Z"},"links":{"citing_paper":"/paper/2607.28150"},"observation_digest":"sha256:ee300c10c8bebcc869a22eba814ae576d05d22b1a2545c6feec19b59e9e838d7","observation_id":"24cbc52d-330e-4989-9f4a-90e53d334753","resolution":{"observed_at":"2026-07-31T16:21:15.510728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:21:15.620746Z","title":"InfiniGen: Efficient generative inference of large language models with dynamic KV cache management","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28150","last_updated":"2026-07-30T12:56:05Z","snapshot_observed_at":"2026-08-06T19:16:15.787392Z","submitted_at":"2026-07-30T12:56:05Z","title":"SmartGen: Seamless Disaggregated LLM Inference with Selective KV Cache Transfer","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-31T16:21:15.620746Z"},"links":{"citing_paper":"/paper/2607.28150"},"observation_digest":"sha256:cce6e92c6369a41d05a60baf9d6a95a0de01b9189d2edcd2fca7ea5f64e5dba9","observation_id":"17372a46-8264-4d95-afef-b95fe357b59f","resolution":{"observed_at":"2026-07-31T16:21:15.620746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:21:15.687846Z","title":"ClusterKV: Manipulating LLM KV cache in semantic space for recallable compression","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28150","last_updated":"2026-07-30T12:56:05Z","snapshot_observed_at":"2026-08-06T19:16:15.787392Z","submitted_at":"2026-07-30T12:56:05Z","title":"SmartGen: Seamless Disaggregated LLM Inference with Selective KV Cache Transfer","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-31T16:21:15.687846Z"},"links":{"citing_paper":"/paper/2607.28150"},"observation_digest":"sha256:a4736e8b99bac7717653630f9d0fa308358382ead1d0ec991463dfe8c04ffc2f","observation_id":"480830a5-bd9f-437d-af28-cd77bd7bdc71","resolution":{"observed_at":"2026-07-31T16:21:15.687846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:21:15.781253Z","title":"Cachegen: KV cache compression and streaming for fast large language model serving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28150","last_updated":"2026-07-30T12:56:05Z","snapshot_observed_at":"2026-08-06T19:16:15.787392Z","submitted_at":"2026-07-30T12:56:05Z","title":"SmartGen: Seamless Disaggregated LLM Inference with Selective KV Cache Transfer","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-31T16:21:15.781253Z"},"links":{"citing_paper":"/paper/2607.28150"},"observation_digest":"sha256:b7867cc8bd64b8d890be37b619b5bd8b43a106ffb82f9428bf30c0e8d7b86e3e","observation_id":"9168d745-635f-4f6e-8fa4-8e125894b1df","resolution":{"observed_at":"2026-07-31T16:21:15.781253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:21:15.839066Z","title":"Helix: Serving large language models over heterogeneous GPUs and network via max-flow","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28150","last_updated":"2026-07-30T12:56:05Z","snapshot_observed_at":"2026-08-06T19:16:15.787392Z","submitted_at":"2026-07-30T12:56:05Z","title":"SmartGen: Seamless Disaggregated LLM Inference with Selective KV Cache Transfer","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-31T16:21:15.839066Z"},"links":{"citing_paper":"/paper/2607.28150"},"observation_digest":"sha256:457cfaa5d8acd8b73f601edb86d1b6d09b541732db2346be63495263a26cfb8f","observation_id":"6d4893e6-b746-483c-bb52-f4cf6674b763","resolution":{"observed_at":"2026-07-31T16:21:15.839066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:21:15.924508Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28150","last_updated":"2026-07-30T12:56:05Z","snapshot_observed_at":"2026-08-06T19:16:15.787392Z","submitted_at":"2026-07-30T12:56:05Z","title":"SmartGen: Seamless Disaggregated LLM Inference with Selective KV Cache Transfer","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-31T16:21:15.924508Z"},"links":{"citing_paper":"/paper/2607.28150"},"observation_digest":"sha256:a85e21820767864134d7e0240220c480bb88b5c8e3915748c4b01eb973b37993","observation_id":"4a679fda-2331-4e5e-9665-2264f296e165","resolution":{"observed_at":"2026-07-31T16:21:15.924508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:21:16.042849Z","title":"Heterogeneity-aware cluster scheduling policies for deep learning workloads","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.28150","last_updated":"2026-07-30T12:56:05Z","snapshot_observed_at":"2026-08-06T19:16:15.787392Z","submitted_at":"2026-07-30T12:56:05Z","title":"SmartGen: Seamless Disaggregated LLM Inference with Selective KV Cache Transfer","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-31T16:21:16.042849Z"},"links":{"citing_paper":"/paper/2607.28150"},"observation_digest":"sha256:be4b7cb22d4caefcb6b0bf18ec8000ff95de99f81509fdecc35951b82380441e","observation_id":"d78d0d49-af54-4119-9d9a-f3f00887bd17","resolution":{"observed_at":"2026-07-31T16:21:16.042849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:21:16.128417Z","title":"GPT-5 is here.https://openai.com/gpt-5, Accessed: 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28150","last_updated":"2026-07-30T12:56:05Z","snapshot_observed_at":"2026-08-06T19:16:15.787392Z","submitted_at":"2026-07-30T12:56:05Z","title":"SmartGen: Seamless Disaggregated LLM Inference with Selective KV Cache Transfer","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-31T16:21:16.128417Z"},"links":{"citing_paper":"/paper/2607.28150"},"observation_digest":"sha256:4e5160dddb29b2ab4558b87dfe4d6fd28fe24548cf63aacec23d1aff00c4bfa7","observation_id":"71bf4129-a72d-4573-bac6-9efb850ce811","resolution":{"observed_at":"2026-07-31T16:21:16.128417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:21:16.241941Z","title":"InstAttention: In-storage attention offloading for cost-effective long-context LLM inference","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28150","last_updated":"2026-07-30T12:56:05Z","snapshot_observed_at":"2026-08-06T19:16:15.787392Z","submitted_at":"2026-07-30T12:56:05Z","title":"SmartGen: Seamless Disaggregated LLM Inference with Selective KV Cache Transfer","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-31T16:21:16.241941Z"},"links":{"citing_paper":"/paper/2607.28150"},"observation_digest":"sha256:b0a94ff4c2a10f3efec8acccb5b3b9cedc0678b8c3638b49a4392a80c2b086fd","observation_id":"b7f1b082-5cf6-48bb-9c06-8d658b5b644d","resolution":{"observed_at":"2026-07-31T16:21:16.241941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:21:16.318560Z","title":"Splitwise: Efficient generative LLM inference using phase splitting","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28150","last_updated":"2026-07-30T12:56:05Z","snapshot_observed_at":"2026-08-06T19:16:15.787392Z","submitted_at":"2026-07-30T12:56:05Z","title":"SmartGen: Seamless Disaggregated LLM Inference with Selective KV Cache Transfer","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-31T16:21:16.318560Z"},"links":{"citing_paper":"/paper/2607.28150"},"observation_digest":"sha256:57a5796b1483131e23de71440740a26052724d05681781875d115f8c562e0311","observation_id":"abe3057a-892d-4051-bb43-c6f60a269d71","resolution":{"observed_at":"2026-07-31T16:21:16.318560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:21:16.451886Z","title":"vAttention: Dynamic memory management for serving llms with- out PagedAttention","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28150","last_updated":"2026-07-30T12:56:05Z","snapshot_observed_at":"2026-08-06T19:16:15.787392Z","submitted_at":"2026-07-30T12:56:05Z","title":"SmartGen: Seamless Disaggregated LLM Inference with Selective KV Cache Transfer","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-31T16:21:16.451886Z"},"links":{"citing_paper":"/paper/2607.28150"},"observation_digest":"sha256:9425c5887ec4e3cf80a6ebb856d5e48983f059c80ef0c899517daeb8cab70c00","observation_id":"27130887-cb0f-40a2-b12a-76381da4c0e3","resolution":{"observed_at":"2026-07-31T16:21:16.451886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:21:16.537189Z","title":"Mooncake: Trading more storage for less computation - A kvcache-centric architecture for serving LLM chatbot","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28150","last_updated":"2026-07-30T12:56:05Z","snapshot_observed_at":"2026-08-06T19:16:15.787392Z","submitted_at":"2026-07-30T12:56:05Z","title":"SmartGen: Seamless Disaggregated LLM Inference with Selective KV Cache Transfer","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-31T16:21:16.537189Z"},"links":{"citing_paper":"/paper/2607.28150"},"observation_digest":"sha256:e6463dc405b920af2ca88c5ec638f59cb8a8aa6cbde9c02ffcbd9a66fb3c5cb0","observation_id":"b5e26cee-d669-45e7-882f-c3eb61e3177f","resolution":{"observed_at":"2026-07-31T16:21:16.537189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:21:16.641220Z","title":"Breakfast of champions: to- wards zero-copy serialization with NIC scatter-gather","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.28150","last_updated":"2026-07-30T12:56:05Z","snapshot_observed_at":"2026-08-06T19:16:15.787392Z","submitted_at":"2026-07-30T12:56:05Z","title":"SmartGen: Seamless Disaggregated LLM Inference with Selective KV Cache Transfer","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-31T16:21:16.641220Z"},"links":{"citing_paper":"/paper/2607.28150"},"observation_digest":"sha256:2c47d4c43b4b6e0d6c9fc5153ea9ae5e485da31692dd1f512cfc7844aa055b61","observation_id":"d6ea45bf-cee7-42e9-9983-df5588d67c2d","resolution":{"observed_at":"2026-07-31T16:21:16.641220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12950","last_updated":"2024-01-31T19:47:26Z","snapshot_observed_at":"2026-07-06T16:10:07.931347Z","submitted_at":"2023-08-24T17:39:13Z","title":"Code Llama: Open Foundation Models for Code","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12950","snapshot_observed_at":"2026-07-31T16:21:16.739282Z","title":"Code Llama: Open foundation models for code.CoRR, abs/2308.12950, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28150","last_updated":"2026-07-30T12:56:05Z","snapshot_observed_at":"2026-08-06T19:16:15.787392Z","submitted_at":"2026-07-30T12:56:05Z","title":"SmartGen: Seamless Disaggregated LLM Inference with Selective KV Cache Transfer","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-31T16:21:16.739282Z"},"links":{"cited_paper":"/paper/2308.12950","citing_paper":"/paper/2607.28150"},"observation_digest":"sha256:cde03375e3c286aeee7d0c473201d47d92b209131468c4009bf59055cae0a445","observation_id":"0d950655-6fe7-4926-aac1-f3e6f96b0c3f","resolution":{"observed_at":"2026-07-31T16:21:16.739282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:21:16.813479Z","title":"Partner success with AWS.http s://aws.amazon.com/partners/success, Accessed: 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28150","last_updated":"2026-07-30T12:56:05Z","snapshot_observed_at":"2026-08-06T19:16:15.787392Z","submitted_at":"2026-07-30T12:56:05Z","title":"SmartGen: Seamless Disaggregated LLM Inference with Selective KV Cache Transfer","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-31T16:21:16.813479Z"},"links":{"citing_paper":"/paper/2607.28150"},"observation_digest":"sha256:18ac156911aed6a23ca8e6afbbece2594bf29c95bd41f1d59bcf6f85e503b5b5","observation_id":"447a7dc3-5d2d-423e-bdfa-5ff0092eab9e","resolution":{"observed_at":"2026-07-31T16:21:16.813479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:21:16.899455Z","title":"Recommended GPU instances","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28150","last_updated":"2026-07-30T12:56:05Z","snapshot_observed_at":"2026-08-06T19:16:15.787392Z","submitted_at":"2026-07-30T12:56:05Z","title":"SmartGen: Seamless Disaggregated LLM Inference with Selective KV Cache Transfer","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-31T16:21:16.899455Z"},"links":{"citing_paper":"/paper/2607.28150"},"observation_digest":"sha256:b72d3b9c80772dd691e9b679dcece2a6fc5b51341cf33631ee64a6d7a6418214","observation_id":"ee8d85d9-7e40-4039-838e-17fa95eaebbb","resolution":{"observed_at":"2026-07-31T16:21:16.899455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:21:16.985377Z","title":"Gonzalez, and Ion Stoica","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28150","last_updated":"2026-07-30T12:56:05Z","snapshot_observed_at":"2026-08-06T19:16:15.787392Z","submitted_at":"2026-07-30T12:56:05Z","title":"SmartGen: Seamless Disaggregated LLM Inference with Selective KV Cache Transfer","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-31T16:21:16.985377Z"},"links":{"citing_paper":"/paper/2607.28150"},"observation_digest":"sha256:3c5d870f2c440fe0dd8ba9588ff28d5f7ece53168f809039a9c6de89978f64df","observation_id":"c047fda4-07cc-4f71-b038-ff25ef0f7af2","resolution":{"observed_at":"2026-07-31T16:21:16.985377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:21:17.076373Z","title":"FlexGen: High-throughput generative inference of large language models with a single GPU","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28150","last_updated":"2026-07-30T12:56:05Z","snapshot_observed_at":"2026-08-06T19:16:15.787392Z","submitted_at":"2026-07-30T12:56:05Z","title":"SmartGen: Seamless Disaggregated LLM Inference with Selective KV Cache Transfer","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-31T16:21:17.076373Z"},"links":{"citing_paper":"/paper/2607.28150"},"observation_digest":"sha256:42d0406a9334bf63dafad5e35687531b6f8eb72fa3570ffe3196f09ae39eff7d","observation_id":"9af42044-f506-4a87-9fec-2e54abad43cf","resolution":{"observed_at":"2026-07-31T16:21:17.076373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:21:17.144547Z","title":"Maguire Jr., and Dejan Kostic","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28150","last_updated":"2026-07-30T12:56:05Z","snapshot_observed_at":"2026-08-06T19:16:15.787392Z","submitted_at":"2026-07-30T12:56:05Z","title":"SmartGen: Seamless Disaggregated LLM Inference with Selective KV Cache Transfer","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-31T16:21:17.144547Z"},"links":{"citing_paper":"/paper/2607.28150"},"observation_digest":"sha256:cc33e96993a32e36f3c335a8aee7507b00ed54dae934c1a21e04d26b8725f1a4","observation_id":"707ee9f0-01b3-45d7-a105-d5db55c090ac","resolution":{"observed_at":"2026-07-31T16:21:17.144547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:21:17.265620Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28150","last_updated":"2026-07-30T12:56:05Z","snapshot_observed_at":"2026-08-06T19:16:15.787392Z","submitted_at":"2026-07-30T12:56:05Z","title":"SmartGen: Seamless Disaggregated LLM Inference with Selective KV Cache Transfer","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-31T16:21:17.265620Z"},"links":{"citing_paper":"/paper/2607.28150"},"observation_digest":"sha256:debb9f500625718c2c89d4823a20218a0ef1b33047011b392e81a2f2f4b48094","observation_id":"dbc46c3f-e186-4485-85f6-8d25c5de5894","resolution":{"observed_at":"2026-07-31T16:21:17.265620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:21:17.444363Z","title":"PowerInfer: Fast large language model serving with a consumer-grade GPU","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28150","last_updated":"2026-07-30T12:56:05Z","snapshot_observed_at":"2026-08-06T19:16:15.787392Z","submitted_at":"2026-07-30T12:56:05Z","title":"SmartGen: Seamless Disaggregated LLM Inference with Selective KV Cache Transfer","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-31T16:21:17.444363Z"},"links":{"citing_paper":"/paper/2607.28150"},"observation_digest":"sha256:ce5a8c7cb02a5325831d7f0c7570dd21c5a604fe50f3ea313ac4a80e1380791d","observation_id":"89ed69c4-7aa6-4a59-bc1c-b0c462225e9b","resolution":{"observed_at":"2026-07-31T16:21:17.444363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:21:17.514460Z","title":"Preble: Efficient distributed prompt scheduling for LLM serving","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28150","last_updated":"2026-07-30T12:56:05Z","snapshot_observed_at":"2026-08-06T19:16:15.787392Z","submitted_at":"2026-07-30T12:56:05Z","title":"SmartGen: Seamless Disaggregated LLM Inference with Selective KV Cache Transfer","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-31T16:21:17.514460Z"},"links":{"citing_paper":"/paper/2607.28150"},"observation_digest":"sha256:5d5e58139cace2dc14b3e89750204f0f9b1dc69d0aea4a2d548bebdfc1d01cfa","observation_id":"51f82ed7-c4e8-4c3d-b5f3-aeb6c480360b","resolution":{"observed_at":"2026-07-31T16:21:17.514460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:21:17.609483Z","title":"Déjàvu: Kv-cache stream- ing for fast, fault-tolerant generative LLM serving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28150","last_updated":"2026-07-30T12:56:05Z","snapshot_observed_at":"2026-08-06T19:16:15.787392Z","submitted_at":"2026-07-30T12:56:05Z","title":"SmartGen: Seamless Disaggregated LLM Inference with Selective KV Cache Transfer","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-31T16:21:17.609483Z"},"links":{"citing_paper":"/paper/2607.28150"},"observation_digest":"sha256:176fc7369e73b7c005c81e789f47a91f35d912d6fbb8b2af5a313a3afaf1bb96","observation_id":"5d28ecb4-9dd4-4959-a4b1-fb00d6b26d62","resolution":{"observed_at":"2026-07-31T16:21:17.609483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:21:17.673473Z","title":"QUEST: query-aware sparsity for efficient long-context LLM inference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28150","last_updated":"2026-07-30T12:56:05Z","snapshot_observed_at":"2026-08-06T19:16:15.787392Z","submitted_at":"2026-07-30T12:56:05Z","title":"SmartGen: Seamless Disaggregated LLM Inference with Selective KV Cache Transfer","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-31T16:21:17.673473Z"},"links":{"citing_paper":"/paper/2607.28150"},"observation_digest":"sha256:a5af18002e6755d1d75f4187a3723d33d288467b63ad49bb3b7e9c42c4b61d37","observation_id":"53cef9d2-a140-470a-a865-0969cd1daecd","resolution":{"observed_at":"2026-07-31T16:21:17.673473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-07-31T16:21:17.746835Z","title":"Gemma 3 technical report.CoRR, abs/2503.19786, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28150","last_updated":"2026-07-30T12:56:05Z","snapshot_observed_at":"2026-08-06T19:16:15.787392Z","submitted_at":"2026-07-30T12:56:05Z","title":"SmartGen: Seamless Disaggregated LLM Inference with Selective KV Cache Transfer","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-31T16:21:17.746835Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2607.28150"},"observation_digest":"sha256:c70325bca7f5667be167ea56074cbde657870ec01a3742173fe56e783f33a8c6","observation_id":"89b885dc-3922-4b61-ba37-07abbaaa4c40","resolution":{"observed_at":"2026-07-31T16:21:17.746835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-31T16:21:17.878772Z","title":"The llama 3 herd of models.CoRR, abs/2407.21783, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28150","last_updated":"2026-07-30T12:56:05Z","snapshot_observed_at":"2026-08-06T19:16:15.787392Z","submitted_at":"2026-07-30T12:56:05Z","title":"SmartGen: Seamless Disaggregated LLM Inference with Selective KV Cache Transfer","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-07-31T16:21:17.878772Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2607.28150"},"observation_digest":"sha256:e0f096834761df59d4e5ca3d8311fccdfe52d4deabff23e4530c05b359717216","observation_id":"c0ec2726-551d-4284-97bd-3eac364d487d","resolution":{"observed_at":"2026-07-31T16:21:17.878772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-31T16:21:17.977097Z","title":"Qwen3 technical report.CoRR, abs/2505.09388, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28150","last_updated":"2026-07-30T12:56:05Z","snapshot_observed_at":"2026-08-06T19:16:15.787392Z","submitted_at":"2026-07-30T12:56:05Z","title":"SmartGen: Seamless Disaggregated LLM Inference with Selective KV Cache Transfer","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-31T16:21:17.977097Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.28150"},"observation_digest":"sha256:c6067f9677911184fd07d97673afc5a647c5556662565d06d4895bc5c9d2c816","observation_id":"690116a3-8c48-4e8c-a601-00df14918396","resolution":{"observed_at":"2026-07-31T16:21:17.977097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:21:18.061323Z","title":"Gomez, Lukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.28150","last_updated":"2026-07-30T12:56:05Z","snapshot_observed_at":"2026-08-06T19:16:15.787392Z","submitted_at":"2026-07-30T12:56:05Z","title":"SmartGen: Seamless Disaggregated LLM Inference with Selective KV Cache Transfer","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-07-31T16:21:18.061323Z"},"links":{"citing_paper":"/paper/2607.28150"},"observation_digest":"sha256:b582458210ba43028d52bd9dc8e8c9bf815652fa99a42c4e4a5064d2e4819cc2","observation_id":"b44aee88-2c5d-4a16-9047-addd2b89c0bd","resolution":{"observed_at":"2026-07-31T16:21:18.061323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:21:18.149540Z","title":"KVCache cache in the wild: Characterizing and optimizing KVCache cache at a large cloud provider, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28150","last_updated":"2026-07-30T12:56:05Z","snapshot_observed_at":"2026-08-06T19:16:15.787392Z","submitted_at":"2026-07-30T12:56:05Z","title":"SmartGen: Seamless Disaggregated LLM Inference with Selective KV Cache Transfer","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-07-31T16:21:18.149540Z"},"links":{"citing_paper":"/paper/2607.28150"},"observation_digest":"sha256:dacf94c8174d4428be26d398684a301e1774124bfb34bea9bf867e1ee54ea187","observation_id":"07710b8f-929d-4d72-b195-898d83b6990d","resolution":{"observed_at":"2026-07-31T16:21:18.149540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:21:18.205939Z","title":"From prefix cache to fusion RAG cache: Accelerating LLM inference in retrieval-augmented generation.CoRR, abs/2601.12904, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28150","last_updated":"2026-07-30T12:56:05Z","snapshot_observed_at":"2026-08-06T19:16:15.787392Z","submitted_at":"2026-07-30T12:56:05Z","title":"SmartGen: Seamless Disaggregated LLM Inference with Selective KV Cache Transfer","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-07-31T16:21:18.205939Z"},"links":{"citing_paper":"/paper/2607.28150"},"observation_digest":"sha256:1861ada923dae8e0ad1ba8499f832a4c17c16ff38bf1f6718a9f25bd057a3091","observation_id":"20d9eb3b-868a-40b7-b2fa-190b65c8cbee","resolution":{"observed_at":"2026-07-31T16:21:18.205939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:21:18.286738Z","title":"Element-aware summarization with large language models: Expert-aligned evaluation and chain-of- thought method","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28150","last_updated":"2026-07-30T12:56:05Z","snapshot_observed_at":"2026-08-06T19:16:15.787392Z","submitted_at":"2026-07-30T12:56:05Z","title":"SmartGen: Seamless Disaggregated LLM Inference with Selective KV Cache Transfer","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-07-31T16:21:18.286738Z"},"links":{"citing_paper":"/paper/2607.28150"},"observation_digest":"sha256:aebd5c3f312419989a6920993770983ddd49b6a015da177902f755b963d11165","observation_id":"24c399bc-9622-4b97-9ed9-f5c1554eaaa7","resolution":{"observed_at":"2026-07-31T16:21:18.286738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:21:18.371796Z","title":"Phoenixos: Concurrent os-level GPU checkpoint and restore with validated speculation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28150","last_updated":"2026-07-30T12:56:05Z","snapshot_observed_at":"2026-08-06T19:16:15.787392Z","submitted_at":"2026-07-30T12:56:05Z","title":"SmartGen: Seamless Disaggregated LLM Inference with Selective KV Cache Transfer","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-07-31T16:21:18.371796Z"},"links":{"citing_paper":"/paper/2607.28150"},"observation_digest":"sha256:68cf86517633531d670bf655dd43d4033d3a2eb247af0b25d04684a9f12308bd","observation_id":"30eca377-2f8e-4662-b1aa-9842445cd7ed","resolution":{"observed_at":"2026-07-31T16:21:18.371796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:21:18.481672Z","title":"LoongServe: Efficiently serv- ing long-context large language models with elastic se- quence parallelism","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28150","last_updated":"2026-07-30T12:56:05Z","snapshot_observed_at":"2026-08-06T19:16:15.787392Z","submitted_at":"2026-07-30T12:56:05Z","title":"SmartGen: Seamless Disaggregated LLM Inference with Selective KV Cache Transfer","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-07-31T16:21:18.481672Z"},"links":{"citing_paper":"/paper/2607.28150"},"observation_digest":"sha256:aeb06893757fc903447bdcb08369586a6f9f576dbc2f11e1dc6a4cf7dd94ddfa","observation_id":"faa59009-37cc-4db8-96e1-f6165a693b8d","resolution":{"observed_at":"2026-07-31T16:21:18.481672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:21:18.554551Z","title":"DuoAttention: Efficient long-context LLM inference with retrieval and streaming heads","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28150","last_updated":"2026-07-30T12:56:05Z","snapshot_observed_at":"2026-08-06T19:16:15.787392Z","submitted_at":"2026-07-30T12:56:05Z","title":"SmartGen: Seamless Disaggregated LLM Inference with Selective KV Cache Transfer","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-07-31T16:21:18.554551Z"},"links":{"citing_paper":"/paper/2607.28150"},"observation_digest":"sha256:b0b4d91c9008ed2664e667083091aae21c86fce95d84d2d5cb747718e44baa67","observation_id":"afb05c1d-4a7a-4e15-88a7-17e8ff8fff54","resolution":{"observed_at":"2026-07-31T16:21:18.554551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:21:18.644504Z","title":"Efficient streaming language models with attention sinks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28150","last_updated":"2026-07-30T12:56:05Z","snapshot_observed_at":"2026-08-06T19:16:15.787392Z","submitted_at":"2026-07-30T12:56:05Z","title":"SmartGen: Seamless Disaggregated LLM Inference with Selective KV Cache Transfer","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-07-31T16:21:18.644504Z"},"links":{"citing_paper":"/paper/2607.28150"},"observation_digest":"sha256:eb9519fe430d1fb98dc6721bbcb23b4e556d0e1607ca917ec56bf07b36d3fe0f","observation_id":"a29c98f4-00f5-4917-b2c9-7d948f907eca","resolution":{"observed_at":"2026-07-31T16:21:18.644504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:21:18.715514Z","title":"CacheBlend: Fast large language model serving for RAG with cached knowledge fusion","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28150","last_updated":"2026-07-30T12:56:05Z","snapshot_observed_at":"2026-08-06T19:16:15.787392Z","submitted_at":"2026-07-30T12:56:05Z","title":"SmartGen: Seamless Disaggregated LLM Inference with Selective KV Cache Transfer","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-07-31T16:21:18.715514Z"},"links":{"citing_paper":"/paper/2607.28150"},"observation_digest":"sha256:664e0b5315001792a50d8f847c84a2a864e86d5a347b63ee2826e62865d0a875","observation_id":"6dbbf075-439e-47e9-bfd3-d104192ffc0d","resolution":{"observed_at":"2026-07-31T16:21:18.715514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:21:18.842799Z","title":"FlashInfer: Efficient and customizable attention engine for LLM inference serving","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28150","last_updated":"2026-07-30T12:56:05Z","snapshot_observed_at":"2026-08-06T19:16:15.787392Z","submitted_at":"2026-07-30T12:56:05Z","title":"SmartGen: Seamless Disaggregated LLM Inference with Selective KV Cache Transfer","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-07-31T16:21:18.842799Z"},"links":{"citing_paper":"/paper/2607.28150"},"observation_digest":"sha256:ca92aca2485ed11b19555523d6fb909d1d2d9d8acd9e4b0166abda224ca9ea45","observation_id":"f05b22b4-7696-4abe-826e-4e0913b26c81","resolution":{"observed_at":"2026-07-31T16:21:18.842799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:21:18.946243Z","title":"Willcock, Suvinay Sub- ramanian, Felix Chern, Alek Andreev, Shreya Pathak, Felix X","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28150","last_updated":"2026-07-30T12:56:05Z","snapshot_observed_at":"2026-08-06T19:16:15.787392Z","submitted_at":"2026-07-30T12:56:05Z","title":"SmartGen: Seamless Disaggregated LLM Inference with Selective KV Cache Transfer","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-07-31T16:21:18.946243Z"},"links":{"citing_paper":"/paper/2607.28150"},"observation_digest":"sha256:10d9e7f2c6d5ac03cb10d4499893aae1cc193ceb270dcbeebf8181c2a3d7a8cf","observation_id":"e64eb608-11df-4107-9838-aa70d32b32af","resolution":{"observed_at":"2026-07-31T16:21:18.946243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:21:19.040565Z","title":"Orca: A distributed 17 serving system for transformer-based generative mod- els","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.28150","last_updated":"2026-07-30T12:56:05Z","snapshot_observed_at":"2026-08-06T19:16:15.787392Z","submitted_at":"2026-07-30T12:56:05Z","title":"SmartGen: Seamless Disaggregated LLM Inference with Selective KV Cache Transfer","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-07-31T16:21:19.040565Z"},"links":{"citing_paper":"/paper/2607.28150"},"observation_digest":"sha256:c7b7f54a08428996990189177766d7bdb0445b710c76150dd1a5fb980debf363","observation_id":"0d251480-4d71-4901-8605-8624723641b2","resolution":{"observed_at":"2026-07-31T16:21:19.040565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:21:19.124125Z","title":"Stateful large language model serving with Pensieve","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28150","last_updated":"2026-07-30T12:56:05Z","snapshot_observed_at":"2026-08-06T19:16:15.787392Z","submitted_at":"2026-07-30T12:56:05Z","title":"SmartGen: Seamless Disaggregated LLM Inference with Selective KV Cache Transfer","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-07-31T16:21:19.124125Z"},"links":{"citing_paper":"/paper/2607.28150"},"observation_digest":"sha256:7792785f71e43c69c9db1ad241a479e2217d7cdf7cad6f586eefec1002c7f975","observation_id":"555c11d3-bd72-4d90-bf87-6e816a092f19","resolution":{"observed_at":"2026-07-31T16:21:19.124125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:21:19.211420Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28150","last_updated":"2026-07-30T12:56:05Z","snapshot_observed_at":"2026-08-06T19:16:15.787392Z","submitted_at":"2026-07-30T12:56:05Z","title":"SmartGen: Seamless Disaggregated LLM Inference with Selective KV Cache Transfer","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-07-31T16:21:19.211420Z"},"links":{"citing_paper":"/paper/2607.28150"},"observation_digest":"sha256:e7918caa3a450ed8251c697132a3a7074344916587a6764d5cad30b70fd91795","observation_id":"1192aa68-5c5d-4b93-8287-a82c84c26301","resolution":{"observed_at":"2026-07-31T16:21:19.211420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:21:19.286688Z","title":"Na- tive sparse attention: Hardware-aligned and natively trainable sparse attention","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28150","last_updated":"2026-07-30T12:56:05Z","snapshot_observed_at":"2026-08-06T19:16:15.787392Z","submitted_at":"2026-07-30T12:56:05Z","title":"SmartGen: Seamless Disaggregated LLM Inference with Selective KV Cache Transfer","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-07-31T16:21:19.286688Z"},"links":{"citing_paper":"/paper/2607.28150"},"observation_digest":"sha256:622467be63b8c5e1385da5a88061b42a4f575fff0b0ebbf9aaf69a6529e169d4","observation_id":"402fccba-1f55-4d3d-b334-3a0acd67166a","resolution":{"observed_at":"2026-07-31T16:21:19.286688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:21:19.375120Z","title":"Rethinking database high availability with RDMA networks.Proc","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.28150","last_updated":"2026-07-30T12:56:05Z","snapshot_observed_at":"2026-08-06T19:16:15.787392Z","submitted_at":"2026-07-30T12:56:05Z","title":"SmartGen: Seamless Disaggregated LLM Inference with Selective KV Cache Transfer","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-07-31T16:21:19.375120Z"},"links":{"citing_paper":"/paper/2607.28150"},"observation_digest":"sha256:730ecb983719eeccf3f7a00ab833e422eeac9dfee3f3b3ca6a637f433a00e0c8","observation_id":"4c82d628-7573-425e-8245-af6f02bfb635","resolution":{"observed_at":"2026-07-31T16:21:19.375120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:21:19.465535Z","title":"GPU checkpoint/restore made fast and lightweight","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28150","last_updated":"2026-07-30T12:56:05Z","snapshot_observed_at":"2026-08-06T19:16:15.787392Z","submitted_at":"2026-07-30T12:56:05Z","title":"SmartGen: Seamless Disaggregated LLM Inference with Selective KV Cache Transfer","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-07-31T16:21:19.465535Z"},"links":{"citing_paper":"/paper/2607.28150"},"observation_digest":"sha256:f547f01bcebda71d02246327d8e71aec5d563ed95c48eae88e7ef85186c56c7c","observation_id":"377907d7-b3b5-4727-91b4-89842814a8f0","resolution":{"observed_at":"2026-07-31T16:21:19.465535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:21:19.526988Z","title":"Jenga: Effective memory manage- ment for serving LLM with heterogeneity","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28150","last_updated":"2026-07-30T12:56:05Z","snapshot_observed_at":"2026-08-06T19:16:15.787392Z","submitted_at":"2026-07-30T12:56:05Z","title":"SmartGen: Seamless Disaggregated LLM Inference with Selective KV Cache Transfer","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-07-31T16:21:19.526988Z"},"links":{"citing_paper":"/paper/2607.28150"},"observation_digest":"sha256:3c94b5d9868aa1f5185e4382c037317ae1fac83748c66e99472b0a9efce5d3fc","observation_id":"e4208fbf-b923-4b7d-8b31-2468997733fb","resolution":{"observed_at":"2026-07-31T16:21:19.526988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:21:19.589085Z","title":"BlitzScale: Fast and live large model autoscaling with O(1) host caching","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28150","last_updated":"2026-07-30T12:56:05Z","snapshot_observed_at":"2026-08-06T19:16:15.787392Z","submitted_at":"2026-07-30T12:56:05Z","title":"SmartGen: Seamless Disaggregated LLM Inference with Selective KV Cache Transfer","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-07-31T16:21:19.589085Z"},"links":{"citing_paper":"/paper/2607.28150"},"observation_digest":"sha256:141ffd6e582fb54880d1efe9de378ff5656e25ebc4fb91dd4895b706ea89177c","observation_id":"d81aa742-8004-4f47-8637-cb295962f17c","resolution":{"observed_at":"2026-07-31T16:21:19.589085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:21:19.661302Z","title":"HACK: homomorphic acceleration via compression of the key- value cache for disaggregated LLM inference","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28150","last_updated":"2026-07-30T12:56:05Z","snapshot_observed_at":"2026-08-06T19:16:15.787392Z","submitted_at":"2026-07-30T12:56:05Z","title":"SmartGen: Seamless Disaggregated LLM Inference with Selective KV Cache Transfer","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-07-31T16:21:19.661302Z"},"links":{"citing_paper":"/paper/2607.28150"},"observation_digest":"sha256:b79f4899329eaef2e9dea701912e6fe594fe64774e4cca452777422ecad37525","observation_id":"492e4f93-fd0e-4e3b-9c76-b72f1f4028fc","resolution":{"observed_at":"2026-07-31T16:21:19.661302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:21:19.735381Z","title":"Barrett, Zhangyang Wang, and Beidi Chen","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28150","last_updated":"2026-07-30T12:56:05Z","snapshot_observed_at":"2026-08-06T19:16:15.787392Z","submitted_at":"2026-07-30T12:56:05Z","title":"SmartGen: Seamless Disaggregated LLM Inference with Selective KV Cache Transfer","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-07-31T16:21:19.735381Z"},"links":{"citing_paper":"/paper/2607.28150"},"observation_digest":"sha256:cdb737959804647ccd2627f6c1cc7d882d037790be599add3ae905edb05ea4a4","observation_id":"fa1106db-6561-4d4d-9c62-25479bce809b","resolution":{"observed_at":"2026-07-31T16:21:19.735381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:21:19.788776Z","title":"Gonzalez, Clark W","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28150","last_updated":"2026-07-30T12:56:05Z","snapshot_observed_at":"2026-08-06T19:16:15.787392Z","submitted_at":"2026-07-30T12:56:05Z","title":"SmartGen: Seamless Disaggregated LLM Inference with Selective KV Cache Transfer","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-07-31T16:21:19.788776Z"},"links":{"citing_paper":"/paper/2607.28150"},"observation_digest":"sha256:96d1d2cc3bfe1e64dfa100bcee0a6de8f00cc70b92ca59f6130946af79ecf8f2","observation_id":"54039205-e481-42a2-873b-a180b6ef5095","resolution":{"observed_at":"2026-07-31T16:21:19.788776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:21:19.869913Z","title":"Dist- Serve: Disaggregating prefill and decoding for goodput- optimized large language model serving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28150","last_updated":"2026-07-30T12:56:05Z","snapshot_observed_at":"2026-08-06T19:16:15.787392Z","submitted_at":"2026-07-30T12:56:05Z","title":"SmartGen: Seamless Disaggregated LLM Inference with Selective KV Cache Transfer","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-07-31T16:21:19.869913Z"},"links":{"citing_paper":"/paper/2607.28150"},"observation_digest":"sha256:60e4f23565864793a12129d9030fcb6e98af4a9e4d45b008f3799d047a93479c","observation_id":"d86c767e-91d2-438f-83f9-fb8f8c5dcbe5","resolution":{"observed_at":"2026-07-31T16:21:19.869913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:21:19.946822Z","title":"NanoFlow: Towards optimal large language model serving throughput","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28150","last_updated":"2026-07-30T12:56:05Z","snapshot_observed_at":"2026-08-06T19:16:15.787392Z","submitted_at":"2026-07-30T12:56:05Z","title":"SmartGen: Seamless Disaggregated LLM Inference with Selective KV Cache Transfer","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-07-31T16:21:19.946822Z"},"links":{"citing_paper":"/paper/2607.28150"},"observation_digest":"sha256:e1dce022dee9cfe24102c0bf529a6da27a40b2a12eab2d7606c426c79aae7bfc","observation_id":"d5dbca3c-7b69-4390-b99b-ed9965171a49","resolution":{"observed_at":"2026-07-31T16:21:19.946822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T16:21:17.363791Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28150","last_updated":"2026-07-30T12:56:05Z","snapshot_observed_at":"2026-08-06T19:16:15.787392Z","submitted_at":"2026-07-30T12:56:05Z","title":"SmartGen: Seamless Disaggregated LLM Inference with Selective KV Cache Transfer","version":1},"reference_index":964,"source":"pdf_text","source_observed_at":"2026-07-31T16:21:17.363791Z"},"links":{"citing_paper":"/paper/2607.28150"},"observation_digest":"sha256:cc31adbede487b066d8d5bca96a3e5a0c7a5c11d6425cdfd66c2e993e7fc6a86","observation_id":"b6bb2120-4bfe-4d09-ab2a-7f7d53b1ff4e","resolution":{"observed_at":"2026-07-31T16:21:17.363791Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.28150","last_updated":"2026-07-30T12:56:05Z","latest_version":1,"primary_category":"cs.DC","snapshot_observed_at":"2026-08-06T19:16:15.787392Z","submitted_at":"2026-07-30T12:56:05Z","title":"SmartGen: Seamless Disaggregated LLM Inference with Selective KV Cache Transfer"},"reference_resolution":{"displayed":87,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":86,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":87},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 87 of 87 outbound references and 0 inbound Pith citation observations for arXiv:2607.28150."}