{"as_of":"2026-08-04T20:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e2a8ad7ef83cb4b9025c260f954756b64b21a33211bc3ffd9a2c556eea9bacb9","coverage":[{"denominator":19,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":19,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T23:39:08.036454Z","state":"measured"},{"denominator":20,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":20,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T04:57:08.746551Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-02T10:46:52.298443Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2511.04791","last_updated":"2026-05-30T23:27:43Z","snapshot_observed_at":"2026-08-03T23:39:04.093171Z","submitted_at":"2025-11-06T20:18:34Z","title":"DuetServe: Harmonizing Prefill and Decode for LLM Serving via Adaptive GPU Multiplexing","version":2},"cited_work":{"arxiv_id":"2511.04791","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.04791","snapshot_observed_at":"2026-07-02T10:46:52.298443Z","title":"DuetServe: Harmonizing Prefill and Decode for LLM Serving via Adaptive GPU Multiplexing","venue":"cs.LG","work_id":"66f6ea18-b287-47e8-8944-e51e8fc43101","year":2025},"citing_paper":{"arxiv_id":"2606.04415","last_updated":"2026-06-03T03:49:34Z","snapshot_observed_at":"2026-07-06T23:44:33.095008Z","submitted_at":"2026-06-03T03:49:34Z","title":"FlexNPU: Transparent NPU Virtualization for Dynamic LLM Prefill-Decode Co-location","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-28T04:57:08.746551Z"},"links":{"cited_paper":"/paper/2511.04791","citing_paper":"/paper/2606.04415"},"observation_digest":"sha256:c8ecba851d203b5e6c5693bc6bf79ad0060e4bbecd12e8814d1749fa13d38f36","observation_id":"8c40914f-5fa0-4995-8bc9-b0d978ebdeeb","resolution":{"observed_at":"2026-07-02T10:46:52.299777Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2511.04791/citation-record","integrity":"/paper/2511.04791/integrity","json":"/paper/2511.04791/citation-record.json","paper":"/paper/2511.04791"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:39:05.344401Z","title":"S., Ramjee, R., and Tumanov, A","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.04791","last_updated":"2026-05-30T23:27:43Z","snapshot_observed_at":"2026-08-03T23:39:04.093171Z","submitted_at":"2025-11-06T20:18:34Z","title":"DuetServe: Harmonizing Prefill and Decode for LLM Serving via Adaptive GPU Multiplexing","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T23:39:05.344401Z"},"links":{"citing_paper":"/paper/2511.04791"},"observation_digest":"sha256:5fb44d0693fe138fc93b0434343a0d06658682f85bebd5ef0b2e4de65d695256","observation_id":"faee7694-f5fa-4c23-aa26-734461bdc49e","resolution":{"observed_at":"2026-08-03T23:39:05.344401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:39:05.963627Z","title":"ISBN 9798400712616","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.04791","last_updated":"2026-05-30T23:27:43Z","snapshot_observed_at":"2026-08-03T23:39:04.093171Z","submitted_at":"2025-11-06T20:18:34Z","title":"DuetServe: Harmonizing Prefill and Decode for LLM Serving via Adaptive GPU Multiplexing","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T23:39:05.963627Z"},"links":{"citing_paper":"/paper/2511.04791"},"observation_digest":"sha256:5703cd412882d97e866bc4e597c33fb60885a65c0fec514c3c0b5b6396174f45","observation_id":"d83e1e03-2924-46ef-9fb5-3cef716d1b72","resolution":{"observed_at":"2026-08-03T23:39:05.963627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-03T23:39:06.217757Z","title":"Han, M., Zhang, H., Chen, R., and Chen, H","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.04791","last_updated":"2026-05-30T23:27:43Z","snapshot_observed_at":"2026-08-03T23:39:04.093171Z","submitted_at":"2025-11-06T20:18:34Z","title":"DuetServe: Harmonizing Prefill and Decode for LLM Serving via Adaptive GPU Multiplexing","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T23:39:06.217757Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2511.04791"},"observation_digest":"sha256:d13feb6b720c5a2b3eecf9348010f639308edb968398dbc0dea4e13d14cada3b","observation_id":"24997dbb-dafd-4851-83f9-d7a0965b0dc5","resolution":{"observed_at":"2026-08-03T23:39:06.217757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17565","last_updated":"2024-12-21T13:55:49Z","snapshot_observed_at":"2026-07-06T18:36:42.830927Z","submitted_at":"2024-06-25T14:02:08Z","title":"MemServe: Context Caching for Disaggregated LLM Serving with Elastic Memory Pool","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17565","snapshot_observed_at":"2026-08-03T23:39:06.591452Z","title":"Memserve: Context caching for disaggregated llm serving with elastic memory pool, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.04791","last_updated":"2026-05-30T23:27:43Z","snapshot_observed_at":"2026-08-03T23:39:04.093171Z","submitted_at":"2025-11-06T20:18:34Z","title":"DuetServe: Harmonizing Prefill and Decode for LLM Serving via Adaptive GPU Multiplexing","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T23:39:06.591452Z"},"links":{"cited_paper":"/paper/2406.17565","citing_paper":"/paper/2511.04791"},"observation_digest":"sha256:a4638f7459498b2618163c9496e90acde420bc47282de14ee56c0faeea682be4","observation_id":"ae877024-34f8-43a3-9549-b818ea3d9c92","resolution":{"observed_at":"2026-08-03T23:39:06.591452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:39:06.693807Z","title":"Bul- let: Boosting gpu utilization for llm serving via dy- namic spatial-temporal orchestration.arXiv preprint arXiv:2504.19516,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.04791","last_updated":"2026-05-30T23:27:43Z","snapshot_observed_at":"2026-08-03T23:39:04.093171Z","submitted_at":"2025-11-06T20:18:34Z","title":"DuetServe: Harmonizing Prefill and Decode for LLM Serving via Adaptive GPU Multiplexing","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T23:39:06.693807Z"},"links":{"citing_paper":"/paper/2511.04791"},"observation_digest":"sha256:654ead95b5901a9c60a94a6e65793078e43084fa46c79482f229edee1f972dfb","observation_id":"3a1e4f4d-6d0f-4b72-b764-30d9947e5e7d","resolution":{"observed_at":"2026-08-03T23:39:06.693807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17177","last_updated":"2024-04-17T18:41:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-27T03:30:58Z","title":"Sora: A Review on Background, Technology, Limitations, and Opportunities of Large Vision Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17177","snapshot_observed_at":"2026-08-03T23:39:06.769325Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.04791","last_updated":"2026-05-30T23:27:43Z","snapshot_observed_at":"2026-08-03T23:39:04.093171Z","submitted_at":"2025-11-06T20:18:34Z","title":"DuetServe: Harmonizing Prefill and Decode for LLM Serving via Adaptive GPU Multiplexing","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T23:39:06.769325Z"},"links":{"cited_paper":"/paper/2402.17177","citing_paper":"/paper/2511.04791"},"observation_digest":"sha256:cef327d1b16804735f17dc68aa6126848991f3aacf9865c738e78effe9649600","observation_id":"6b00b24c-47c9-44c4-a1ca-fceddc7379c9","resolution":{"observed_at":"2026-08-03T23:39:06.769325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:39:06.882234Z","title":"lmcache.ai/2025-04-29-pdbench/","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.04791","last_updated":"2026-05-30T23:27:43Z","snapshot_observed_at":"2026-08-03T23:39:04.093171Z","submitted_at":"2025-11-06T20:18:34Z","title":"DuetServe: Harmonizing Prefill and Decode for LLM Serving via Adaptive GPU Multiplexing","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T23:39:06.882234Z"},"links":{"citing_paper":"/paper/2511.04791"},"observation_digest":"sha256:ab24ab221ac8b3dbeee3ff062ac3c263fb4d150662b95cb15a6a6888266a4dfb","observation_id":"89f5d42f-215a-4e1d-9c0e-7b0559827ac3","resolution":{"observed_at":"2026-08-03T23:39:06.882234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:39:07.099305Z","title":"Azure llm inference trace 2023,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.04791","last_updated":"2026-05-30T23:27:43Z","snapshot_observed_at":"2026-08-03T23:39:04.093171Z","submitted_at":"2025-11-06T20:18:34Z","title":"DuetServe: Harmonizing Prefill and Decode for LLM Serving via Adaptive GPU Multiplexing","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T23:39:07.099305Z"},"links":{"citing_paper":"/paper/2511.04791"},"observation_digest":"sha256:a8814bdb0231dbc5a1733892bc9b0b990663b71e55244ac627b523e0f994c826","observation_id":"34f30212-c926-4155-8db8-ba996fb96953","resolution":{"observed_at":"2026-08-03T23:39:07.099305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-03T23:39:07.249012Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.04791","last_updated":"2026-05-30T23:27:43Z","snapshot_observed_at":"2026-08-03T23:39:04.093171Z","submitted_at":"2025-11-06T20:18:34Z","title":"DuetServe: Harmonizing Prefill and Decode for LLM Serving via Adaptive GPU Multiplexing","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T23:39:07.249012Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2511.04791"},"observation_digest":"sha256:ceac8078370d85d05f49f813bcbec998f895dbb67fecdfd76b82ea99306797ab","observation_id":"089141c0-e46f-48fa-a5c0-9d4bbdda9e17","resolution":{"observed_at":"2026-08-03T23:39:07.249012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:39:07.384783Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.04791","last_updated":"2026-05-30T23:27:43Z","snapshot_observed_at":"2026-08-03T23:39:04.093171Z","submitted_at":"2025-11-06T20:18:34Z","title":"DuetServe: Harmonizing Prefill and Decode for LLM Serving via Adaptive GPU Multiplexing","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T23:39:07.384783Z"},"links":{"citing_paper":"/paper/2511.04791"},"observation_digest":"sha256:920fc87f077625aa158c46f9277cd59820b8454e6bccd3eb9cfc7e431859ee6b","observation_id":"eed99aaf-864d-4c80-a05c-649a38a3c4f9","resolution":{"observed_at":"2026-08-03T23:39:07.384783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06608","last_updated":"2025-08-07T12:26:15Z","snapshot_observed_at":"2026-07-06T21:54:19.900770Z","submitted_at":"2025-07-09T07:27:18Z","title":"Nexus:Proactive Intra-GPU Disaggregation of Prefill and Decode in LLM Serving","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06608","snapshot_observed_at":"2026-08-03T23:39:07.565606Z","title":"Shi, X., Cai, C., Du, J., and Jia, Z","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.04791","last_updated":"2026-05-30T23:27:43Z","snapshot_observed_at":"2026-08-03T23:39:04.093171Z","submitted_at":"2025-11-06T20:18:34Z","title":"DuetServe: Harmonizing Prefill and Decode for LLM Serving via Adaptive GPU Multiplexing","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T23:39:07.565606Z"},"links":{"cited_paper":"/paper/2507.06608","citing_paper":"/paper/2511.04791"},"observation_digest":"sha256:18d91f2317266c393cd0cb3b9b7535b753df7a5115b32baeead076c4f1b57716","observation_id":"9455ab2d-4938-4969-8633-9e880bf8a1ca","resolution":{"observed_at":"2026-08-03T23:39:07.565606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:39:07.694976Z","title":"Cuda graphs compatibility of attention back- ends, 2025a","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.04791","last_updated":"2026-05-30T23:27:43Z","snapshot_observed_at":"2026-08-03T23:39:04.093171Z","submitted_at":"2025-11-06T20:18:34Z","title":"DuetServe: Harmonizing Prefill and Decode for LLM Serving via Adaptive GPU Multiplexing","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T23:39:07.694976Z"},"links":{"citing_paper":"/paper/2511.04791"},"observation_digest":"sha256:1ba65eb329e1b91fc76b11951e86b5e168eeca9dde78e94c437a8fbab774f27f","observation_id":"4d4edeec-e363-4910-8dfb-0053f4fd3678","resolution":{"observed_at":"2026-08-03T23:39:07.694976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-03T23:39:07.864886Z","title":"Yu, G.-I., Jeong, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.04791","last_updated":"2026-05-30T23:27:43Z","snapshot_observed_at":"2026-08-03T23:39:04.093171Z","submitted_at":"2025-11-06T20:18:34Z","title":"DuetServe: Harmonizing Prefill and Decode for LLM Serving via Adaptive GPU Multiplexing","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T23:39:07.864886Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2511.04791"},"observation_digest":"sha256:8f2211aaad91aa3d4b99f665aa928b59c98f170ecdb471197360a29f51d3249c","observation_id":"795a3d79-9edd-4103-9fbb-8ff49e53f522","resolution":{"observed_at":"2026-08-03T23:39:07.864886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:39:08.036454Z","title":"Nanoflow: To- wards optimal large language model serving throughput","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.04791","last_updated":"2026-05-30T23:27:43Z","snapshot_observed_at":"2026-08-03T23:39:04.093171Z","submitted_at":"2025-11-06T20:18:34Z","title":"DuetServe: Harmonizing Prefill and Decode for LLM Serving via Adaptive GPU Multiplexing","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T23:39:08.036454Z"},"links":{"citing_paper":"/paper/2511.04791"},"observation_digest":"sha256:b2ff88d82286a2b3b85d330756a716bbf84d55aec46d433d55647d91dc245bb0","observation_id":"badb81ca-3851-4295-8134-fad2b5dd08df","resolution":{"observed_at":"2026-08-03T23:39:08.036454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:39:05.802487Z","title":"ISBN 9781450381376","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.04791","last_updated":"2026-05-30T23:27:43Z","snapshot_observed_at":"2026-08-03T23:39:04.093171Z","submitted_at":"2025-11-06T20:18:34Z","title":"DuetServe: Harmonizing Prefill and Decode for LLM Serving via Adaptive GPU Multiplexing","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-03T23:39:05.802487Z"},"links":{"citing_paper":"/paper/2511.04791"},"observation_digest":"sha256:fa9cf3588ce77a0b7ec7c217489ecec42afca2d13a9c832f387d1b2a7871b702","observation_id":"3558dd2f-fd35-4251-b89e-46968595aba2","resolution":{"observed_at":"2026-08-03T23:39:05.802487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.19867","last_updated":"2025-04-28T15:00:03Z","snapshot_observed_at":"2026-07-06T21:15:49.962258Z","submitted_at":"2025-04-28T15:00:03Z","title":"semi-PD: Towards Efficient LLM Serving via Phase-Wise Disaggregated Computation and Unified Storage","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.19867","snapshot_observed_at":"2026-08-03T23:39:06.362657Z","title":"semi-pd: Towards efficient llm serving via phase-wise disaggre- gated computation and unified storage.arXiv preprint arXiv:2504.19867,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.04791","last_updated":"2026-05-30T23:27:43Z","snapshot_observed_at":"2026-08-03T23:39:04.093171Z","submitted_at":"2025-11-06T20:18:34Z","title":"DuetServe: Harmonizing Prefill and Decode for LLM Serving via Adaptive GPU Multiplexing","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-03T23:39:06.362657Z"},"links":{"cited_paper":"/paper/2504.19867","citing_paper":"/paper/2511.04791"},"observation_digest":"sha256:e4676a3b03d0475337a957a46ea027a75e675371e7728309db609bae92186dcf","observation_id":"633d21dc-2e09-4afa-a53e-f7dfe3ee0580","resolution":{"observed_at":"2026-08-03T23:39:06.362657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:39:05.625797Z","title":"Optimizing slo- oriented llm serving with pd-multiplexing.arXiv preprint arXiv:2504.14489,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.04791","last_updated":"2026-05-30T23:27:43Z","snapshot_observed_at":"2026-08-03T23:39:04.093171Z","submitted_at":"2025-11-06T20:18:34Z","title":"DuetServe: Harmonizing Prefill and Decode for LLM Serving via Adaptive GPU Multiplexing","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-03T23:39:05.625797Z"},"links":{"citing_paper":"/paper/2511.04791"},"observation_digest":"sha256:1311b72ac4746ccd0767beba6d24ef796826eee69747585deeb533f1dc7a48c4","observation_id":"9d4d9977-53b8-4aba-a0ed-77fb97d7427d","resolution":{"observed_at":"2026-08-03T23:39:05.625797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-03T23:39:06.136972Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.04791","last_updated":"2026-05-30T23:27:43Z","snapshot_observed_at":"2026-08-03T23:39:04.093171Z","submitted_at":"2025-11-06T20:18:34Z","title":"DuetServe: Harmonizing Prefill and Decode for LLM Serving via Adaptive GPU Multiplexing","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-03T23:39:06.136972Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2511.04791"},"observation_digest":"sha256:08582a4edd4bce0d182a4997fa5c5e169febdd684f13462ee0e184f0ffb1c25e","observation_id":"990953a8-7b1d-4b14-a681-dbdbfbac60a4","resolution":{"observed_at":"2026-08-03T23:39:06.136972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.4230/lipics.ecrts.2025.21","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:44:06.356764Z","title":"Chow, M., Jahanshahi, A., and Wong, D","venue":null,"work_id":"02cf6604-b132-4a18-987b-d8bc3e3fcfc7","year":2025},"citing_paper":{"arxiv_id":"2511.04791","last_updated":"2026-05-30T23:27:43Z","snapshot_observed_at":"2026-08-03T23:39:04.093171Z","submitted_at":"2025-11-06T20:18:34Z","title":"DuetServe: Harmonizing Prefill and Decode for LLM Serving via Adaptive GPU Multiplexing","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-03T23:39:05.462331Z"},"links":{"citing_paper":"/paper/2511.04791"},"observation_digest":"sha256:37d3c66aac6b323ffd206363c4d05410613bbcb4d1105a848b0adfea505162e1","observation_id":"f1e71ccb-e045-4960-9a4d-e425c2b5e784","resolution":{"observed_at":"2026-08-03T23:44:06.428629Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2511.04791","last_updated":"2026-05-30T23:27:43Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-03T23:39:04.093171Z","submitted_at":"2025-11-06T20:18:34Z","title":"DuetServe: Harmonizing Prefill and Decode for LLM Serving via Adaptive GPU Multiplexing"},"reference_resolution":{"displayed":19,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":18,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":19},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 19 of 19 outbound references and 1 inbound Pith citation observation for arXiv:2511.04791."}