{"as_of":"2026-08-11T19:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f0b61bd437f5f00b0d620d4c0f956ab4349a17bf61d1a5a75d641e7517bb4acb","coverage":[{"denominator":22,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":22,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T04:29:34.814139Z","state":"measured"},{"denominator":26,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":26,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-01T00:31:12.965178Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T10:27:56.708993Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.05460","last_updated":"2025-06-28T03:53:17Z","snapshot_observed_at":"2026-08-11T16:14:49.468473Z","submitted_at":"2024-12-25T10:11:31Z","title":"Efficiently Serving Large Multimodal Models Using EPD Disaggregation","version":4},"cited_work":{"arxiv_id":"2501.05460","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05460","snapshot_observed_at":"2026-07-03T10:27:56.708993Z","title":"Efficiently serv- ing large multimodal models using epd disaggregation","venue":null,"work_id":"714f3080-513c-42e0-ad31-dbc7361d5a1a","year":2025},"citing_paper":{"arxiv_id":"2605.02329","last_updated":"2026-05-25T17:26:33Z","snapshot_observed_at":"2026-08-02T00:39:56.914878Z","submitted_at":"2026-05-04T08:29:47Z","title":"Taming Request Imbalance: SLO-Aware Scheduling for Disaggregated LLM Inference","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-08T18:27:13.781231Z"},"links":{"cited_paper":"/paper/2501.05460","citing_paper":"/paper/2605.02329"},"observation_digest":"sha256:377bcc9437eaf3560d51a840f399c7f7de63fe9f2ad8fa5a6acd0ace92a9e6ab","observation_id":"b31d7bd5-83c8-41cd-9bf8-4f1d994fd4cf","resolution":{"observed_at":"2026-05-09T06:25:46.433228Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05460","last_updated":"2025-06-28T03:53:17Z","snapshot_observed_at":"2026-08-11T16:14:49.468473Z","submitted_at":"2024-12-25T10:11:31Z","title":"Efficiently Serving Large Multimodal Models Using EPD Disaggregation","version":4},"cited_work":{"arxiv_id":"2501.05460","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05460","snapshot_observed_at":"2026-07-03T10:27:56.708993Z","title":"Efficiently serv- ing large multimodal models using epd disaggregation","venue":null,"work_id":"714f3080-513c-42e0-ad31-dbc7361d5a1a","year":2025},"citing_paper":{"arxiv_id":"2605.02329","last_updated":"2026-05-25T17:26:33Z","snapshot_observed_at":"2026-08-02T00:39:56.914878Z","submitted_at":"2026-05-04T08:29:47Z","title":"Taming Request Imbalance: SLO-Aware Scheduling for Disaggregated LLM Inference","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-01T00:31:12.965178Z"},"links":{"cited_paper":"/paper/2501.05460","citing_paper":"/paper/2605.02329"},"observation_digest":"sha256:dbe831b1620fcf7a26ad08cfffd42dc3a3105ee844fd45ea946a15b020eb641a","observation_id":"fbf9efa4-beef-43dd-a7d5-9b06a76d13ae","resolution":{"observed_at":"2026-07-01T00:35:10.220523Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05460","last_updated":"2025-06-28T03:53:17Z","snapshot_observed_at":"2026-08-11T16:14:49.468473Z","submitted_at":"2024-12-25T10:11:31Z","title":"Efficiently Serving Large Multimodal Models Using EPD Disaggregation","version":4},"cited_work":{"arxiv_id":"2501.05460","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05460","snapshot_observed_at":"2026-07-03T10:27:56.708993Z","title":"Efficiently serv- ing large multimodal models using epd disaggregation","venue":null,"work_id":"714f3080-513c-42e0-ad31-dbc7361d5a1a","year":2025},"citing_paper":{"arxiv_id":"2605.29639","last_updated":"2026-05-28T09:07:06Z","snapshot_observed_at":"2026-08-09T19:32:18.545752Z","submitted_at":"2026-05-28T09:07:06Z","title":"RTP-LLM: High-Performance Alibaba LLM Inference Engine","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-28T23:52:40.763228Z"},"links":{"cited_paper":"/paper/2501.05460","citing_paper":"/paper/2605.29639"},"observation_digest":"sha256:f2780ba2483b636b37cd1930840f6c264b14bc22b607a14fcbfabcfd3bd7587a","observation_id":"8f6663c9-ffdd-45ef-81fa-24d7aa46c2c0","resolution":{"observed_at":"2026-06-28T23:52:49.116085Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05460","last_updated":"2025-06-28T03:53:17Z","snapshot_observed_at":"2026-08-11T16:14:49.468473Z","submitted_at":"2024-12-25T10:11:31Z","title":"Efficiently Serving Large Multimodal Models Using EPD Disaggregation","version":4},"cited_work":{"arxiv_id":"2501.05460","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05460","snapshot_observed_at":"2026-07-03T10:27:56.708993Z","title":"Efficiently serv- ing large multimodal models using epd disaggregation","venue":null,"work_id":"714f3080-513c-42e0-ad31-dbc7361d5a1a","year":2025},"citing_paper":{"arxiv_id":"2606.12688","last_updated":"2026-06-10T21:22:22Z","snapshot_observed_at":"2026-08-07T01:13:29.099043Z","submitted_at":"2026-06-10T21:22:22Z","title":"M*: A Modular, Extensible, Serving System for Multimodal Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-27T10:01:04.153130Z"},"links":{"cited_paper":"/paper/2501.05460","citing_paper":"/paper/2606.12688"},"observation_digest":"sha256:b208b4d2e5e3af776fe665d22b18c4e524e0e1aedf606f888f2042aa2a3ca2cd","observation_id":"6dfd23c0-4950-4a8d-8547-2c2653179600","resolution":{"observed_at":"2026-07-03T10:27:56.710430Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.05460/citation-record","integrity":"/paper/2501.05460/integrity","json":"/paper/2501.05460/citation-record.json","paper":"/paper/2501.05460"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:29:34.674265Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.05460","last_updated":"2025-06-28T03:53:17Z","snapshot_observed_at":"2026-08-11T16:14:49.468473Z","submitted_at":"2024-12-25T10:11:31Z","title":"Efficiently Serving Large Multimodal Models Using EPD Disaggregation","version":4},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T04:29:34.674265Z"},"links":{"citing_paper":"/paper/2501.05460"},"observation_digest":"sha256:07afff37e9de702bde2b6a84034de607aac6b827eed6956265f6544b5a91cbe4","observation_id":"c6a4cebb-9521-4820-ac94-9c94739b3328","resolution":{"observed_at":"2026-08-11T04:29:34.674265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-11T04:29:34.682023Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.05460","last_updated":"2025-06-28T03:53:17Z","snapshot_observed_at":"2026-08-11T16:14:49.468473Z","submitted_at":"2024-12-25T10:11:31Z","title":"Efficiently Serving Large Multimodal Models Using EPD Disaggregation","version":4},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T04:29:34.682023Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2501.05460"},"observation_digest":"sha256:4487733878e48e11989a5fdfcbf0ed8f7f15f64d25fe0edb564a9b00962051ec","observation_id":"81c278c7-4849-44d0-9d21-2051357c10b3","resolution":{"observed_at":"2026-08-11T04:29:34.682023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16369","last_updated":"2023-08-31T00:03:02Z","snapshot_observed_at":"2026-08-06T15:43:00.292272Z","submitted_at":"2023-08-31T00:03:02Z","title":"SARATHI: Efficient LLM Inference by Piggybacking Decodes with Chunked Prefills","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16369","snapshot_observed_at":"2026-08-11T04:29:34.688512Z","title":"Gulavani, and Ramachandran Ramjee","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.05460","last_updated":"2025-06-28T03:53:17Z","snapshot_observed_at":"2026-08-11T16:14:49.468473Z","submitted_at":"2024-12-25T10:11:31Z","title":"Efficiently Serving Large Multimodal Models Using EPD Disaggregation","version":4},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T04:29:34.688512Z"},"links":{"cited_paper":"/paper/2308.16369","citing_paper":"/paper/2501.05460"},"observation_digest":"sha256:f8f9a9f2d7a4bfe1757c0b40285e34cddab6287df510a5fb2504e659a34517c8","observation_id":"159e985a-df5e-4fb8-895a-24eba915a341","resolution":{"observed_at":"2026-08-11T04:29:34.688512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:29:35.325213Z","title":"Bayesian performance analysis for black-box optimization benchmarking","venue":null,"work_id":"36bd6f0e-5ffc-49d5-8e00-39c59eedf0f2","year":2019},"citing_paper":{"arxiv_id":"2501.05460","last_updated":"2025-06-28T03:53:17Z","snapshot_observed_at":"2026-08-11T16:14:49.468473Z","submitted_at":"2024-12-25T10:11:31Z","title":"Efficiently Serving Large Multimodal Models Using EPD Disaggregation","version":4},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T04:29:34.694287Z"},"links":{"citing_paper":"/paper/2501.05460"},"observation_digest":"sha256:5d563cac3485ad6068a780751792d36614cfb8fd14bda6914c32cea613f3dbed","observation_id":"d368e730-0f3a-4b4b-bf29-ddbf99e9d34c","resolution":{"observed_at":"2026-08-11T04:29:35.332131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:29:34.702705Z","title":"A survey on evaluation of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.05460","last_updated":"2025-06-28T03:53:17Z","snapshot_observed_at":"2026-08-11T16:14:49.468473Z","submitted_at":"2024-12-25T10:11:31Z","title":"Efficiently Serving Large Multimodal Models Using EPD Disaggregation","version":4},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T04:29:34.702705Z"},"links":{"citing_paper":"/paper/2501.05460"},"observation_digest":"sha256:62da6ac2afd83b9d6e46c1d4e4ef228591be315196022968412b5f4f729f26cb","observation_id":"7115aa6f-977d-4886-a4fa-bf59f60a44de","resolution":{"observed_at":"2026-08-11T04:29:34.702705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:29:35.283671Z","title":null,"venue":null,"work_id":"1f515e31-9d1f-4642-8348-cdbd9037f8ee","year":2024},"citing_paper":{"arxiv_id":"2501.05460","last_updated":"2025-06-28T03:53:17Z","snapshot_observed_at":"2026-08-11T16:14:49.468473Z","submitted_at":"2024-12-25T10:11:31Z","title":"Efficiently Serving Large Multimodal Models Using EPD Disaggregation","version":4},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T04:29:34.708988Z"},"links":{"citing_paper":"/paper/2501.05460"},"observation_digest":"sha256:0443d6f60650c6d181de9fa82ab61535b2989abb2b5c9948e19d0f56499a2bfb","observation_id":"9b5c4a0e-3eb6-4663-9f5d-4bcc72741d2a","resolution":{"observed_at":"2026-08-11T04:29:35.290259Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.11181","last_updated":"2024-01-20T09:43:36Z","snapshot_observed_at":"2026-08-05T23:35:16.350557Z","submitted_at":"2024-01-20T09:43:36Z","title":"Inference without Interference: Disaggregate LLM Inference for Mixed Downstream Workloads","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.11181","snapshot_observed_at":"2026-08-11T04:29:34.715304Z","title":"Inference without interference: Disaggregate llm inference for mixed downstream workloads","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.05460","last_updated":"2025-06-28T03:53:17Z","snapshot_observed_at":"2026-08-11T16:14:49.468473Z","submitted_at":"2024-12-25T10:11:31Z","title":"Efficiently Serving Large Multimodal Models Using EPD Disaggregation","version":4},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T04:29:34.715304Z"},"links":{"cited_paper":"/paper/2401.11181","citing_paper":"/paper/2501.05460"},"observation_digest":"sha256:8ebf87e0fb65124b29e51d68cd6cf00a826e1db47d15af734a870f3f4d76105b","observation_id":"4bfc5aba-9f8e-4f16-807a-02fa3f311093","resolution":{"observed_at":"2026-08-11T04:29:34.715304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08147","last_updated":"2024-08-15T13:32:25Z","snapshot_observed_at":"2026-07-06T19:01:06.124684Z","submitted_at":"2024-08-15T13:32:25Z","title":"P/D-Serve: Serving Disaggregated Large Language Model at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08147","snapshot_observed_at":"2026-08-11T04:29:34.722701Z","title":"P/d-serve: Serving disaggregated large language model at scale","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.05460","last_updated":"2025-06-28T03:53:17Z","snapshot_observed_at":"2026-08-11T16:14:49.468473Z","submitted_at":"2024-12-25T10:11:31Z","title":"Efficiently Serving Large Multimodal Models Using EPD Disaggregation","version":4},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T04:29:34.722701Z"},"links":{"cited_paper":"/paper/2408.08147","citing_paper":"/paper/2501.05460"},"observation_digest":"sha256:f37dc1ceb79c99e13262eff8f7c8ea8674449765dd3fd0790301be0faea5797f","observation_id":"a0117dca-f92c-49d7-9e15-5433c53e1873","resolution":{"observed_at":"2026-08-11T04:29:34.722701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05527","last_updated":"2024-09-30T22:44:58Z","snapshot_observed_at":"2026-08-07T12:20:18.370756Z","submitted_at":"2024-03-08T18:48:30Z","title":"GEAR: An Efficient KV Cache Compression Recipe for Near-Lossless Generative Inference of LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05527","snapshot_observed_at":"2026-08-11T04:29:34.728199Z","title":"Gear: An efficient kv cache compression recipefor near-lossless generative inference of llm","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.05460","last_updated":"2025-06-28T03:53:17Z","snapshot_observed_at":"2026-08-11T16:14:49.468473Z","submitted_at":"2024-12-25T10:11:31Z","title":"Efficiently Serving Large Multimodal Models Using EPD Disaggregation","version":4},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T04:29:34.728199Z"},"links":{"cited_paper":"/paper/2403.05527","citing_paper":"/paper/2501.05460"},"observation_digest":"sha256:96314b9ccaa5b4fe75b7c75633c1fd6cce264af375b6080cf27f510e60148aa3","observation_id":"2377e117-9098-4867-96d4-78956e29de2a","resolution":{"observed_at":"2026-08-11T04:29:34.728199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:29:34.734734Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.05460","last_updated":"2025-06-28T03:53:17Z","snapshot_observed_at":"2026-08-11T16:14:49.468473Z","submitted_at":"2024-12-25T10:11:31Z","title":"Efficiently Serving Large Multimodal Models Using EPD Disaggregation","version":4},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T04:29:34.734734Z"},"links":{"citing_paper":"/paper/2501.05460"},"observation_digest":"sha256:fbaf92c13b00849a6410d620f9fedcc734dbfb625ab5dac7dd48ede6f2c9233e","observation_id":"15dd31be-cc95-4cb3-ba54-d9daf26363bd","resolution":{"observed_at":"2026-08-11T04:29:34.734734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14469","last_updated":"2024-06-17T03:01:58Z","snapshot_observed_at":"2026-08-07T22:57:56.263839Z","submitted_at":"2024-04-22T17:42:58Z","title":"SnapKV: LLM Knows What You are Looking for Before Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14469","snapshot_observed_at":"2026-08-11T04:29:34.741541Z","title":"Snapkv: LLM knows what you are looking for before generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.05460","last_updated":"2025-06-28T03:53:17Z","snapshot_observed_at":"2026-08-11T16:14:49.468473Z","submitted_at":"2024-12-25T10:11:31Z","title":"Efficiently Serving Large Multimodal Models Using EPD Disaggregation","version":4},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T04:29:34.741541Z"},"links":{"cited_paper":"/paper/2404.14469","citing_paper":"/paper/2501.05460"},"observation_digest":"sha256:6b4a511fa0dcdc56a502ddbb06fabf8a78af629b18f54fb2b75e3d232f9837aa","observation_id":"97a7ee87-fa7b-44fd-a5b2-3782d8931485","resolution":{"observed_at":"2026-08-11T04:29:34.741541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:29:35.247730Z","title":"Visual instruction tuning","venue":null,"work_id":"5b609737-851b-4ef5-9cbb-468302556a2b","year":2023},"citing_paper":{"arxiv_id":"2501.05460","last_updated":"2025-06-28T03:53:17Z","snapshot_observed_at":"2026-08-11T16:14:49.468473Z","submitted_at":"2024-12-25T10:11:31Z","title":"Efficiently Serving Large Multimodal Models Using EPD Disaggregation","version":4},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T04:29:34.747685Z"},"links":{"citing_paper":"/paper/2501.05460"},"observation_digest":"sha256:9a759a9c0d9c0ce2ad948215f48bd24e08be79dc099df3e30477f0ac19a4fb69","observation_id":"73c28bde-86c0-41e9-9b92-df4fa936a110","resolution":{"observed_at":"2026-08-11T04:29:35.255190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08092","last_updated":"2024-09-23T07:37:34Z","snapshot_observed_at":"2026-08-11T06:35:48.857163Z","submitted_at":"2024-01-16T03:35:26Z","title":"A Survey of Resource-efficient LLM and Multimodal Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08092","snapshot_observed_at":"2026-08-11T04:29:34.754050Z","title":"A survey of resource-efficient llm and multimodal foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.05460","last_updated":"2025-06-28T03:53:17Z","snapshot_observed_at":"2026-08-11T16:14:49.468473Z","submitted_at":"2024-12-25T10:11:31Z","title":"Efficiently Serving Large Multimodal Models Using EPD Disaggregation","version":4},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T04:29:34.754050Z"},"links":{"cited_paper":"/paper/2401.08092","citing_paper":"/paper/2501.05460"},"observation_digest":"sha256:4eb8a3f824e5d2e5c7298da54e57678c0e7c74eb118d7ba21fd95d883fbe227b","observation_id":"6228cef4-4dd2-4c59-a563-b9bd40c58774","resolution":{"observed_at":"2026-08-11T04:29:34.754050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.09086","last_updated":"2024-09-11T12:44:12Z","snapshot_observed_at":"2026-08-11T09:47:19.417542Z","submitted_at":"2024-09-11T12:44:12Z","title":"Inf-MLLM: Efficient Streaming Inference of Multimodal Large Language Models on a Single GPU","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.09086","snapshot_observed_at":"2026-08-11T04:29:34.761337Z","title":"Inf-mllm: Efficient streaming inference of multimodal large language models on a single gpu","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.05460","last_updated":"2025-06-28T03:53:17Z","snapshot_observed_at":"2026-08-11T16:14:49.468473Z","submitted_at":"2024-12-25T10:11:31Z","title":"Efficiently Serving Large Multimodal Models Using EPD Disaggregation","version":4},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-11T04:29:34.761337Z"},"links":{"cited_paper":"/paper/2409.09086","citing_paper":"/paper/2501.05460"},"observation_digest":"sha256:4698cf119f1effde96882114fcea9ba828431dd9f7352d6583731ffa28d1c677","observation_id":"dff5c09c-b35e-4453-a966-7649deab5b34","resolution":{"observed_at":"2026-08-11T04:29:34.761337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:29:35.224246Z","title":"Splitwise: Efficient generative llm inference using phase splitting","venue":null,"work_id":"c1e00663-2d3a-489b-a595-e0d91a96e861","year":2024},"citing_paper":{"arxiv_id":"2501.05460","last_updated":"2025-06-28T03:53:17Z","snapshot_observed_at":"2026-08-11T16:14:49.468473Z","submitted_at":"2024-12-25T10:11:31Z","title":"Efficiently Serving Large Multimodal Models Using EPD Disaggregation","version":4},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-11T04:29:34.767357Z"},"links":{"citing_paper":"/paper/2501.05460"},"observation_digest":"sha256:a86cc568ec260d96a39790e38f2c3b0e19ab0ff03638209e49e2a7dbd80f70cf","observation_id":"3e71c408-6d18-48c6-b9ce-04c7d489c5c6","resolution":{"observed_at":"2026-08-11T04:29:35.230980Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00079","last_updated":"2025-09-03T14:56:29Z","snapshot_observed_at":"2026-08-07T12:08:57.217593Z","submitted_at":"2024-06-24T02:05:32Z","title":"Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00079","snapshot_observed_at":"2026-08-11T04:29:34.773621Z","title":"Mooncake: A kvcache-centric disaggregated architecture for llm serving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.05460","last_updated":"2025-06-28T03:53:17Z","snapshot_observed_at":"2026-08-11T16:14:49.468473Z","submitted_at":"2024-12-25T10:11:31Z","title":"Efficiently Serving Large Multimodal Models Using EPD Disaggregation","version":4},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-11T04:29:34.773621Z"},"links":{"cited_paper":"/paper/2407.00079","citing_paper":"/paper/2501.05460"},"observation_digest":"sha256:abad20027e9f506f93dc2099b6d0e91d4409a1e8fed50fd09a65ff117f0d711f","observation_id":"40f4ea5e-993e-4f6c-a998-6dfd33b497e4","resolution":{"observed_at":"2026-08-11T04:29:34.773621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:29:35.203549Z","title":"Déjàvu: Kv-cache streaming for fast, fault-tolerant generative llm serving","venue":null,"work_id":"3a6e4098-185e-4a57-9763-338ac4128f11","year":2024},"citing_paper":{"arxiv_id":"2501.05460","last_updated":"2025-06-28T03:53:17Z","snapshot_observed_at":"2026-08-11T16:14:49.468473Z","submitted_at":"2024-12-25T10:11:31Z","title":"Efficiently Serving Large Multimodal Models Using EPD Disaggregation","version":4},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T04:29:34.780230Z"},"links":{"citing_paper":"/paper/2501.05460"},"observation_digest":"sha256:97a56ff288622bec20f4dad0a74aba214582ed0b73f8ff50e0c0e65315e664c5","observation_id":"94c49337-4b17-45cb-943c-27d8b7d00f4a","resolution":{"observed_at":"2026-08-11T04:29:35.210047Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:29:35.184200Z","title":"Multimodal large language models: A survey","venue":null,"work_id":"66306895-1e51-4d56-82b2-ffab448d5485","year":2023},"citing_paper":{"arxiv_id":"2501.05460","last_updated":"2025-06-28T03:53:17Z","snapshot_observed_at":"2026-08-11T16:14:49.468473Z","submitted_at":"2024-12-25T10:11:31Z","title":"Efficiently Serving Large Multimodal Models Using EPD Disaggregation","version":4},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T04:29:34.787367Z"},"links":{"citing_paper":"/paper/2501.05460"},"observation_digest":"sha256:e8b4bbf26e46aca9bf80118cd95d7792af3bc4ee58e4f5149610da89b7cc281c","observation_id":"338d2da4-22cc-4777-afe7-9b661fd0bbc2","resolution":{"observed_at":"2026-08-11T04:29:35.190521Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:29:35.161448Z","title":"Next-qa: Next phase of question-answering to explaining temporal actions","venue":null,"work_id":"92073c17-4a74-4e25-90f4-912a598789d7","year":2021},"citing_paper":{"arxiv_id":"2501.05460","last_updated":"2025-06-28T03:53:17Z","snapshot_observed_at":"2026-08-11T16:14:49.468473Z","submitted_at":"2024-12-25T10:11:31Z","title":"Efficiently Serving Large Multimodal Models Using EPD Disaggregation","version":4},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-11T04:29:34.794908Z"},"links":{"citing_paper":"/paper/2501.05460"},"observation_digest":"sha256:40e05a250df6c887caeaeee29f3ba940c566dc22d74b05475673782559f827fe","observation_id":"fd044171-a942-48a2-b84e-255b46599e40","resolution":{"observed_at":"2026-08-11T04:29:35.167832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-11T04:29:34.801288Z","title":"Minicpm-v: A gpt-4v level mllm on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.05460","last_updated":"2025-06-28T03:53:17Z","snapshot_observed_at":"2026-08-11T16:14:49.468473Z","submitted_at":"2024-12-25T10:11:31Z","title":"Efficiently Serving Large Multimodal Models Using EPD Disaggregation","version":4},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T04:29:34.801288Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2501.05460"},"observation_digest":"sha256:3df76f109254abfdd9690d4b52912c2acdb70b770bf2df271ed927768a6508cd","observation_id":"5e4a0f9a-7f97-42a2-893c-ebb612184070","resolution":{"observed_at":"2026-08-11T04:29:34.801288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:29:35.138136Z","title":"Orca: A distributed serving system for Transformer-Based generative models","venue":null,"work_id":"a23f081e-af3b-4a45-8f37-04381eb5dcc9","year":2022},"citing_paper":{"arxiv_id":"2501.05460","last_updated":"2025-06-28T03:53:17Z","snapshot_observed_at":"2026-08-11T16:14:49.468473Z","submitted_at":"2024-12-25T10:11:31Z","title":"Efficiently Serving Large Multimodal Models Using EPD Disaggregation","version":4},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T04:29:34.807559Z"},"links":{"citing_paper":"/paper/2501.05460"},"observation_digest":"sha256:9fba1422db348e47324261556808b1b6cc2911380536225f154f8ca95f5da850","observation_id":"67b3ed10-eb80-449a-9dbf-e10719527c3a","resolution":{"observed_at":"2026-08-11T04:29:35.144618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:29:35.116732Z","title":"Distserve: Disaggregating prefill and decoding for goodput-optimized large language model serving","venue":null,"work_id":"aead0532-1902-40bc-b5bc-c2ee57be027c","year":null},"citing_paper":{"arxiv_id":"2501.05460","last_updated":"2025-06-28T03:53:17Z","snapshot_observed_at":"2026-08-11T16:14:49.468473Z","submitted_at":"2024-12-25T10:11:31Z","title":"Efficiently Serving Large Multimodal Models Using EPD Disaggregation","version":4},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-11T04:29:34.814139Z"},"links":{"citing_paper":"/paper/2501.05460"},"observation_digest":"sha256:068b265bad4bdf0b40affc7a48770b6b75130d40747c31e520a74bd7944b6c20","observation_id":"22e01768-2e30-4e87-ac5c-33606952ea2c","resolution":{"observed_at":"2026-08-11T04:29:35.124767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.05460","last_updated":"2025-06-28T03:53:17Z","latest_version":4,"primary_category":"cs.DC","snapshot_observed_at":"2026-08-11T16:14:49.468473Z","submitted_at":"2024-12-25T10:11:31Z","title":"Efficiently Serving Large Multimodal Models Using EPD Disaggregation"},"reference_resolution":{"displayed":22,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":0,"verified_fuzzy":8},"total_outbound_references":22},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 22 of 22 outbound references and 4 inbound Pith citation observations for arXiv:2501.05460."}