Pith. sign in

Paper Citation Record · LEDGER

Efficiently Serving Large Multimodal Models Using EPD Disaggregation

As of 11 August 2026, this Paper Citation Record lists 22 of 22 outbound references and 4 inbound Pith citation observations for arXiv:2501.05460.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2501.05460 v4

Coverage vector

measured 22 of 22 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-11T04:29:34.814139Z

measured 26 of 26 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-11T06:34:44.6726+00:00

measured 4 of 4 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-07-01T00:31:12.965178Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-03T10:27:56.708993Z

Reference resolution

22 of 22 outbound references displayed

  • verified exact0
  • verified fuzzy8
  • unresolved14
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation c6a4cebb-9521-4820-ac94-9c94739b3328 · outbound

This paper cites write newline.

Efficiently Serving Large Multimodal Models Using EPD Disaggregation write newline

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-11T04:29:34.674265Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T04:29:34.674265Z digest=sha256:07afff37e9de702bde2b6a84034de607aac6b827eed6956265f6544b5a91cbe4

Observation 81c278c7-4849-44d0-9d21-2051357c10b3 · outbound

This paper cites GPT-4 Technical Report.

Efficiently Serving Large Multimodal Models Using EPD Disaggregation GPT-4 Technical Report

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-11T04:29:34.682023Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T04:29:34.682023Z digest=sha256:4487733878e48e11989a5fdfcbf0ed8f7f15f64d25fe0edb564a9b00962051ec

Observation 159e985a-df5e-4fb8-895a-24eba915a341 · outbound

This paper cites SARATHI: Efficient LLM Inference by Piggybacking Decodes with Chunked Prefills.

Efficiently Serving Large Multimodal Models Using EPD Disaggregation SARATHI: Efficient LLM Inference by Piggybacking Decodes with Chunked Prefills

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-11T04:29:34.688512Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T04:29:34.688512Z digest=sha256:f8f9a9f2d7a4bfe1757c0b40285e34cddab6287df510a5fb2504e659a34517c8

Observation d368e730-0f3a-4b4b-bf29-ddbf99e9d34c · outbound

This paper cites Bayesian performance analysis for black-box optimization benchmarking.

Efficiently Serving Large Multimodal Models Using EPD Disaggregation Bayesian performance analysis for black-box optimization benchmarking

Reference 4

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T04:29:35.332131Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=arxiv_source observed=2026-08-11T04:29:34.694287Z digest=sha256:5d563cac3485ad6068a780751792d36614cfb8fd14bda6914c32cea613f3dbed

Observation 7115aa6f-977d-4886-a4fa-bf59f60a44de · outbound

This paper cites A survey on evaluation of large language models.

Efficiently Serving Large Multimodal Models Using EPD Disaggregation A survey on evaluation of large language models

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-11T04:29:34.702705Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T04:29:34.702705Z digest=sha256:62da6ac2afd83b9d6e46c1d4e4ef228591be315196022968412b5f4f729f26cb

Observation 9b5c4a0e-3eb6-4663-9f5d-4bcc72741d2a · outbound

This paper cites an unresolved cited work.

Efficiently Serving Large Multimodal Models Using EPD Disaggregation Unresolved cited work

Reference 6

Resolution
unresolved
raw_fallback, observed 2026-08-11T04:29:35.290259Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=arxiv_source observed=2026-08-11T04:29:34.708988Z digest=sha256:0443d6f60650c6d181de9fa82ab61535b2989abb2b5c9948e19d0f56499a2bfb

Observation 4bfc5aba-9f8e-4f16-807a-02fa3f311093 · outbound

This paper cites Inference without Interference: Disaggregate LLM Inference for Mixed Downstream Workloads.

Efficiently Serving Large Multimodal Models Using EPD Disaggregation Inference without Interference: Disaggregate LLM Inference for Mixed Downstream Workloads

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-11T04:29:34.715304Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T04:29:34.715304Z digest=sha256:8ebf87e0fb65124b29e51d68cd6cf00a826e1db47d15af734a870f3f4d76105b

Observation a0117dca-f92c-49d7-9e15-5433c53e1873 · outbound

This paper cites P/D-Serve: Serving Disaggregated Large Language Model at Scale.

Efficiently Serving Large Multimodal Models Using EPD Disaggregation P/D-Serve: Serving Disaggregated Large Language Model at Scale

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-11T04:29:34.722701Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T04:29:34.722701Z digest=sha256:f37dc1ceb79c99e13262eff8f7c8ea8674449765dd3fd0790301be0faea5797f

Observation 2377e117-9098-4867-96d4-78956e29de2a · outbound

This paper cites GEAR: An Efficient KV Cache Compression Recipe for Near-Lossless Generative Inference of LLM.

Efficiently Serving Large Multimodal Models Using EPD Disaggregation GEAR: An Efficient KV Cache Compression Recipe for Near-Lossless Generative Inference of LLM

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-11T04:29:34.728199Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T04:29:34.728199Z digest=sha256:96314b9ccaa5b4fe75b7c75633c1fd6cce264af375b6080cf27f510e60148aa3

Observation 15dd31be-cc95-4cb3-ba54-d9daf26363bd · outbound

This paper cites Gonzalez, Hao Zhang, and Ion Stoica.

Efficiently Serving Large Multimodal Models Using EPD Disaggregation Gonzalez, Hao Zhang, and Ion Stoica

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-11T04:29:34.734734Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T04:29:34.734734Z digest=sha256:fbaf92c13b00849a6410d620f9fedcc734dbfb625ab5dac7dd48ede6f2c9233e

Observation 97a7ee87-fa7b-44fd-a5b2-3782d8931485 · outbound

This paper cites SnapKV: LLM Knows What You are Looking for Before Generation.

Efficiently Serving Large Multimodal Models Using EPD Disaggregation SnapKV: LLM Knows What You are Looking for Before Generation

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-11T04:29:34.741541Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T04:29:34.741541Z digest=sha256:6b4a511fa0dcdc56a502ddbb06fabf8a78af629b18f54fb2b75e3d232f9837aa

Observation 73c28bde-86c0-41e9-9b92-df4fa936a110 · outbound

This paper cites Visual instruction tuning.

Efficiently Serving Large Multimodal Models Using EPD Disaggregation Visual instruction tuning

Reference 12

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T04:29:35.255190Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=arxiv_source observed=2026-08-11T04:29:34.747685Z digest=sha256:9a759a9c0d9c0ce2ad948215f48bd24e08be79dc099df3e30477f0ac19a4fb69

Observation 6228cef4-4dd2-4c59-a563-b9bd40c58774 · outbound

This paper cites A Survey of Resource-efficient LLM and Multimodal Foundation Models.

Efficiently Serving Large Multimodal Models Using EPD Disaggregation A Survey of Resource-efficient LLM and Multimodal Foundation Models

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-11T04:29:34.754050Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T04:29:34.754050Z digest=sha256:4eb8a3f824e5d2e5c7298da54e57678c0e7c74eb118d7ba21fd95d883fbe227b

Observation dff5c09c-b35e-4453-a966-7649deab5b34 · outbound

This paper cites Inf-MLLM: Efficient Streaming Inference of Multimodal Large Language Models on a Single GPU.

Efficiently Serving Large Multimodal Models Using EPD Disaggregation Inf-MLLM: Efficient Streaming Inference of Multimodal Large Language Models on a Single GPU

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-11T04:29:34.761337Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T04:29:34.761337Z digest=sha256:4698cf119f1effde96882114fcea9ba828431dd9f7352d6583731ffa28d1c677

Observation 3e71c408-6d18-48c6-b9ce-04c7d489c5c6 · outbound

This paper cites Splitwise: Efficient generative llm inference using phase splitting.

Efficiently Serving Large Multimodal Models Using EPD Disaggregation Splitwise: Efficient generative llm inference using phase splitting

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T04:29:35.230980Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=arxiv_source observed=2026-08-11T04:29:34.767357Z digest=sha256:a86cc568ec260d96a39790e38f2c3b0e19ab0ff03638209e49e2a7dbd80f70cf

Observation 40f4ea5e-993e-4f6c-a998-6dfd33b497e4 · outbound

This paper cites Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving.

Efficiently Serving Large Multimodal Models Using EPD Disaggregation Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-11T04:29:34.773621Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T04:29:34.773621Z digest=sha256:abad20027e9f506f93dc2099b6d0e91d4409a1e8fed50fd09a65ff117f0d711f

Observation 94c49337-4b17-45cb-943c-27d8b7d00f4a · outbound

This paper cites Déjàvu: Kv-cache streaming for fast, fault-tolerant generative llm serving.

Efficiently Serving Large Multimodal Models Using EPD Disaggregation Déjàvu: Kv-cache streaming for fast, fault-tolerant generative llm serving

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T04:29:35.210047Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=arxiv_source observed=2026-08-11T04:29:34.780230Z digest=sha256:97a56ff288622bec20f4dad0a74aba214582ed0b73f8ff50e0c0e65315e664c5

Observation 338d2da4-22cc-4777-afe7-9b661fd0bbc2 · outbound

This paper cites Multimodal large language models: A survey.

Efficiently Serving Large Multimodal Models Using EPD Disaggregation Multimodal large language models: A survey

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T04:29:35.190521Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=arxiv_source observed=2026-08-11T04:29:34.787367Z digest=sha256:e8b4bbf26e46aca9bf80118cd95d7792af3bc4ee58e4f5149610da89b7cc281c

Observation fd044171-a942-48a2-b84e-255b46599e40 · outbound

This paper cites Next-qa: Next phase of question-answering to explaining temporal actions.

Efficiently Serving Large Multimodal Models Using EPD Disaggregation Next-qa: Next phase of question-answering to explaining temporal actions

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T04:29:35.167832Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=arxiv_source observed=2026-08-11T04:29:34.794908Z digest=sha256:40e05a250df6c887caeaeee29f3ba940c566dc22d74b05475673782559f827fe

Observation 5e4a0f9a-7f97-42a2-893c-ebb612184070 · outbound

This paper cites MiniCPM-V: A GPT-4V Level MLLM on Your Phone.

Efficiently Serving Large Multimodal Models Using EPD Disaggregation MiniCPM-V: A GPT-4V Level MLLM on Your Phone

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-11T04:29:34.801288Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T04:29:34.801288Z digest=sha256:3df76f109254abfdd9690d4b52912c2acdb70b770bf2df271ed927768a6508cd

Observation 67b3ed10-eb80-449a-9dbf-e10719527c3a · outbound

This paper cites Orca: A distributed serving system for Transformer-Based generative models.

Efficiently Serving Large Multimodal Models Using EPD Disaggregation Orca: A distributed serving system for Transformer-Based generative models

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T04:29:35.144618Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=arxiv_source observed=2026-08-11T04:29:34.807559Z digest=sha256:9fba1422db348e47324261556808b1b6cc2911380536225f154f8ca95f5da850

Observation 22e01768-2e30-4e87-ac5c-33606952ea2c · outbound

This paper cites Distserve: Disaggregating prefill and decoding for goodput-optimized large language model serving.

Efficiently Serving Large Multimodal Models Using EPD Disaggregation Distserve: Disaggregating prefill and decoding for goodput-optimized large language model serving

Reference 22

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T04:29:35.124767Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=arxiv_source observed=2026-08-11T04:29:34.814139Z digest=sha256:068b265bad4bdf0b40affc7a48770b6b75130d40747c31e520a74bd7944b6c20

Pith citing papers

Observation b31d7bd5-83c8-41cd-9bf8-4f1d994fd4cf · inbound

Taming Request Imbalance: SLO-Aware Scheduling for Disaggregated LLM Inference cites this paper.

Taming Request Imbalance: SLO-Aware Scheduling for Disaggregated LLM Inference Efficiently Serving Large Multimodal Models Using EPD Disaggregation

Reference 9

Resolution
verified exact
arxiv_id, observed 2026-05-09T06:25:46.433228Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-05-08T18:27:13.781231Z digest=sha256:377bcc9437eaf3560d51a840f399c7f7de63fe9f2ad8fa5a6acd0ace92a9e6ab

Observation fbf9efa4-beef-43dd-a7d5-9b06a76d13ae · inbound

Taming Request Imbalance: SLO-Aware Scheduling for Disaggregated LLM Inference cites this paper.

Taming Request Imbalance: SLO-Aware Scheduling for Disaggregated LLM Inference Efficiently Serving Large Multimodal Models Using EPD Disaggregation

Reference 9

Resolution
verified exact
arxiv_id, observed 2026-07-01T00:35:10.220523Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-07-01T00:31:12.965178Z digest=sha256:dbe831b1620fcf7a26ad08cfffd42dc3a3105ee844fd45ea946a15b020eb641a

Observation 8f6663c9-ffdd-45ef-81fa-24d7aa46c2c0 · inbound

RTP-LLM: High-Performance Alibaba LLM Inference Engine cites this paper.

RTP-LLM: High-Performance Alibaba LLM Inference Engine Efficiently Serving Large Multimodal Models Using EPD Disaggregation

Reference 46

Resolution
metadata mismatch
arxiv_id, observed 2026-06-28T23:52:49.116085Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-06-28T23:52:40.763228Z digest=sha256:f2780ba2483b636b37cd1930840f6c264b14bc22b607a14fcbfabcfd3bd7587a

Observation 6dfd23c0-4950-4a8d-8547-2c2653179600 · inbound

M*: A Modular, Extensible, Serving System for Multimodal Models cites this paper.

M*: A Modular, Extensible, Serving System for Multimodal Models Efficiently Serving Large Multimodal Models Using EPD Disaggregation

Reference 34

Resolution
verified exact
arxiv_id, observed 2026-07-03T10:27:56.710430Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-06-27T10:01:04.153130Z digest=sha256:b208b4d2e5e3af776fe665d22b18c4e524e0e1aedf606f888f2042aa2a3ca2cd