Pith. sign in

Paper Citation Record · LEDGER

Data Driven Optimization of GPU efficiency for Distributed LLM-Adapter Serving

As of 7 August 2026, this Paper Citation Record lists 42 of 42 outbound references and 0 inbound Pith citation observations for arXiv:2602.24044.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2602.24044 v2

Coverage vector

measured 42 of 42 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-02T20:10:09.020308Z

measured 42 of 42 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-07T06:34:17.273281+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

42 of 42 outbound references displayed

  • verified exact1
  • verified fuzzy0
  • unresolved40
  • parse uncertain0
  • malformed identifier1
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation a233e350-3aef-4861-bfb5-7c5561a4e573 · outbound

This paper cites Vidur: A large-scale simulation framework for llm inference.

Data Driven Optimization of GPU efficiency for Distributed LLM-Adapter Serving Vidur: A large-scale simulation framework for llm inference

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-02T20:10:08.892976Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T20:10:08.892976Z digest=sha256:d3456d1ade978f5ff31a94aefe3e4c271dff91825a5d24d44334b648479dd3fc

Observation fdc99142-7a9c-4d2d-8acc-efddddf537ab · outbound

This paper cites Taming throughput-latency tradeoff in llm in- ference with sarathi-serve, in: 18th USENIX Sympo- sium on Operating Systems Design and Implementa- tion (OSDI 24), pp.

Data Driven Optimization of GPU efficiency for Distributed LLM-Adapter Serving Taming throughput-latency tradeoff in llm in- ference with sarathi-serve, in: 18th USENIX Sympo- sium on Operating Systems Design and Implementa- tion (OSDI 24), pp

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-02T20:10:08.896492Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T20:10:08.896492Z digest=sha256:ca0174d7a4c2da7ca8f74c3a336e3439c7f4910c70da21533d3a7d0e055abb63

Observation c588857d-a1c0-4dbc-bee2-680e866c66f0 · outbound

This paper cites Clean sharegpt dataset.

Data Driven Optimization of GPU efficiency for Distributed LLM-Adapter Serving Clean sharegpt dataset

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-02T20:10:08.899550Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T20:10:08.899550Z digest=sha256:7dcec032f546632dbe963bf80f404f4d458543435e4191790af630ad4f3bf6bf

Observation f21e5e5f-995e-4756-b5e2-0308f70745f3 · outbound

This paper cites Language models are few-shot learners.

Data Driven Optimization of GPU efficiency for Distributed LLM-Adapter Serving Language models are few-shot learners

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-02T20:10:08.902565Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T20:10:08.902565Z digest=sha256:0437444e34fb1560f6b38430502999fd79e18ee9d494c0facf5dcb244e171de4

Observation 67101bfd-3a65-42ee-a873-c8bef006c2de · outbound

This paper cites Compress then Serve: Serving Thousands of LoRA Adapters with Little Overhead.

Data Driven Optimization of GPU efficiency for Distributed LLM-Adapter Serving Compress then Serve: Serving Thousands of LoRA Adapters with Little Overhead

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-02T20:10:08.905901Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T20:10:08.905901Z digest=sha256:5d89af2dc94c0102c46b32fbb0d769defc4bf738fdafba60ebb984295b098b8a

Observation 4b2e137e-b616-469a-bce4-2465627afe24 · outbound

This paper cites Punica: Multi-tenant lora serving.

Data Driven Optimization of GPU efficiency for Distributed LLM-Adapter Serving Punica: Multi-tenant lora serving

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-02T20:10:08.909475Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T20:10:08.909475Z digest=sha256:a2accb3ec36001a92729abc42987a0dad50cdd078fa3545b3a4d9191b4ffaad0

Observation 9976b25a-4d08-4f3f-8498-aff7bd17953b · outbound

This paper cites Llmservingsim: A hw/sw co-simulation infrastructure for llm inference serving at scale, in: 2024 IEEE Inter- national Symposium on Workload Characterization (IISWC), IEEE.

Data Driven Optimization of GPU efficiency for Distributed LLM-Adapter Serving Llmservingsim: A hw/sw co-simulation infrastructure for llm inference serving at scale, in: 2024 IEEE Inter- national Symposium on Workload Characterization (IISWC), IEEE

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-02T20:10:08.912329Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T20:10:08.912329Z digest=sha256:31618f796d33983d7b509fb94f3d286a7acc429c54ec46e139c804135799d861

Observation 3564582c-e288-4c54-abbf-e373ff3ab183 · outbound

This paper cites Computers and Intractability: A Guide to the Theory of NP- Completeness.

Data Driven Optimization of GPU efficiency for Distributed LLM-Adapter Serving Computers and Intractability: A Guide to the Theory of NP- Completeness

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-02T20:10:08.915930Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T20:10:08.915930Z digest=sha256:e12161c2a722803d7eb19ef728237c621690581c5acfc1a2348ca185a057bec2

Observation 1993d999-a665-403d-9414-96f8f4695b9a · outbound

This paper cites The Llama 3 Herd of Models.

Data Driven Optimization of GPU efficiency for Distributed LLM-Adapter Serving The Llama 3 Herd of Models

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-02T20:10:08.919252Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T20:10:08.919252Z digest=sha256:c8cdd0f373835db70267145dd63e8d9d5e6c9f5cf2c608925d6bc50c5c393e12

Observation db4615fc-356e-4dd0-aa26-c0a0f3b6827b · outbound

This paper cites an unresolved cited work.

Data Driven Optimization of GPU efficiency for Distributed LLM-Adapter Serving Unresolved cited work

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-02T20:10:08.922159Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T20:10:08.922159Z digest=sha256:6e7982b90a524a70b14674eb347b857ab56fbcfa405c81c304dc7669cdd184f1

Observation 9075a214-5de2-4296-858d-e129efa4f2f7 · outbound

This paper cites Parameter-efficient transfer learning fornlp, in: Internationalconferenceonmachinelearn- ing, PMLR.

Data Driven Optimization of GPU efficiency for Distributed LLM-Adapter Serving Parameter-efficient transfer learning fornlp, in: Internationalconferenceonmachinelearn- ing, PMLR

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-02T20:10:08.925916Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T20:10:08.925916Z digest=sha256:05cf609aff2d4c2795cd3f8e3c77e524871589763cd55778a4236b6a4190f1ae

Observation dd75c6e9-a505-4c97-a0f4-ad899115142f · outbound

This paper cites Lora: Low-rank adaptation of large language models.

Data Driven Optimization of GPU efficiency for Distributed LLM-Adapter Serving Lora: Low-rank adaptation of large language models

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-02T20:10:08.928867Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T20:10:08.928867Z digest=sha256:6dd1126293c382b500c311566b7716810ad4dd39300b41351b33acdc4425df21

Observation 08683555-6cef-4227-b645-c18032096df5 · outbound

This paper cites Chameleon: Adap- tive Caching and Scheduling for Many-Adapter LLM Inference Environments.

Data Driven Optimization of GPU efficiency for Distributed LLM-Adapter Serving Chameleon: Adap- tive Caching and Scheduling for Many-Adapter LLM Inference Environments

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-02T20:10:08.932682Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T20:10:08.932682Z digest=sha256:977956b034f7ede63861b2310a39c8c51982b810bedadd065ca5ec8827b8d065

Observation a5c88794-6735-49cb-836d-c4514b9275ed · outbound

This paper cites Fast algorithms for bin packing.

Data Driven Optimization of GPU efficiency for Distributed LLM-Adapter Serving Fast algorithms for bin packing

Reference 14

Resolution
verified exact
doi, observed 2026-08-02T20:14:03.025533Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-02T20:10:08.935608Z digest=sha256:56ace773880300ee906d59c3b7f9ab1ffd3b081d362b07844374e5c677702a34

Observation f5de80dd-d827-4444-b286-57fe4a32d0fd · outbound

This paper cites Ef- ficient memory management for large language model serving with pagedattention, in: Proceedings of the 29th Symposium on Operating Systems Principles, pp.

Data Driven Optimization of GPU efficiency for Distributed LLM-Adapter Serving Ef- ficient memory management for large language model serving with pagedattention, in: Proceedings of the 29th Symposium on Operating Systems Principles, pp

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-02T20:10:08.939076Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T20:10:08.939076Z digest=sha256:6c7f7626b8696b0f4cacb82671ff8d9df01e774e4d1fae7aa37f67060a4af2c7

Observation 12d10cbb-89b8-458b-8b9a-8802fbb884c2 · outbound

This paper cites Numba: A llvm-based python jit compiler, in: Proceedings of the Second Workshop on the LLVM Compiler Infrastruc- ture in HPC, pp.

Data Driven Optimization of GPU efficiency for Distributed LLM-Adapter Serving Numba: A llvm-based python jit compiler, in: Proceedings of the Second Workshop on the LLVM Compiler Infrastruc- ture in HPC, pp

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-02T20:10:08.941951Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T20:10:08.941951Z digest=sha256:648c89b2db8710a46a7dbea32305a2c3d83b847005830fbca0f553bdd6f3184f

Observation 87a2a520-729a-4c87-a011-486123706c54 · outbound

This paper cites CaraServe: CPU-Assisted and Rank-Aware LoRA Serving for Generative LLM Inference.

Data Driven Optimization of GPU efficiency for Distributed LLM-Adapter Serving CaraServe: CPU-Assisted and Rank-Aware LoRA Serving for Generative LLM Inference

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-02T20:10:08.944967Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T20:10:08.944967Z digest=sha256:e0d30c66e9889e9338f4f4a39046e0c31149bf2eeb534bfac30d0a7f5dc58496

Observation 37946ea0-ddb1-44b4-a58d-8d8a77ebfa97 · outbound

This paper cites Prefix-tuning: Optimizing continuouspromptsforgeneration.

Data Driven Optimization of GPU efficiency for Distributed LLM-Adapter Serving Prefix-tuning: Optimizing continuouspromptsforgeneration

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-02T20:10:08.948035Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T20:10:08.948035Z digest=sha256:dfcd152c8c7081e955182414760e0c26e87ff4d9fc3ab23bc0a9a7985f2848f8

Observation 33c53d03-6a39-407a-9f01-f00723626e73 · outbound

This paper cites Few-shot parameter- efficient fine-tuning is better and cheaper than in- context learning.

Data Driven Optimization of GPU efficiency for Distributed LLM-Adapter Serving Few-shot parameter- efficient fine-tuning is better and cheaper than in- context learning

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-02T20:10:08.951260Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T20:10:08.951260Z digest=sha256:42e7cd5896369f34d17d30059e6bbdd3fb7e7cb3b31a322ad770bddaa5dc3c74

Observation b8aa8b5f-7ea3-414a-8524-ce4954c1acf8 · outbound

This paper cites an unresolved cited work.

Data Driven Optimization of GPU efficiency for Distributed LLM-Adapter Serving Unresolved cited work

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-02T20:10:08.954583Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T20:10:08.954583Z digest=sha256:e3311ba12fc5fa61a99bd6edbb37df1a0b3788262268f23ae8f1ead2826953ca

Observation ec86f556-fabc-4bfc-888f-a8f2483cce29 · outbound

This paper cites DeepSpeed-MII.

Data Driven Optimization of GPU efficiency for Distributed LLM-Adapter Serving DeepSpeed-MII

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-02T20:10:08.960311Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T20:10:08.960311Z digest=sha256:6fa4c17709df69dfcfbbda7f12369729da3fe2d2d7d6b4c4e0e3b6ec969fa606

Observation d0938c5d-4b1e-49fd-add6-667da2e48b4a · outbound

This paper cites TensorRT-LLM.

Data Driven Optimization of GPU efficiency for Distributed LLM-Adapter Serving TensorRT-LLM

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-02T20:10:08.963043Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T20:10:08.963043Z digest=sha256:bf0d3355ee05353776766af6b0340ccc8290b3ba3e1c59ef31a2f0ed0f85bfd6

Observation 70a7674a-31bc-4549-94cf-3e7a42334af4 · outbound

This paper cites Scikit-learn: Machine learning in Python.

Data Driven Optimization of GPU efficiency for Distributed LLM-Adapter Serving Scikit-learn: Machine learning in Python

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-02T20:10:08.966262Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T20:10:08.966262Z digest=sha256:ec9ee5974c0e1d0d5cf86b1a7528e876797cefdd4518eb0849cb8f145e0e8ddd

Observation cf9b79c7-9b4b-4f42-a965-abcf0052d886 · outbound

This paper cites an unresolved cited work.

Data Driven Optimization of GPU efficiency for Distributed LLM-Adapter Serving Unresolved cited work

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-02T20:10:08.969561Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T20:10:08.969561Z digest=sha256:0ef480b7f73c56492189b178317d358b5e2dcb77f042be85a895153e97fc5d6e

Observation 5a8fd1af-78de-40ca-bcd3-5c1640ec3b85 · outbound

This paper cites Mind the memory gap: Unveiling gpu bottlenecks in large- batch llm inference, in: 2025 IEEE 18th International Conference on Cloud Computing (CLOUD), IEEE.

Data Driven Optimization of GPU efficiency for Distributed LLM-Adapter Serving Mind the memory gap: Unveiling gpu bottlenecks in large- batch llm inference, in: 2025 IEEE 18th International Conference on Cloud Computing (CLOUD), IEEE

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-02T20:10:08.972431Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T20:10:08.972431Z digest=sha256:84fe0cfd9675274f6d653d170b6cfd944500dcc8d185e9d6bd53b156fafd973d

Observation 2bd1c87a-613d-49c5-98f9-2dd29576e5da · outbound

This paper cites Towards pareto optimal throughput in small language model serving, in: Proceedings of the 4th Workshop on Machine Learning and Systems, pp.

Data Driven Optimization of GPU efficiency for Distributed LLM-Adapter Serving Towards pareto optimal throughput in small language model serving, in: Proceedings of the 4th Workshop on Machine Learning and Systems, pp

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-02T20:10:08.975710Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T20:10:08.975710Z digest=sha256:2faff6d29bcb2b84c4f389fb8bdf332c49364bef3d6731c79fcad0d1249af1f3

Observation 6265eb50-4119-41ef-b976-97a1edf34905 · outbound

This paper cites an unresolved cited work.

Data Driven Optimization of GPU efficiency for Distributed LLM-Adapter Serving Unresolved cited work

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-02T20:10:08.978780Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T20:10:08.978780Z digest=sha256:671cdb5decfc642a2b8f1d11b969921bf8fb273098f9b9c3e28a7fd95fc249ef

Observation 81d040ed-fc9e-4e9c-8d29-4b62ded7c17b · outbound

This paper cites EdgeLoRA: An Efficient Multi- Tenant LLM Serving System on Edge Devices.

Data Driven Optimization of GPU efficiency for Distributed LLM-Adapter Serving EdgeLoRA: An Efficient Multi- Tenant LLM Serving System on Edge Devices

Reference 28

Resolution
malformed identifier
no resolver link, observed 2026-08-02T20:10:08.984732Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T20:10:08.984732Z digest=sha256:183dd0664f565b84f5babc097c8fbe5160c0b6ed1083d71125efa2290d491139

Observation 56fc4404-708a-42d0-96d8-7f36aae052dd · outbound

This paper cites an unresolved cited work.

Data Driven Optimization of GPU efficiency for Distributed LLM-Adapter Serving Unresolved cited work

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-02T20:10:08.987262Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T20:10:08.987262Z digest=sha256:c7a6151697b21db9cdc8a63c732e0bb42909a8bb8e6d44cc32ebfa7b09fcb583

Observation 9c28a3b1-8b30-40c5-893a-e75f15e5a616 · outbound

This paper cites Lst: Ladder side-tuning for parameter and memory efficient trans- fer learning.

Data Driven Optimization of GPU efficiency for Distributed LLM-Adapter Serving Lst: Ladder side-tuning for parameter and memory efficient trans- fer learning

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-02T20:10:08.993204Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T20:10:08.993204Z digest=sha256:026b5524eca41d135f644a9e0920959a4a4fc5198fb1575549df2168c086b91c

Observation bc657ccd-90b0-4be8-815d-7c2b060a9bb7 · outbound

This paper cites Llama 2: Open Foundation and Fine-Tuned Chat Models.

Data Driven Optimization of GPU efficiency for Distributed LLM-Adapter Serving Llama 2: Open Foundation and Fine-Tuned Chat Models

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-02T20:10:08.996368Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T20:10:08.996368Z digest=sha256:0c8cf1ade0559f6c67ac99df4cd86a89415e32365813458bce7081364f7db047

Observation 891765e7-c9dd-440d-8513-9a076fdbe722 · outbound

This paper cites Parameter-efficient fine-tuning in large language models: a survey of methodologies.

Data Driven Optimization of GPU efficiency for Distributed LLM-Adapter Serving Parameter-efficient fine-tuning in large language models: a survey of methodologies

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-02T20:10:08.999561Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T20:10:08.999561Z digest=sha256:d0fb89ab99226db89af27da6bcb142b124c922c443a1683f0fbb8a04042bef6c

Observation a8f7eb87-51b8-4e3e-ad3e-5bc027b201ca · outbound

This paper cites Finance lora adapter for llama-3.1-8b instruct.

Data Driven Optimization of GPU efficiency for Distributed LLM-Adapter Serving Finance lora adapter for llama-3.1-8b instruct

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-02T20:10:09.002086Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T20:10:09.002086Z digest=sha256:4bdec171948d28def2e8b35c1f9905c84857a547bce52689e8935dd6d49d928d

Observation 05e5b63a-373b-4efc-ad73-542a674052bd · outbound

This paper cites dlora: Dynamically orchestrating requests and adapters for lora llm serving, in: 18th USENIX Symposium on Operating Systems Design and Imple- mentation (OSDI 24), pp.

Data Driven Optimization of GPU efficiency for Distributed LLM-Adapter Serving dlora: Dynamically orchestrating requests and adapters for lora llm serving, in: 18th USENIX Symposium on Operating Systems Design and Imple- mentation (OSDI 24), pp

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-02T20:10:09.005354Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T20:10:09.005354Z digest=sha256:47ed5e3f608d4a34dc51ebccf455887a4979f3ebc445df8ba6b46acf7ae6a9ec

Observation d48b7ccf-1f00-41ef-b96d-406399b665e8 · outbound

This paper cites Qwen2.5 Technical Report.

Data Driven Optimization of GPU efficiency for Distributed LLM-Adapter Serving Qwen2.5 Technical Report

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-02T20:10:09.007780Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T20:10:09.007780Z digest=sha256:7542d312bd854818197c09d5b86319050cd07063d858382f930e0a8afc97c126

Observation a11e7cb8-9054-44ef-8339-f5fcbc1de873 · outbound

This paper cites Sql lora for llama-2-7b.

Data Driven Optimization of GPU efficiency for Distributed LLM-Adapter Serving Sql lora for llama-2-7b

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-02T20:10:09.010810Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T20:10:09.010810Z digest=sha256:5e4fba2dadcf4534d504ed7ef10f91ba1af5ad26b4ed1440f04738012d0cdec6

Observation dfefe2b4-30b1-4f6a-bbf2-5108a1e93d95 · outbound

This paper cites Orca: A distributed serving system for transformer-based generative models, in: 16th USENIX Symposium on Operating Systems Design and Implementation (OSDI 22), pp.

Data Driven Optimization of GPU efficiency for Distributed LLM-Adapter Serving Orca: A distributed serving system for transformer-based generative models, in: 16th USENIX Symposium on Operating Systems Design and Implementation (OSDI 22), pp

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-02T20:10:09.013776Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T20:10:09.013776Z digest=sha256:bb28721464e4d32bb93408eb4da8104a53bd0f6bea2245d5b21324dd8c358f0e

Observation e8dc3b4a-6280-417c-9c12-19a398a439de · outbound

This paper cites Shepherd: Serving dnns in the wild, in: 20th USENIX Symposium on Networked Systems Design and Imple- mentation (NSDI 23), pp.

Data Driven Optimization of GPU efficiency for Distributed LLM-Adapter Serving Shepherd: Serving dnns in the wild, in: 20th USENIX Symposium on Networked Systems Design and Imple- mentation (NSDI 23), pp

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-02T20:10:09.017071Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T20:10:09.017071Z digest=sha256:1096e0a559ffa83f1c9df8e0b597b42b197d861e0175aca64083898c19a43f96

Observation 6436fb1a-26a4-47bd-8d82-aff6012b05d2 · outbound

This paper cites Medical lora for qwen2.5-7b- instruc.

Data Driven Optimization of GPU efficiency for Distributed LLM-Adapter Serving Medical lora for qwen2.5-7b- instruc

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-02T20:10:09.020308Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T20:10:09.020308Z digest=sha256:1516d410e432f03ef57e0028f759ccab37a6e769b35964d0e8734d665ad4bcbe

Observation f6931a87-de69-4e14-86cd-972d2714ead2 · outbound

This paper cites an unresolved cited work.

Data Driven Optimization of GPU efficiency for Distributed LLM-Adapter Serving Unresolved cited work

Reference 2019

Resolution
unresolved
no resolver link, observed 2026-08-02T20:10:08.981876Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T20:10:08.981876Z digest=sha256:6377b525a6522a5e39a9196d8e25d8ac5e5793413058146cdac0dc3656dd4128

Observation d4c5a457-55d4-4e16-b8be-eed0b6a16d19 · outbound

This paper cites Proceedings of Machine Learning and Sys- tems 6, 296–311.

Data Driven Optimization of GPU efficiency for Distributed LLM-Adapter Serving Proceedings of Machine Learning and Sys- tems 6, 296–311

Reference 2024

Resolution
unresolved
no resolver link, observed 2026-08-02T20:10:08.990224Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T20:10:08.990224Z digest=sha256:a5333bb1e10285d71c120462b92e5918515326a3abe0a538f788b2fb7147b91e

Observation 312734b0-5dc8-41d7-8b9c-7ce034606633 · outbound

This paper cites Poster session, San Diego, CA.

Data Driven Optimization of GPU efficiency for Distributed LLM-Adapter Serving Poster session, San Diego, CA

Reference 2025

Resolution
unresolved
no resolver link, observed 2026-08-02T20:10:08.957354Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T20:10:08.957354Z digest=sha256:e8b9b5f7b98e95ff28afef7f40a76e5c24994eaf9346a0f51f7bbb756bac581c

Pith citing papers

No inbound Pith citation observations are available.