Pith. sign in

Paper Citation Record · LEDGER

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference

As of 9 August 2026, this Paper Citation Record lists 60 of 60 outbound references and 2 inbound Pith citation observations for arXiv:2508.19559.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2508.19559 v1

Coverage vector

measured 60 of 60 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-05T15:45:41.645133Z

measured 62 of 62 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-09T06:31:02.800959+00:00

measured 2 of 2 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-06-26T19:23:10.356881Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-04T02:39:25.590182Z

Reference resolution

60 of 60 outbound references displayed

  • verified exact0
  • verified fuzzy37
  • unresolved22
  • parse uncertain1
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 5296e3ec-05ea-4bcd-aa64-18062ea8bf1e · outbound

This paper cites Accessed 2025-7-24.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference Accessed 2025-7-24

Reference 1

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T15:45:51.734750Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-05T15:45:35.064123Z digest=sha256:daa58853029644897bd16265048c78b78f9f8a9eca4c11efa11553c73ec326cf

Observation e9a84438-7d06-4387-9d3f-3117c7e02ccb · outbound

This paper cites https:// developer.nvidia.com/docs,.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference https:// developer.nvidia.com/docs,

Reference 2

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T15:45:51.572255Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-05T15:45:35.204902Z digest=sha256:55a6c0f57c69e7467fee303cfc87f718ff78dc41013a90afc99ad1d5501be439

Observation b1aa73c1-0094-43ae-acc1-44eaa0ef514c · outbound

This paper cites an unresolved cited work.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference Unresolved cited work

Reference 3

Resolution
unresolved
raw_fallback, observed 2026-08-05T15:45:51.434810Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-05T15:45:35.294236Z digest=sha256:73c6a9126374f5ce510e8113ec45293bccc8eddea696fe800560703862117f77

Observation 2be6c643-712a-4b5b-b3c2-5aaacc822daa · outbound

This paper cites Taming Throughput-Latency Tradeoff in LLM Inference with Sarathi-Serve.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference Taming Throughput-Latency Tradeoff in LLM Inference with Sarathi-Serve

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-05T15:45:35.454834Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T15:45:35.454834Z digest=sha256:b899e43af1a14c0b692d555218b3beffcf46524b9c092229a9b2bb47fdfc6a29

Observation b78d49da-ca7c-4f1d-93d6-27b0c2b84725 · outbound

This paper cites Deepspeed-inference: enabling efficient inference of transformer models at unprecedented scale.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference Deepspeed-inference: enabling efficient inference of transformer models at unprecedented scale

Reference 5

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T15:45:51.304744Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-05T15:45:35.576172Z digest=sha256:fc2d76eb7e4160d75b7e5fb993ecd21fe468a7e48d2db558a03fcdbde8679cd7

Observation 005f0de8-1e5a-4f39-9539-e06fb5d312ae · outbound

This paper cites Gpu utilization is a misleading metric, 2025.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference Gpu utilization is a misleading metric, 2025

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T15:45:51.165591Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-05T15:45:35.614837Z digest=sha256:ab7e1b1213c5236d367a22600378bc37fdc4e7ebc2020b1048aecd14d3ff4e3b

Observation 37415a6e-20ca-453a-88e9-92b47eab4bc4 · outbound

This paper cites KVDirect: Distributed Disaggregated LLM Inference.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference KVDirect: Distributed Disaggregated LLM Inference

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-05T15:45:35.674883Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T15:45:35.674883Z digest=sha256:85df39a3df345f602944d38a6f16b9e712e3bd1319eddc4555889392014693a8

Observation 917bc262-3221-4a86-ba8c-68677aa20ce7 · outbound

This paper cites Leveraging endpoint flexibility in data- intensive clusters.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference Leveraging endpoint flexibility in data- intensive clusters

Reference 8

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T15:45:51.044949Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-05T15:45:35.722485Z digest=sha256:7e4824b5de2e4c1a9de6b53c3395a07e8a69dc171e11bfbbeb41e48f5a7ec427

Observation 434850f0-8903-417f-b7a6-ffd26b851236 · outbound

This paper cites Efficient coflow scheduling with varys.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference Efficient coflow scheduling with varys

Reference 9

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T15:45:50.913622Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-05T15:45:35.785050Z digest=sha256:04168e834d56bac1e0468a5459fa74e88cf2ba8fd68f6e6b5fee8aa9374b2d9c

Observation 409d0484-5e32-410c-a5e0-104957c72a60 · outbound

This paper cites Resource central: Understanding and predict- ing workloads for improved resource management in large cloud platforms.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference Resource central: Understanding and predict- ing workloads for improved resource management in large cloud platforms

Reference 10

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T15:45:50.784886Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-05T15:45:35.845065Z digest=sha256:cd9ea8116126c0d615581a70aa5e4996dd3821353b2862fe3464aede3622e22b

Observation e875fca2-10f5-4384-852b-1a3a117d8998 · outbound

This paper cites A Complete Survey on LLM-based AI Chatbots.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference A Complete Survey on LLM-based AI Chatbots

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-05T15:45:35.905253Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T15:45:35.905253Z digest=sha256:79207661f455c1d51877b1a28a3321049ae09d388ad66ad3766f1f27ef29bec5

Observation 475ceb66-0e2a-402e-9b23-87108b8374f7 · outbound

This paper cites Paragon: Qos-aware scheduling for heterogeneous datacenters.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference Paragon: Qos-aware scheduling for heterogeneous datacenters

Reference 12

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T15:45:50.634811Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-05T15:45:35.954752Z digest=sha256:659ac90fa7ad2cb579af3c0f5095e271c8c30e8a38a70280f10cde0aa336873b

Observation 6a2343fd-7f22-4243-9541-5ab22adf0c5c · outbound

This paper cites Deploy DeepSeek-V3/R1 671b on 8 × H100 and throughput bench- marks.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference Deploy DeepSeek-V3/R1 671b on 8 × H100 and throughput bench- marks

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T15:45:50.484742Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-05T15:45:36.004833Z digest=sha256:ba4bf60f14d4e412d4f3ed75b462bd78eb51ddefc33cc5a0cdb624bdc8aad872

Observation 5bbc3669-7426-4e42-b71e-95fbe657eed6 · outbound

This paper cites Autoscale: Dynamic, robust capacity management for multi-tier data centers.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference Autoscale: Dynamic, robust capacity management for multi-tier data centers

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T15:45:50.292762Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-05T15:45:36.049734Z digest=sha256:a56467930888e4958d872db0f9fb2c11c8fba64c5a6f7d40b4927d0e0ca8a910

Observation be13370d-eb17-418d-ba53-bd1ecfdce013 · outbound

This paper cites Firmament: Fast, centralized cluster scheduling at scale.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference Firmament: Fast, centralized cluster scheduling at scale

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T15:45:50.155912Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-05T15:45:36.105424Z digest=sha256:b37642c3e290c454c44327a30703bfedac6ae739c44c6fe4db5783aaa430b860

Observation 6a74bdda-0d75-4dff-865e-b99caede7018 · outbound

This paper cites M\'elange: Cost Efficient Large Language Model Serving by Exploiting GPU Heterogeneity.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference M\'elange: Cost Efficient Large Language Model Serving by Exploiting GPU Heterogeneity

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-05T15:45:36.145048Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T15:45:36.145048Z digest=sha256:b9b349791ca761b71877db3a5e6af99917e6c99e740b70cd768284f60f3e8f75

Observation 8aeedfa4-c07d-4dfe-8f40-33f896f9b853 · outbound

This paper cites Tiresias: A {GPU} cluster manager for distributed deep learning.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference Tiresias: A {GPU} cluster manager for distributed deep learning

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T15:45:50.014740Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-05T15:45:36.184753Z digest=sha256:873c38d695a28283977f6d565ac6d21e23d9f06c13fc84376563d900cb45d4d5

Observation 39312223-c144-4967-ba9d-d17370826359 · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-05T15:45:36.234753Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T15:45:36.234753Z digest=sha256:48a038ab49ad31e0049c20d33d5f9636965fffa8e29ddf223aea34f39920c637

Observation 3b62d94d-a129-4d69-9b26-5a56356e42ca · outbound

This paper cites MemServe: Context Caching for Disaggregated LLM Serving with Elastic Memory Pool.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference MemServe: Context Caching for Disaggregated LLM Serving with Elastic Memory Pool

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-05T15:45:36.304749Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T15:45:36.304749Z digest=sha256:57790b7a1e1020f11b7b49a015c997f1159aeb22399be4735311605bf4de0175

Observation f33f8277-8b6a-4991-b6f4-b43908aa318b · outbound

This paper cites Inference without Interference: Disaggregate LLM Inference for Mixed Downstream Workloads.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference Inference without Interference: Disaggregate LLM Inference for Mixed Downstream Workloads

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-05T15:45:36.345043Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T15:45:36.345043Z digest=sha256:993899c3af087e3db30d76e5935cc363d30acc5cdb2576956a7bdd4bb4e3b805

Observation 45d01c18-09d5-4c7f-ba03-31439aed0250 · outbound

This paper cites Quincy: fair scheduling for distributed computing clusters.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference Quincy: fair scheduling for distributed computing clusters

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T15:45:49.844745Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-05T15:45:36.394846Z digest=sha256:66691aedd64cd25903bd68ca446036e4093e9326ede4ca607453a44bcf1f6311

Observation 4440eb5b-1899-4b27-825d-5f28883f0231 · outbound

This paper cites Amant, Chetan Bansal, Victor Rühle, Anoop Kulkarni, Steve Kofsky, and Saravan Rajmohan.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference Amant, Chetan Bansal, Victor Rühle, Anoop Kulkarni, Steve Kofsky, and Saravan Rajmohan

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-05T15:45:36.468687Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T15:45:36.468687Z digest=sha256:95fd901675ce1d3c7da6f46608fb62b6f81f1001fc3f1d3b49afaee28625e719

Observation f8e7c6e4-e32f-40d6-b289-aa0fb5da0410 · outbound

This paper cites HexGen: Generative Inference of Large Language Model over Heterogeneous Environment.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference HexGen: Generative Inference of Large Language Model over Heterogeneous Environment

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-05T15:45:36.495152Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T15:45:36.495152Z digest=sha256:c628267209115c0af2f2e72d1e9a667d9ad81ce1ff2c6902286af7e81bc001a2

Observation 59ce4631-00ea-4533-a7ba-7c080344900d · outbound

This paper cites Netcache: Balancing key-value stores with fast in-network caching.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference Netcache: Balancing key-value stores with fast in-network caching

Reference 24

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T15:45:49.705565Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-05T15:45:36.534752Z digest=sha256:9127970a08057c8651f2b894baa3b0e2a34897ef593f6144bc50a4f485ab858d

Observation 617bfea6-471a-425a-bf6a-44dcb80fa309 · outbound

This paper cites P/d- serve: Serving disaggregated large language model at scale, 2024.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference P/d- serve: Serving disaggregated large language model at scale, 2024

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T15:45:49.544746Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-05T15:45:36.585452Z digest=sha256:30c3a97d0c502132790d6501f715792220bf622b7ae48b5518fc69ad8cecc043

Observation 21b1a28a-61fe-4592-9c44-72ab951f3b18 · outbound

This paper cites Morpheus: Towards automated {SLOs} for en- terprise clusters.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference Morpheus: Towards automated {SLOs} for en- terprise clusters

Reference 26

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T15:45:49.356334Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-05T15:45:36.696297Z digest=sha256:470389789282efea3d4d9636edc9be14f285f335d85a16048e7f0cf6dee2310f

Observation d890f1f7-c6ea-4e78-9a31-aa1b0b2ff789 · outbound

This paper cites Pod-attention: Unlocking full prefill-decode overlap for faster llm inference.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference Pod-attention: Unlocking full prefill-decode overlap for faster llm inference

Reference 27

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T15:45:49.204747Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-05T15:45:36.845133Z digest=sha256:916335377ee9081d999df72371527aac50ed640cbf317b0397771599d37e8588

Observation cbeeca16-12c9-4573-a9b3-c7050b81c92a · outbound

This paper cites Keda: Kubernetes event-driven autoscaling.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference Keda: Kubernetes event-driven autoscaling

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T15:45:49.020411Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-05T15:45:36.964911Z digest=sha256:6fdea19c5d005e07e70d23db4f7fe2202d9ff8c6177e9bc3b878d7cf312a7e01

Observation 322f0d49-79c5-449f-a8c1-166f093df45f · outbound

This paper cites Kubernetes horizontal pod au- toscaler.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference Kubernetes horizontal pod au- toscaler

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T15:45:48.854745Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-05T15:45:37.095704Z digest=sha256:d941f5bad08e968d093778238ce0d478c7ee55c302ed0a76d3f8125bee78efd8

Observation efaff735-3754-4881-bab5-24bbd0938ddb · outbound

This paper cites Kubernetes vertical pod autoscaler.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference Kubernetes vertical pod autoscaler

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T15:45:48.524829Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-05T15:45:37.394751Z digest=sha256:ba86998205c2c715d3da8d161c3ef7e9161f3330cb0143be2de1ec3bfb24cf5c

Observation 61e57b32-a9c4-4e53-b13d-a709948684c1 · outbound

This paper cites Kubernetes: Production-grade container orchestration.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference Kubernetes: Production-grade container orchestration

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T15:45:48.374746Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-05T15:45:37.514840Z digest=sha256:dd64a84d07cc8e5a90dd64ecad2710e9834da9459f833fe8d750e487187fb7ff

Observation c4311eac-23f7-4449-b276-c31f83235da3 · outbound

This paper cites Efficient Memory Management for Large Language Model Serving with PagedAttention.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference Efficient Memory Management for Large Language Model Serving with PagedAttention

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-05T15:45:37.797229Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T15:45:37.797229Z digest=sha256:101febc322236cfc3bcf0949e6bbfc6a2d54adc95b5c2fc0434d49feae4c66a4

Observation 34e5fb31-0986-4b91-8ebf-86c0b4eda6a6 · outbound

This paper cites an unresolved cited work.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference Unresolved cited work

Reference 33

Resolution
parse uncertain
raw_fallback, observed 2026-08-05T15:45:48.684744Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-05T15:45:37.644748Z digest=sha256:42c812b9c46d46656328ffe997947b427afaac4a65ae5ee2fff5fb409029cd7c

Observation 24b6c890-27de-4af7-8f90-d3dffe6ba77a · outbound

This paper cites Themis: Fair and efficient {GPU} cluster scheduling.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference Themis: Fair and efficient {GPU} cluster scheduling

Reference 34

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T15:45:48.054753Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-05T15:45:38.045215Z digest=sha256:eb2a5e19af15c1fc0e0cc313381a1c06e3e036d7fc8a480abbdc9e03fd30b395

Observation d9a25650-0111-4be7-94b2-9e8419d86b50 · outbound

This paper cites Alpaserve: Statistical multiplexing with model parallelism for deep learning serving.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference Alpaserve: Statistical multiplexing with model parallelism for deep learning serving

Reference 35

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T15:45:48.224826Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-05T15:45:37.904754Z digest=sha256:17ea55369b5d311e718aa4b8cbaf6abd4c97fc154aae2f846c2a54a93b21ba57

Observation 008c09e5-d21c-48c1-b5c1-7e835ca18425 · outbound

This paper cites Mastering llm techniques: Inference optimization, 2023.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference Mastering llm techniques: Inference optimization, 2023

Reference 36

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T15:45:47.715097Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-05T15:45:38.302511Z digest=sha256:e49a0941a9eafb1eea5ea3e81088ce3f13109072ee911968a2cb2afbdc032643

Observation 946a2472-09c5-4e0b-8c07-93415e59af99 · outbound

This paper cites {Heterogeneity-Aware} cluster scheduling policies for deep learning workloads.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference {Heterogeneity-Aware} cluster scheduling policies for deep learning workloads

Reference 37

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T15:45:47.894357Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-05T15:45:38.194756Z digest=sha256:cf0da910a4802317c5dbd11c035a2f97dfe84618eadea808fd6312f2305c194c

Observation e26c1d2a-85b5-4204-88f6-abbf66139cad · outbound

This paper cites Introducing chatgpt.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference Introducing chatgpt

Reference 38

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T15:45:47.374750Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-05T15:45:38.568169Z digest=sha256:96764cbb7b156d011d4e60dc407af3e0c92e0d0dee2268ad25eb346dbd9ca2ec

Observation 7dd67305-7e24-437b-b0e2-24a865b5d666 · outbound

This paper cites Tensorrt-llm: A deep learning compiler for large language models.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference Tensorrt-llm: A deep learning compiler for large language models

Reference 39

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T15:45:47.543754Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-05T15:45:38.384930Z digest=sha256:e56a8f56cb6c1315a6582f71bbb2c5b920450e81f246359ffac857c07d433b65

Observation 06e8cfb6-5051-45c5-8a5b-5b8ad9c2bdcf · outbound

This paper cites Splitwise: Efficient generative LLM inference using phase splitting.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference Splitwise: Efficient generative LLM inference using phase splitting

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-05T15:45:38.815520Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T15:45:38.815520Z digest=sha256:2773c69813e85d99b288b43dce41ec8b89f0724997570c31eb1504bbc381748a

Observation 10af1f55-f75b-4194-9f3e-e5ebe6d56cb1 · outbound

This paper cites Splitwise: Efficient generative llm inference using phase splitting.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference Splitwise: Efficient generative llm inference using phase splitting

Reference 41

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T15:45:47.104828Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-05T15:45:38.684953Z digest=sha256:34f73fda226a04bf4067f12a36248038359e3564763072678f37cfb061e7d21f

Observation add94ac0-d2e8-450f-beb4-56798e2c52e7 · outbound

This paper cites DeepSpeed-MoE: Advancing Mixture-of-Experts Inference and Training to Power Next-Generation AI Scale.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference DeepSpeed-MoE: Advancing Mixture-of-Experts Inference and Training to Power Next-Generation AI Scale

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-05T15:45:39.094750Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T15:45:39.094750Z digest=sha256:10416bd553b2522cc27ff5f083a079f0182dbcd71b6833becec656152841325d

Observation 92be0001-d2d4-4b27-b8bb-b84232124710 · outbound

This paper cites Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-05T15:45:38.950601Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T15:45:38.950601Z digest=sha256:659437cec8292c18031303c54a14cbc80df1eb9738536395be7b2a81d3f498f2

Observation fb9321c0-4d56-464b-bfc7-346b861a505f · outbound

This paper cites D\'ej\`aVu: KV-cache Streaming for Fast, Fault-tolerant Generative LLM Serving.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference D\'ej\`aVu: KV-cache Streaming for Fast, Fault-tolerant Generative LLM Serving

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-05T15:45:39.355105Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T15:45:39.355105Z digest=sha256:0c9193295c22f6d31a0e8df3b7b91051c21874e2f3962919c6037e1bc817ad7e

Observation cde3a46f-15b0-4b33-8203-5c39b29d5f5d · outbound

This paper cites Dynamollm: Designing llm inference clusters for performance and energy ef- ficiency, 2024.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference Dynamollm: Designing llm inference clusters for performance and energy ef- ficiency, 2024

Reference 45

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T15:45:46.790797Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-05T15:45:39.244748Z digest=sha256:fe81f11cdc89b4101fce24825973981d6e48f373e7a1c1020a2d4d2bb3eb9109

Observation 63815573-bf62-4253-a78e-11a2f9f2bee6 · outbound

This paper cites Burstgpt: A real-world workload dataset to optimize llm serving systems, 2025.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference Burstgpt: A real-world workload dataset to optimize llm serving systems, 2025

Reference 46

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T15:45:46.662517Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-05T15:45:39.735447Z digest=sha256:bacd5915441c2900d3f6d60ac3db0fae587307f06096b041ee99ea37c6d26a95

Observation fd14e2a9-b054-4988-883c-e1bdcdeae13d · outbound

This paper cites Attention is all you need.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference Attention is all you need

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-05T15:45:39.514903Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T15:45:39.514903Z digest=sha256:d3bfb83f6cdcb5e16a65e81b2aa1caf92ceec7bca4475570849d94ecb6aaffb0

Observation 4e5c97bd-0af5-460d-b280-c1736cfdbb3d · outbound

This paper cites Fast Distributed Inference Serving for Large Language Models.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference Fast Distributed Inference Serving for Large Language Models

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-05T15:45:40.072783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T15:45:40.072783Z digest=sha256:d62a8a8a412c0a0d7434b3bff92c10a3eda5e20559269951259606c160171afb

Observation b6b5f8af-d27f-4efc-a55b-3e0e49cba8af · outbound

This paper cites Deepscaling: mi- croservices autoscaling for stable cpu utilization in large scale cloud systems.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference Deepscaling: mi- croservices autoscaling for stable cpu utilization in large scale cloud systems

Reference 49

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T15:45:46.484737Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-05T15:45:39.874829Z digest=sha256:7c2e631e8bb6db2d75d5f6bc5e7b490dc20ca1a5ffc6a3e5a48f08ba471e8f50

Observation 628fb8ca-daed-443a-9c09-98c934c15340 · outbound

This paper cites Gandiva: Introspec- tive cluster scheduling for deep learning.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference Gandiva: Introspec- tive cluster scheduling for deep learning

Reference 50

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T15:45:46.304737Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-05T15:45:40.384815Z digest=sha256:de366b24392a1f77a536e2ff5999f004359b1f8149d7188cd51223def4f5e848

Observation 8029a4fa-940d-4270-8a33-34a1f2fbeb3c · outbound

This paper cites Skylb: A locality-aware cross-region load balancer for llm inference.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference Skylb: A locality-aware cross-region load balancer for llm inference

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-05T15:45:40.285526Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T15:45:40.285526Z digest=sha256:585872b6ff5d5d0c06196f7dd0a6ced936cd7b9ee7168550a002685b04cb77f8

Observation a5ca7c4f-3319-459b-b0ad-2f5dae35a1e0 · outbound

This paper cites When Search Engine Services meet Large Language Models: Visions and Challenges.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference When Search Engine Services meet Large Language Models: Visions and Challenges

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-05T15:45:40.814751Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T15:45:40.814751Z digest=sha256:94084985fd6bdbe3364a69ccf0dcc9c1bb824e9cab2866a39f7cc6712150cde8

Observation 5a26dc84-0566-465a-b261-d159407ac033 · outbound

This paper cites {AntMan}: Dynamic scaling on {GPU} clusters for deep learning.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference {AntMan}: Dynamic scaling on {GPU} clusters for deep learning

Reference 53

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T15:45:46.134894Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-05T15:45:40.564835Z digest=sha256:7e884c39f4b33d839ff1a4236e50058fd4fbd703492f5821dc4ebc3dba11bf07

Observation 9c1753c7-4196-4eef-8c5d-9605fafc83cf · outbound

This paper cites Orca: A distributed serving system for transformer-based generative models.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference Orca: A distributed serving system for transformer-based generative models

Reference 54

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T15:45:45.984742Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-05T15:45:41.054848Z digest=sha256:386f9995b8335b4ad9def4777c0d3428e6010ad698be3b5b5554dd71c5acd05e

Observation e003e517-1b64-4008-83bc-c1ef61bfa38c · outbound

This paper cites Qwen3 Technical Report.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference Qwen3 Technical Report

Reference 55

Resolution
unresolved
no resolver link, observed 2026-08-05T15:45:40.923132Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T15:45:40.923132Z digest=sha256:c0ebe4aa453c7dc90d2a881c7230e33d974a0bcd08868ae221b306f22326a681

Observation a2226b0d-482c-40e2-9ff5-95ac47053a60 · outbound

This paper cites Sglang: Efficient execution of structured language model programs.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference Sglang: Efficient execution of structured language model programs

Reference 56

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T15:45:45.334854Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-05T15:45:41.445649Z digest=sha256:3fcd812a717598ce9b21bc5d3050b81747df8c284212995d3c1f02794d52d7a6

Observation 52c49da3-783b-4771-a9c6-28672a21f558 · outbound

This paper cites Day zero benchmarks for qwen 3 with sglang on baseten.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference Day zero benchmarks for qwen 3 with sglang on baseten

Reference 57

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T15:45:45.832062Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-05T15:45:41.187832Z digest=sha256:331b22acb0ec56c866610d9fbe86d5f22257bcc81cd4a4e56b2c63fef0eff01d

Observation e999b7ab-399e-41ac-b2a2-49922ad45b24 · outbound

This paper cites MegaScale-Infer: Serving Mixture-of-Experts at Scale with Disaggregated Expert Parallelism.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference MegaScale-Infer: Serving Mixture-of-Experts at Scale with Disaggregated Expert Parallelism

Reference 58

Resolution
unresolved
no resolver link, observed 2026-08-05T15:45:41.645133Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T15:45:41.645133Z digest=sha256:20beec0343159c0448ec51854dda7109880a823f37b92a285cbcbf2f81a73bcd

Observation 05f34593-b95c-4dbd-bc11-7220b48a6446 · outbound

This paper cites {DistServe}: Disaggregating prefill and decoding for goodput-optimized large language model serving.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference {DistServe}: Disaggregating prefill and decoding for goodput-optimized large language model serving

Reference 60

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T15:45:45.064755Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-05T15:45:41.584746Z digest=sha256:592c72ddd9494dc06ca16de9dec047083fa675987883255b7bcfa778df49d8e6

Observation 7d6a797b-c5be-45c7-936a-a5d037fa6939 · outbound

This paper cites an unresolved cited work.

Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference Unresolved cited work

Reference 2025

Resolution
unresolved
raw_fallback, observed 2026-08-05T15:45:45.694749Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-05T15:45:41.297650Z digest=sha256:41013cb080a18a70bc8789bb615707c18bea1fd419f7dd1550199ec0523754e9

Pith citing papers

Observation cf870d12-d482-4314-8454-4d57614fcc5a · inbound

Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda cites this paper.

Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference

Reference 67

Resolution
verified exact
arxiv_id, observed 2026-05-10T06:31:30.854890Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-05-10T06:27:23.580445Z digest=sha256:b30825e1e3a3ee9dad6e61232c6d54fca49e7c5c7afdcd06ad1475cc8ce13d9e

Observation 63695de3-9746-4158-9525-4fb243846207 · inbound

TurboServe: Serving Streaming Video Generation Efficiently and Economically cites this paper.

TurboServe: Serving Streaming Video Generation Efficiently and Economically Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference

Reference 27

Resolution
verified exact
arxiv_id, observed 2026-07-04T02:39:25.592664Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-06-26T19:23:10.356881Z digest=sha256:df9fe53fc0c50b2e6b3922602c2ca57d2cf8fefcb2520909d820d6720ac1019b