{"as_of":"2026-08-09T13:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3d7466182e32e0d534b983716c38c0dbfe562835e2fa88bdbafbdeb44f0a6cd6","coverage":[{"denominator":60,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":60,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T15:45:41.645133Z","state":"measured"},{"denominator":62,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":62,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-26T19:23:10.356881Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T02:39:25.590182Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-08T02:10:39.123561Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"cited_work":{"arxiv_id":"2508.19559","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.19559","snapshot_observed_at":"2026-07-04T02:39:25.590182Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference.arXiv preprint arXiv:2508.19559.2025","venue":null,"work_id":"363b745c-6b1b-4dbf-9be7-79cbb2b32379","year":2025},"citing_paper":{"arxiv_id":"2604.17227","last_updated":"2026-04-19T03:20:30Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T03:20:30Z","title":"Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models -- A Research Agenda","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-10T06:27:23.580445Z"},"links":{"cited_paper":"/paper/2508.19559","citing_paper":"/paper/2604.17227"},"observation_digest":"sha256:b30825e1e3a3ee9dad6e61232c6d54fca49e7c5c7afdcd06ad1475cc8ce13d9e","observation_id":"cf870d12-d482-4314-8454-4d57614fcc5a","resolution":{"observed_at":"2026-05-10T06:31:30.854890Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-08T02:10:39.123561Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"cited_work":{"arxiv_id":"2508.19559","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.19559","snapshot_observed_at":"2026-07-04T02:39:25.590182Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference.arXiv preprint arXiv:2508.19559.2025","venue":null,"work_id":"363b745c-6b1b-4dbf-9be7-79cbb2b32379","year":2025},"citing_paper":{"arxiv_id":"2606.19271","last_updated":"2026-06-17T16:48:36Z","snapshot_observed_at":"2026-08-05T21:43:31.886249Z","submitted_at":"2026-06-17T16:48:36Z","title":"TurboServe: Serving Streaming Video Generation Efficiently and Economically","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-26T19:23:10.356881Z"},"links":{"cited_paper":"/paper/2508.19559","citing_paper":"/paper/2606.19271"},"observation_digest":"sha256:df9fe53fc0c50b2e6b3922602c2ca57d2cf8fefcb2520909d820d6720ac1019b","observation_id":"63695de3-9746-4158-9525-4fb243846207","resolution":{"observed_at":"2026-07-04T02:39:25.592664Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2508.19559/citation-record","integrity":"/paper/2508.19559/integrity","json":"/paper/2508.19559/citation-record.json","paper":"/paper/2508.19559"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:51.684739Z","title":"Accessed 2025-7-24","venue":null,"work_id":"3d86b173-73da-40fa-bcdd-b26d4e18fe67","year":2025},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-08T02:10:39.123561Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:35.064123Z"},"links":{"citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:daa58853029644897bd16265048c78b78f9f8a9eca4c11efa11553c73ec326cf","observation_id":"5296e3ec-05ea-4bcd-aa64-18062ea8bf1e","resolution":{"observed_at":"2026-08-05T15:45:51.734750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:51.554738Z","title":"https:// developer.nvidia.com/docs,","venue":null,"work_id":"10b4a840-c9f3-47b2-9681-6aa2caa3d089","year":null},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-08T02:10:39.123561Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:35.204902Z"},"links":{"citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:55a6c0f57c69e7467fee303cfc87f718ff78dc41013a90afc99ad1d5501be439","observation_id":"e9a84438-7d06-4387-9d3f-3117c7e02ccb","resolution":{"observed_at":"2026-08-05T15:45:51.572255Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:51.409153Z","title":null,"venue":null,"work_id":"5001aaf8-7857-4a53-a07f-41417907cc94","year":2023},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-08T02:10:39.123561Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:35.294236Z"},"links":{"citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:73c6a9126374f5ce510e8113ec45293bccc8eddea696fe800560703862117f77","observation_id":"b1aa73c1-0094-43ae-acc1-44eaa0ef514c","resolution":{"observed_at":"2026-08-05T15:45:51.434810Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02310","last_updated":"2024-06-17T21:10:46Z","snapshot_observed_at":"2026-07-06T17:39:24.823145Z","submitted_at":"2024-03-04T18:47:08Z","title":"Taming Throughput-Latency Tradeoff in LLM Inference with Sarathi-Serve","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.02310","snapshot_observed_at":"2026-08-05T15:45:35.454834Z","title":"Gula- vani, Alexey Tumanov, and Ramachandran Ram- jee","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-08T02:10:39.123561Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:35.454834Z"},"links":{"cited_paper":"/paper/2403.02310","citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:b899e43af1a14c0b692d555218b3beffcf46524b9c092229a9b2bb47fdfc6a29","observation_id":"2be6c643-712a-4b5b-b3c2-5aaacc822daa","resolution":{"observed_at":"2026-08-05T15:45:35.454834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:51.266670Z","title":"Deepspeed-inference: enabling efficient inference of transformer models at unprecedented scale","venue":null,"work_id":"78e6bc95-7816-4b64-b948-1ab90bd09d95","year":2022},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-08T02:10:39.123561Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:35.576172Z"},"links":{"citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:fc2d76eb7e4160d75b7e5fb993ecd21fe468a7e48d2db558a03fcdbde8679cd7","observation_id":"b78d49da-ca7c-4f1d-93d6-27b0c2b84725","resolution":{"observed_at":"2026-08-05T15:45:51.304744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:51.124725Z","title":"Gpu utilization is a misleading metric, 2025","venue":null,"work_id":"225198d8-3ae3-4f01-8f67-05ae858c7cb1","year":2025},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-08T02:10:39.123561Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:35.614837Z"},"links":{"citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:ab7e1b1213c5236d367a22600378bc37fdc4e7ebc2020b1048aecd14d3ff4e3b","observation_id":"005f0de8-1e5a-4f39-9539-e06fb5d312ae","resolution":{"observed_at":"2026-08-05T15:45:51.165591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14743","last_updated":"2024-12-13T21:54:16Z","snapshot_observed_at":"2026-08-05T05:05:35.758967Z","submitted_at":"2024-12-13T21:54:16Z","title":"KVDirect: Distributed Disaggregated LLM Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.14743","snapshot_observed_at":"2026-08-05T15:45:35.674883Z","title":"Kvdirect: Dis- tributed disaggregated llm inference.arXiv preprint arXiv:2501.14743, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-08T02:10:39.123561Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:35.674883Z"},"links":{"cited_paper":"/paper/2501.14743","citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:85df39a3df345f602944d38a6f16b9e712e3bd1319eddc4555889392014693a8","observation_id":"37415a6e-20ca-453a-88e9-92b47eab4bc4","resolution":{"observed_at":"2026-08-05T15:45:35.674883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:50.998231Z","title":"Leveraging endpoint flexibility in data- intensive clusters","venue":null,"work_id":"9603220c-2c0c-4fa3-be24-ba308aacc502","year":2013},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-08T02:10:39.123561Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:35.722485Z"},"links":{"citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:7e4824b5de2e4c1a9de6b53c3395a07e8a69dc171e11bfbbeb41e48f5a7ec427","observation_id":"917bc262-3221-4a86-ba8c-68677aa20ce7","resolution":{"observed_at":"2026-08-05T15:45:51.044949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:50.881065Z","title":"Efficient coflow scheduling with varys","venue":null,"work_id":"e068b87c-99c2-41fa-93e0-2f7dd3e67803","year":2014},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-08T02:10:39.123561Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:35.785050Z"},"links":{"citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:04168e834d56bac1e0468a5459fa74e88cf2ba8fd68f6e6b5fee8aa9374b2d9c","observation_id":"434850f0-8903-417f-b7a6-ffd26b851236","resolution":{"observed_at":"2026-08-05T15:45:50.913622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:50.734979Z","title":"Resource central: Understanding and predict- ing workloads for improved resource management in large cloud platforms","venue":null,"work_id":"aa1de879-daf2-45b8-ae63-816592bcacba","year":2017},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-08T02:10:39.123561Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:35.845065Z"},"links":{"citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:cd9ea8116126c0d615581a70aa5e4996dd3821353b2862fe3464aede3622e22b","observation_id":"409d0484-5e32-410c-a5e0-104957c72a60","resolution":{"observed_at":"2026-08-05T15:45:50.784886Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16937","last_updated":"2024-11-18T12:36:13Z","snapshot_observed_at":"2026-07-06T18:36:16.828338Z","submitted_at":"2024-06-17T09:39:34Z","title":"A Complete Survey on LLM-based AI Chatbots","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16937","snapshot_observed_at":"2026-08-05T15:45:35.905253Z","title":"A complete survey on llm- based ai chatbots.arXiv preprint arXiv:2406.16937, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-08T02:10:39.123561Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:35.905253Z"},"links":{"cited_paper":"/paper/2406.16937","citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:79207661f455c1d51877b1a28a3321049ae09d388ad66ad3766f1f27ef29bec5","observation_id":"e875fca2-10f5-4384-852b-1a3a117d8998","resolution":{"observed_at":"2026-08-05T15:45:35.905253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:50.604765Z","title":"Paragon: Qos-aware scheduling for heterogeneous datacenters","venue":null,"work_id":"bdd61825-c2ca-41f3-8506-994e9c340270","year":2013},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-08T02:10:39.123561Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:35.954752Z"},"links":{"citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:659ac90fa7ad2cb579af3c0f5095e271c8c30e8a38a70280f10cde0aa336873b","observation_id":"475ceb66-0e2a-402e-9b23-87108b8374f7","resolution":{"observed_at":"2026-08-05T15:45:50.634811Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:50.424837Z","title":"Deploy DeepSeek-V3/R1 671b on 8 × H100 and throughput bench- marks","venue":null,"work_id":"60a59d71-70ee-4013-9b19-2f63470d54a6","year":2025},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-08T02:10:39.123561Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:36.004833Z"},"links":{"citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:ba4bf60f14d4e412d4f3ed75b462bd78eb51ddefc33cc5a0cdb624bdc8aad872","observation_id":"6a2343fd-7f22-4243-9541-5ab22adf0c5c","resolution":{"observed_at":"2026-08-05T15:45:50.484742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:50.245147Z","title":"Autoscale: Dynamic, robust capacity management for multi-tier data centers","venue":null,"work_id":"366d560c-b54e-4d21-84e2-022b0d993a9b","year":2012},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-08T02:10:39.123561Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:36.049734Z"},"links":{"citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:a56467930888e4958d872db0f9fb2c11c8fba64c5a6f7d40b4927d0e0ca8a910","observation_id":"5bbc3669-7426-4e42-b71e-95fbe657eed6","resolution":{"observed_at":"2026-08-05T15:45:50.292762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:50.124829Z","title":"Firmament: Fast, centralized cluster scheduling at scale","venue":null,"work_id":"54a1be86-d7b0-4050-bce0-86583a5812f3","year":2016},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-08T02:10:39.123561Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:36.105424Z"},"links":{"citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:b37642c3e290c454c44327a30703bfedac6ae739c44c6fe4db5783aaa430b860","observation_id":"be13370d-eb17-418d-ba53-bd1ecfdce013","resolution":{"observed_at":"2026-08-05T15:45:50.155912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14527","last_updated":"2024-07-22T10:56:19Z","snapshot_observed_at":"2026-07-06T18:04:00.217896Z","submitted_at":"2024-04-22T18:56:18Z","title":"M\\'elange: Cost Efficient Large Language Model Serving by Exploiting GPU Heterogeneity","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14527","snapshot_observed_at":"2026-08-05T15:45:36.145048Z","title":"M\\’elange: Cost efficient large language model serv- ing by exploiting gpu heterogeneity.arXiv preprint arXiv:2404.14527, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-08T02:10:39.123561Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:36.145048Z"},"links":{"cited_paper":"/paper/2404.14527","citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:b9b349791ca761b71877db3a5e6af99917e6c99e740b70cd768284f60f3e8f75","observation_id":"6a74bdda-0d75-4dff-865e-b99caede7018","resolution":{"observed_at":"2026-08-05T15:45:36.145048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:49.964746Z","title":"Tiresias: A {GPU} cluster manager for distributed deep learning","venue":null,"work_id":"67fb910a-14f4-409a-a586-a20845b156c3","year":2019},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-08T02:10:39.123561Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:36.184753Z"},"links":{"citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:873c38d695a28283977f6d565ac6d21e23d9f06c13fc84376563d900cb45d4d5","observation_id":"8aeedfa4-c07d-4dfe-8f40-33f896f9b853","resolution":{"observed_at":"2026-08-05T15:45:50.014740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T15:45:36.234753Z","title":"Deepseek-r1: Incen- tivizingreasoningcapabilityinllmsviareinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-08T02:10:39.123561Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:36.234753Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:48a038ab49ad31e0049c20d33d5f9636965fffa8e29ddf223aea34f39920c637","observation_id":"39312223-c144-4967-ba9d-d17370826359","resolution":{"observed_at":"2026-08-05T15:45:36.234753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17565","last_updated":"2024-12-21T13:55:49Z","snapshot_observed_at":"2026-07-06T18:36:42.830927Z","submitted_at":"2024-06-25T14:02:08Z","title":"MemServe: Context Caching for Disaggregated LLM Serving with Elastic Memory Pool","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17565","snapshot_observed_at":"2026-08-05T15:45:36.304749Z","title":"Mem- serve: Flexible mem pool for building disaggre- gated llm serving with caching, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-08T02:10:39.123561Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:36.304749Z"},"links":{"cited_paper":"/paper/2406.17565","citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:57790b7a1e1020f11b7b49a015c997f1159aeb22399be4735311605bf4de0175","observation_id":"3b62d94d-a129-4d69-9b26-5a56356e42ca","resolution":{"observed_at":"2026-08-05T15:45:36.304749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.11181","last_updated":"2024-01-20T09:43:36Z","snapshot_observed_at":"2026-08-05T23:35:16.350557Z","submitted_at":"2024-01-20T09:43:36Z","title":"Inference without Interference: Disaggregate LLM Inference for Mixed Downstream Workloads","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.11181","snapshot_observed_at":"2026-08-05T15:45:36.345043Z","title":"Infer- ence without interference: Disaggregate llm inference for mixed downstream workloads","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-08T02:10:39.123561Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:36.345043Z"},"links":{"cited_paper":"/paper/2401.11181","citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:993899c3af087e3db30d76e5935cc363d30acc5cdb2576956a7bdd4bb4e3b805","observation_id":"f33f8277-8b6a-4991-b6f4-b43908aa318b","resolution":{"observed_at":"2026-08-05T15:45:36.345043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:49.801321Z","title":"Quincy: fair scheduling for distributed computing clusters","venue":null,"work_id":"eaa87a55-197d-420a-96d8-f4c185dd70ed","year":2009},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-08T02:10:39.123561Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:36.394846Z"},"links":{"citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:66691aedd64cd25903bd68ca446036e4093e9326ede4ca607453a44bcf1f6311","observation_id":"45d01c18-09d5-4c7f-ba03-31439aed0250","resolution":{"observed_at":"2026-08-05T15:45:49.844745Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:36.468687Z","title":"Amant, Chetan Bansal, Victor Rühle, Anoop Kulkarni, Steve Kofsky, and Saravan Rajmohan","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-08T02:10:39.123561Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:36.468687Z"},"links":{"citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:95fd901675ce1d3c7da6f46608fb62b6f81f1001fc3f1d3b49afaee28625e719","observation_id":"4440eb5b-1899-4b27-825d-5f28883f0231","resolution":{"observed_at":"2026-08-05T15:45:36.468687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.11514","last_updated":"2024-05-27T15:55:22Z","snapshot_observed_at":"2026-08-08T21:38:25.606375Z","submitted_at":"2023-11-20T03:28:57Z","title":"HexGen: Generative Inference of Large Language Model over Heterogeneous Environment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.11514","snapshot_observed_at":"2026-08-05T15:45:36.495152Z","title":"Hexgen: Generative inference of large language model over heterogeneous environment","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-08T02:10:39.123561Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:36.495152Z"},"links":{"cited_paper":"/paper/2311.11514","citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:c628267209115c0af2f2e72d1e9a667d9ad81ce1ff2c6902286af7e81bc001a2","observation_id":"f8e7c6e4-e32f-40d6-b289-aa0fb5da0410","resolution":{"observed_at":"2026-08-05T15:45:36.495152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:49.674401Z","title":"Netcache: Balancing key-value stores with fast in-network caching","venue":null,"work_id":"148cb772-e7db-4903-b788-03239df86843","year":2017},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-08T02:10:39.123561Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:36.534752Z"},"links":{"citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:9127970a08057c8651f2b894baa3b0e2a34897ef593f6144bc50a4f485ab858d","observation_id":"59ce4631-00ea-4533-a7ba-7c080344900d","resolution":{"observed_at":"2026-08-05T15:45:49.705565Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:49.494749Z","title":"P/d- serve: Serving disaggregated large language model at scale, 2024","venue":null,"work_id":"09415c84-ef56-4934-b96f-e193ee904f49","year":2024},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-08T02:10:39.123561Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:36.585452Z"},"links":{"citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:30c3a97d0c502132790d6501f715792220bf622b7ae48b5518fc69ad8cecc043","observation_id":"617bfea6-471a-425a-bf6a-44dcb80fa309","resolution":{"observed_at":"2026-08-05T15:45:49.544746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:49.314804Z","title":"Morpheus: Towards automated {SLOs} for en- terprise clusters","venue":null,"work_id":"9173d991-9dcb-4c94-beac-6d667ce99b0e","year":2016},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-08T02:10:39.123561Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:36.696297Z"},"links":{"citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:470389789282efea3d4d9636edc9be14f285f335d85a16048e7f0cf6dee2310f","observation_id":"21b1a28a-61fe-4592-9c44-72ab951f3b18","resolution":{"observed_at":"2026-08-05T15:45:49.356334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:49.154752Z","title":"Pod-attention: Unlocking full prefill-decode overlap for faster llm inference","venue":null,"work_id":"18742511-1481-4a16-853e-7ea85c500d15","year":2025},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-08T02:10:39.123561Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:36.845133Z"},"links":{"citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:916335377ee9081d999df72371527aac50ed640cbf317b0397771599d37e8588","observation_id":"d890f1f7-c6ea-4e78-9a31-aa1b0b2ff789","resolution":{"observed_at":"2026-08-05T15:45:49.204747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:48.984747Z","title":"Keda: Kubernetes event-driven autoscaling","venue":null,"work_id":"53bf2a0e-a99f-4a69-a409-d065b55f1f1b","year":2023},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-08T02:10:39.123561Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:36.964911Z"},"links":{"citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:6fdea19c5d005e07e70d23db4f7fe2202d9ff8c6177e9bc3b878d7cf312a7e01","observation_id":"cbeeca16-12c9-4573-a9b3-c7050b81c92a","resolution":{"observed_at":"2026-08-05T15:45:49.020411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:48.816463Z","title":"Kubernetes horizontal pod au- toscaler","venue":null,"work_id":"b5a2155b-409c-4064-972d-943b684fc0b8","year":null},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-08T02:10:39.123561Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:37.095704Z"},"links":{"citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:d941f5bad08e968d093778238ce0d478c7ee55c302ed0a76d3f8125bee78efd8","observation_id":"322f0d49-79c5-449f-a8c1-166f093df45f","resolution":{"observed_at":"2026-08-05T15:45:48.854745Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:48.464747Z","title":"Kubernetes vertical pod autoscaler","venue":null,"work_id":"a1cf2239-c893-4e5c-af94-6da010c860cf","year":2023},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-08T02:10:39.123561Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:37.394751Z"},"links":{"citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:ba86998205c2c715d3da8d161c3ef7e9161f3330cb0143be2de1ec3bfb24cf5c","observation_id":"efaff735-3754-4881-bab5-24bbd0938ddb","resolution":{"observed_at":"2026-08-05T15:45:48.524829Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:48.334886Z","title":"Kubernetes: Production-grade container orchestration","venue":null,"work_id":"8be70081-a0db-4eab-b62b-7ef50ac93499","year":null},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-08T02:10:39.123561Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:37.514840Z"},"links":{"citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:dd64a84d07cc8e5a90dd64ecad2710e9834da9459f833fe8d750e487187fb7ff","observation_id":"61e57b32-a9c4-4e53-b13d-a709948684c1","resolution":{"observed_at":"2026-08-05T15:45:48.374746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-05T15:45:37.797229Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-08T02:10:39.123561Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:37.797229Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:101febc322236cfc3bcf0949e6bbfc6a2d54adc95b5c2fc0434d49feae4c66a4","observation_id":"c4311eac-23f7-4449-b276-c31f83235da3","resolution":{"observed_at":"2026-08-05T15:45:37.797229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:48.644767Z","title":null,"venue":null,"work_id":"5565f992-911f-49d1-8fdf-0a5e155adb8b","year":2025},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-08T02:10:39.123561Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:37.644748Z"},"links":{"citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:42c812b9c46d46656328ffe997947b427afaac4a65ae5ee2fff5fb409029cd7c","observation_id":"34e5fb31-0986-4b91-8ebf-86c0b4eda6a6","resolution":{"observed_at":"2026-08-05T15:45:48.684744Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:48.006841Z","title":"Themis: Fair and efficient {GPU} cluster scheduling","venue":null,"work_id":"f0dcb4a2-4128-4b66-8684-d8ade10ed508","year":2020},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-08T02:10:39.123561Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:38.045215Z"},"links":{"citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:eb2a5e19af15c1fc0e0cc313381a1c06e3e036d7fc8a480abbdc9e03fd30b395","observation_id":"24b6c890-27de-4af7-8f90-d3dffe6ba77a","resolution":{"observed_at":"2026-08-05T15:45:48.054753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:48.184751Z","title":"Alpaserve: Statistical multiplexing with model parallelism for deep learning serving","venue":null,"work_id":"658afa2a-75ab-4e5d-b1e0-732167a00404","year":2023},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-08T02:10:39.123561Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:37.904754Z"},"links":{"citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:17ea55369b5d311e718aa4b8cbaf6abd4c97fc154aae2f846c2a54a93b21ba57","observation_id":"d9a25650-0111-4be7-94b2-9e8419d86b50","resolution":{"observed_at":"2026-08-05T15:45:48.224826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:47.664815Z","title":"Mastering llm techniques: Inference optimization, 2023","venue":null,"work_id":"7077208a-0827-41a5-8007-0699614e6969","year":2023},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-08T02:10:39.123561Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:38.302511Z"},"links":{"citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:e49a0941a9eafb1eea5ea3e81088ce3f13109072ee911968a2cb2afbdc032643","observation_id":"008c09e5-d21c-48c1-b5c1-7e835ca18425","resolution":{"observed_at":"2026-08-05T15:45:47.715097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:47.846377Z","title":"{Heterogeneity-Aware} cluster scheduling policies for deep learning workloads","venue":null,"work_id":"e9bb5a2d-b7e5-4b3b-ac05-e6acc24c4e51","year":2020},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-08T02:10:39.123561Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:38.194756Z"},"links":{"citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:cf0da910a4802317c5dbd11c035a2f97dfe84618eadea808fd6312f2305c194c","observation_id":"946a2472-09c5-4e0b-8c07-93415e59af99","resolution":{"observed_at":"2026-08-05T15:45:47.894357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:47.325023Z","title":"Introducing chatgpt","venue":null,"work_id":"efe4fa49-0370-4399-adbd-767dd92f4fa9","year":2022},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-08T02:10:39.123561Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:38.568169Z"},"links":{"citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:96764cbb7b156d011d4e60dc407af3e0c92e0d0dee2268ad25eb346dbd9ca2ec","observation_id":"e26c1d2a-85b5-4204-88f6-abbf66139cad","resolution":{"observed_at":"2026-08-05T15:45:47.374750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:47.502196Z","title":"Tensorrt-llm: A deep learning compiler for large language models","venue":null,"work_id":"a4d73403-9f59-43d2-b2b1-42cd6f1be363","year":2023},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-08T02:10:39.123561Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:38.384930Z"},"links":{"citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:e56a8f56cb6c1315a6582f71bbb2c5b920450e81f246359ffac857c07d433b65","observation_id":"7dd67305-7e24-437b-b0e2-24a865b5d666","resolution":{"observed_at":"2026-08-05T15:45:47.543754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18677","last_updated":"2024-05-20T15:37:36Z","snapshot_observed_at":"2026-08-06T12:06:11.068182Z","submitted_at":"2023-11-30T16:24:42Z","title":"Splitwise: Efficient generative LLM inference using phase splitting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.18677","snapshot_observed_at":"2026-08-05T15:45:38.815520Z","title":"Splitwise: Efficient generative llm inference using phase splitting, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-08T02:10:39.123561Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:38.815520Z"},"links":{"cited_paper":"/paper/2311.18677","citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:2773c69813e85d99b288b43dce41ec8b89f0724997570c31eb1504bbc381748a","observation_id":"06e8cfb6-5051-45c5-8a5b-5b8ad9c2bdcf","resolution":{"observed_at":"2026-08-05T15:45:38.815520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:46.944851Z","title":"Splitwise: Efficient generative llm inference using phase splitting","venue":null,"work_id":"c393cd4a-c75a-4c42-8fb3-d5ad98843a9c","year":2024},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-08T02:10:39.123561Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:38.684953Z"},"links":{"citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:34f73fda226a04bf4067f12a36248038359e3564763072678f37cfb061e7d21f","observation_id":"10af1f55-f75b-4194-9f3e-e5ebe6d56cb1","resolution":{"observed_at":"2026-08-05T15:45:47.104828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.05596","last_updated":"2022-07-21T18:21:36Z","snapshot_observed_at":"2026-07-06T12:27:29.223870Z","submitted_at":"2022-01-14T18:36:04Z","title":"DeepSpeed-MoE: Advancing Mixture-of-Experts Inference and Training to Power Next-Generation AI Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.05596","snapshot_observed_at":"2026-08-05T15:45:39.094750Z","title":"Deepspeed- moe: Advancing mixture-of-experts inference and trainingtopowernext-generationaiscale, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-08T02:10:39.123561Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:39.094750Z"},"links":{"cited_paper":"/paper/2201.05596","citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:10416bd553b2522cc27ff5f083a079f0182dbcd71b6833becec656152841325d","observation_id":"add94ac0-d2e8-450f-beb4-56798e2c52e7","resolution":{"observed_at":"2026-08-05T15:45:39.094750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00079","last_updated":"2025-09-03T14:56:29Z","snapshot_observed_at":"2026-08-07T12:08:57.217593Z","submitted_at":"2024-06-24T02:05:32Z","title":"Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00079","snapshot_observed_at":"2026-08-05T15:45:38.950601Z","title":"Mooncake: A kvcache-centric disaggre- gated architecture for llm serving.arXiv preprint arXiv:2407.00079, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-08T02:10:39.123561Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:38.950601Z"},"links":{"cited_paper":"/paper/2407.00079","citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:659437cec8292c18031303c54a14cbc80df1eb9738536395be7b2a81d3f498f2","observation_id":"92be0001-d2d4-4b27-b8bb-b84232124710","resolution":{"observed_at":"2026-08-05T15:45:38.950601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.01876","last_updated":"2024-03-04T09:32:05Z","snapshot_observed_at":"2026-07-06T17:39:03.755444Z","submitted_at":"2024-03-04T09:32:05Z","title":"D\\'ej\\`aVu: KV-cache Streaming for Fast, Fault-tolerant Generative LLM Serving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.01876","snapshot_observed_at":"2026-08-05T15:45:39.355105Z","title":"Déjàvu: Kv- cache streaming for fast, fault-tolerant generative llm serving, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-08T02:10:39.123561Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:39.355105Z"},"links":{"cited_paper":"/paper/2403.01876","citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:0c9193295c22f6d31a0e8df3b7b91051c21874e2f3962919c6037e1bc817ad7e","observation_id":"fb9321c0-4d56-464b-bfc7-346b861a505f","resolution":{"observed_at":"2026-08-05T15:45:39.355105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:46.749666Z","title":"Dynamollm: Designing llm inference clusters for performance and energy ef- ficiency, 2024","venue":null,"work_id":"e512f6cc-03a6-40b9-ab92-8d360cc1f9fc","year":2024},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-08T02:10:39.123561Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:39.244748Z"},"links":{"citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:fe81f11cdc89b4101fce24825973981d6e48f373e7a1c1020a2d4d2bb3eb9109","observation_id":"cde3a46f-15b0-4b33-8203-5c39b29d5f5d","resolution":{"observed_at":"2026-08-05T15:45:46.790797Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:46.604737Z","title":"Burstgpt: A real-world workload dataset to optimize llm serving systems, 2025","venue":null,"work_id":"975037c1-7480-475f-a74d-3dee956b2b29","year":2025},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-08T02:10:39.123561Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:39.735447Z"},"links":{"citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:bacd5915441c2900d3f6d60ac3db0fae587307f06096b041ee99ea37c6d26a95","observation_id":"63815573-bf62-4253-a78e-11a2f9f2bee6","resolution":{"observed_at":"2026-08-05T15:45:46.662517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:39.514903Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-08T02:10:39.123561Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:39.514903Z"},"links":{"citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:d3bfb83f6cdcb5e16a65e81b2aa1caf92ceec7bca4475570849d94ecb6aaffb0","observation_id":"fd14e2a9-b054-4988-883c-e1bdcdeae13d","resolution":{"observed_at":"2026-08-05T15:45:39.514903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.05920","last_updated":"2024-09-25T05:57:51Z","snapshot_observed_at":"2026-07-06T15:25:24.491136Z","submitted_at":"2023-05-10T06:17:50Z","title":"Fast Distributed Inference Serving for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.05920","snapshot_observed_at":"2026-08-05T15:45:40.072783Z","title":"Fast distributed inference serving for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-08T02:10:39.123561Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:40.072783Z"},"links":{"cited_paper":"/paper/2305.05920","citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:d62a8a8a412c0a0d7434b3bff92c10a3eda5e20559269951259606c160171afb","observation_id":"4e5c97bd-0af5-460d-b280-c1736cfdbb3d","resolution":{"observed_at":"2026-08-05T15:45:40.072783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:46.434738Z","title":"Deepscaling: mi- croservices autoscaling for stable cpu utilization in large scale cloud systems","venue":null,"work_id":"a862dde1-d462-4d88-8ae9-5540ae575996","year":2022},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-08T02:10:39.123561Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:39.874829Z"},"links":{"citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:7c2e631e8bb6db2d75d5f6bc5e7b490dc20ca1a5ffc6a3e5a48f08ba471e8f50","observation_id":"b6b5f8af-d27f-4efc-a55b-3e0e49cba8af","resolution":{"observed_at":"2026-08-05T15:45:46.484737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:46.268787Z","title":"Gandiva: Introspec- tive cluster scheduling for deep learning","venue":null,"work_id":"0740ea2b-c643-4116-9cc2-bfe8d980cb67","year":2018},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-08T02:10:39.123561Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:40.384815Z"},"links":{"citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:de366b24392a1f77a536e2ff5999f004359b1f8149d7188cd51223def4f5e848","observation_id":"628fb8ca-daed-443a-9c09-98c934c15340","resolution":{"observed_at":"2026-08-05T15:45:46.304737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:40.285526Z","title":"Skylb: A locality-aware cross-region load balancer for llm inference","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-08T02:10:39.123561Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:40.285526Z"},"links":{"citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:585872b6ff5d5d0c06196f7dd0a6ced936cd7b9ee7168550a002685b04cb77f8","observation_id":"8029a4fa-940d-4270-8a33-34a1f2fbeb3c","resolution":{"observed_at":"2026-08-05T15:45:40.285526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00128","last_updated":"2024-06-28T03:52:13Z","snapshot_observed_at":"2026-08-04T02:09:59.170120Z","submitted_at":"2024-06-28T03:52:13Z","title":"When Search Engine Services meet Large Language Models: Visions and Challenges","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00128","snapshot_observed_at":"2026-08-05T15:45:40.814751Z","title":"When search engine services meet large language models: Visions and challenges, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-08T02:10:39.123561Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:40.814751Z"},"links":{"cited_paper":"/paper/2407.00128","citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:94084985fd6bdbe3364a69ccf0dcc9c1bb824e9cab2866a39f7cc6712150cde8","observation_id":"a5ca7c4f-3319-459b-b0ad-2f5dae35a1e0","resolution":{"observed_at":"2026-08-05T15:45:40.814751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:46.084745Z","title":"{AntMan}: Dynamic scaling on {GPU} clusters for deep learning","venue":null,"work_id":"f1175d4b-0e24-4f30-a3b2-6c20891ae956","year":2020},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-08T02:10:39.123561Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:40.564835Z"},"links":{"citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:7e884c39f4b33d839ff1a4236e50058fd4fbd703492f5821dc4ebc3dba11bf07","observation_id":"5a26dc84-0566-465a-b261-d159407ac033","resolution":{"observed_at":"2026-08-05T15:45:46.134894Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:45.934900Z","title":"Orca: A distributed serving system for transformer-based generative models","venue":null,"work_id":"6e3b8985-3886-49d3-b6aa-6a3032290bfb","year":2022},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-08T02:10:39.123561Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:41.054848Z"},"links":{"citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:386f9995b8335b4ad9def4777c0d3428e6010ad698be3b5b5554dd71c5acd05e","observation_id":"9c1753c7-4196-4eef-8c5d-9605fafc83cf","resolution":{"observed_at":"2026-08-05T15:45:45.984742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-05T15:45:40.923132Z","title":"Qwen3 technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-08T02:10:39.123561Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:40.923132Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:c0ebe4aa453c7dc90d2a881c7230e33d974a0bcd08868ae221b306f22326a681","observation_id":"e003e517-1b64-4008-83bc-c1ef61bfa38c","resolution":{"observed_at":"2026-08-05T15:45:40.923132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:45.206435Z","title":"Sglang: Efficient execution of structured language model programs","venue":null,"work_id":"3d674710-0c8d-4c37-98ae-791e788814ef","year":2024},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-08T02:10:39.123561Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:41.445649Z"},"links":{"citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:3fcd812a717598ce9b21bc5d3050b81747df8c284212995d3c1f02794d52d7a6","observation_id":"a2226b0d-482c-40e2-9ff5-95ac47053a60","resolution":{"observed_at":"2026-08-05T15:45:45.334854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:45.795090Z","title":"Day zero benchmarks for qwen 3 with sglang on baseten","venue":null,"work_id":"dde960e0-d6bd-4f60-a801-3ba6c1f5aec0","year":null},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-08T02:10:39.123561Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:41.187832Z"},"links":{"citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:331b22acb0ec56c866610d9fbe86d5f22257bcc81cd4a4e56b2c63fef0eff01d","observation_id":"52c49da3-783b-4771-a9c6-28672a21f558","resolution":{"observed_at":"2026-08-05T15:45:45.832062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02263","last_updated":"2025-07-26T15:29:10Z","snapshot_observed_at":"2026-08-08T01:33:26.740871Z","submitted_at":"2025-04-03T04:20:44Z","title":"MegaScale-Infer: Serving Mixture-of-Experts at Scale with Disaggregated Expert Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.02263","snapshot_observed_at":"2026-08-05T15:45:41.645133Z","title":"Megascale- infer: Serving mixture-of-experts at scale with disaggregated expert parallelism","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-08T02:10:39.123561Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:41.645133Z"},"links":{"cited_paper":"/paper/2504.02263","citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:20beec0343159c0448ec51854dda7109880a823f37b92a285cbcbf2f81a73bcd","observation_id":"e999b7ab-399e-41ac-b2a2-49922ad45b24","resolution":{"observed_at":"2026-08-05T15:45:41.645133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:44.925668Z","title":"{DistServe}: Disaggregating prefill and decoding for goodput-optimized large language model serving","venue":null,"work_id":"1d371326-0772-4dc3-b533-a264e55c7957","year":2024},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-08T02:10:39.123561Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:41.584746Z"},"links":{"citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:592c72ddd9494dc06ca16de9dec047083fa675987883255b7bcfa778df49d8e6","observation_id":"05f34593-b95c-4dbd-bc11-7220b48a6446","resolution":{"observed_at":"2026-08-05T15:45:45.064755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:45.574763Z","title":null,"venue":null,"work_id":"150c71dc-6eaf-45a6-9760-5fbfb42f73f6","year":null},"citing_paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","snapshot_observed_at":"2026-08-08T02:10:39.123561Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:41.297650Z"},"links":{"citing_paper":"/paper/2508.19559"},"observation_digest":"sha256:41013cb080a18a70bc8789bb615707c18bea1fd419f7dd1550199ec0523754e9","observation_id":"7d6a797b-c5be-45c7-936a-a5d037fa6939","resolution":{"observed_at":"2026-08-05T15:45:45.694749Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.19559","last_updated":"2025-08-27T04:22:02Z","latest_version":1,"primary_category":"cs.DC","snapshot_observed_at":"2026-08-08T02:10:39.123561Z","submitted_at":"2025-08-27T04:22:02Z","title":"Taming the Chaos: Coordinated Autoscaling for Heterogeneous and Disaggregated LLM Inference"},"reference_resolution":{"displayed":60,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":22,"verified_exact":0,"verified_fuzzy":37},"total_outbound_references":60},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 60 of 60 outbound references and 2 inbound Pith citation observations for arXiv:2508.19559."}