{"as_of":"2026-08-07T10:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6564fdc7d4f8cc2349014e0068fe00ac463577d5ad380e78ab0fded35c2639e7","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T20:53:34.066002Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T16:55:38.764173Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-28T17:02:24.553672Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"cited_work":{"arxiv_id":"2509.08309","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.08309","snapshot_observed_at":"2026-06-28T17:02:24.553672Z","title":"Hetis: Serving LLMs in heterogeneous GPU clusters with fine-grained and dynamic parallelism","venue":null,"work_id":"6db5da0b-6198-4750-867a-778296c60994","year":2025},"citing_paper":{"arxiv_id":"2606.00946","last_updated":"2026-05-31T01:31:02Z","snapshot_observed_at":"2026-07-06T23:41:34.459700Z","submitted_at":"2026-05-31T01:31:02Z","title":"Lodestar: An Online-Learning LLM Inference Router","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-06-28T16:55:38.764173Z"},"links":{"cited_paper":"/paper/2509.08309","citing_paper":"/paper/2606.00946"},"observation_digest":"sha256:caf47fc2df267a2179eee2dffa79c99a8b8bb6131a1d44b2faa70577e5fff304","observation_id":"38e3bb4d-7a66-4493-afca-66643d3f92db","resolution":{"observed_at":"2026-06-28T17:02:24.555133Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2509.08309/citation-record","integrity":"/paper/2509.08309/integrity","json":"/paper/2509.08309/citation-record.json","paper":"/paper/2509.08309"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:53:37.704481Z","title":"NCCL: accelerated multi-GPU collective communication","venue":null,"work_id":"210e21f6-7157-4b08-8d0b-1a5c97815279","year":2023},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:30.541035Z"},"links":{"citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:5555f96529811d4c9f5db5d244688bca55b5c30b8e53554c9b1e64a532b60982","observation_id":"31875306-5efe-4012-9a2a-50618d5b531c","resolution":{"observed_at":"2026-08-04T20:53:37.756092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:53:37.626474Z","title":"ShareGPT","venue":null,"work_id":"f8640104-f3a6-4675-a4fe-f279f1041c62","year":2023},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:30.595124Z"},"links":{"citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:0856c0a6da61ce91b2a2808ce650bc4264afc55a1543191ecd06b04a0c2ffd61","observation_id":"314d7857-8f3c-45cc-8158-b5bf6eedde3a","resolution":{"observed_at":"2026-08-04T20:53:37.660572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-04T20:53:30.671849Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:30.671849Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:2c0fdc8f230bec6c6f688c4b042187492310108b790d0eb5079b2019714c9f28","observation_id":"41584052-a921-4839-8e82-d17e38fcea85","resolution":{"observed_at":"2026-08-04T20:53:30.671849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02310","last_updated":"2024-06-17T21:10:46Z","snapshot_observed_at":"2026-07-06T17:39:24.823145Z","submitted_at":"2024-03-04T18:47:08Z","title":"Taming Throughput-Latency Tradeoff in LLM Inference with Sarathi-Serve","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.02310","snapshot_observed_at":"2026-08-04T20:53:30.772845Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:30.772845Z"},"links":{"cited_paper":"/paper/2403.02310","citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:920e19f190fd32e79346ce83f4bfbed2240d84b1659fc303b99b6bb0cd208e0f","observation_id":"b80e34f7-c743-48f1-a56a-f98d807df92c","resolution":{"observed_at":"2026-08-04T20:53:30.772845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:53:37.530317Z","title":null,"venue":null,"work_id":"973a53ac-b544-4b27-ba8e-56f839a47bd9","year":2020},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:30.844502Z"},"links":{"citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:6e460d44ae27fecca0d952aa3379375429bbd29f8f3276bf378909c64b2ce6f2","observation_id":"1863aa73-3f8a-40b5-a13b-626c4eba2caa","resolution":{"observed_at":"2026-08-04T20:53:37.575686Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:53:37.418898Z","title":null,"venue":null,"work_id":"c050f97f-42e0-4ec5-ad6b-2ebe7c3242a4","year":2025},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:30.953102Z"},"links":{"citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:f48d1a99a43c676325e0e16185d77d6e46db85c432fea0136682cf8b199e0be8","observation_id":"fa23cd5c-5924-4ca4-9fa3-6bd67dbfc07b","resolution":{"observed_at":"2026-08-04T20:53:37.454601Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.14508","last_updated":"2024-06-19T04:00:32Z","snapshot_observed_at":"2026-08-02T11:20:36.216220Z","submitted_at":"2023-08-28T11:53:40Z","title":"LongBench: A Bilingual, Multitask Benchmark for Long Context Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.14508","snapshot_observed_at":"2026-08-04T20:53:31.024369Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:31.024369Z"},"links":{"cited_paper":"/paper/2308.14508","citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:283d7da38a3830a3fdaca21a65eb0f0652babe63f8bf3d88cf2f025d7e18e46a","observation_id":"8dd0b71f-7983-4b72-8380-9b0cc492b4ee","resolution":{"observed_at":"2026-08-04T20:53:31.024369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:53:31.063237Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:31.063237Z"},"links":{"citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:34aa8a6ec06882c153352663e8fc331521bb07600f578e9aa8390c5954e37868","observation_id":"ba04eae8-0604-4ca9-a88f-d4458ffd1816","resolution":{"observed_at":"2026-08-04T20:53:31.063237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:53:37.308121Z","title":null,"venue":null,"work_id":"75874a2f-4598-4804-8466-cdae17f6281c","year":2020},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:31.134404Z"},"links":{"citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:28ea936767f8b01a484f0f98545a523afbbf133099ed8ec365eb8989faba7717","observation_id":"5767af28-784d-4a6a-a5b7-0d5c36264212","resolution":{"observed_at":"2026-08-04T20:53:37.344324Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-04T20:53:31.189865Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:31.189865Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:cc2da7eaf9dbdb0b08806674ec614307f6f116f5c436492e095aa047028d39a1","observation_id":"51c3b14e-9f9a-4884-8d31-f9d5715d7568","resolution":{"observed_at":"2026-08-04T20:53:31.189865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:53:37.133841Z","title":null,"venue":null,"work_id":"643001d7-5f3b-46f4-9cf0-455851f40090","year":2021},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:31.258524Z"},"links":{"citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:2b3510deab71f1f195290bed5cbc75e9a54479c568b403f3ee74bca94c286b32","observation_id":"368ee591-7614-4a19-9f1b-ecba55b6c56c","resolution":{"observed_at":"2026-08-04T20:53:37.178582Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:53:37.054164Z","title":null,"venue":null,"work_id":"ebc0966f-9d83-4177-ad12-56fd43278b45","year":2021},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:31.342315Z"},"links":{"citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:491bd83a4305737ad61e82f465aaec57018b50628c59889d97f382d0ddc40765","observation_id":"c6c10d33-4c23-45a4-9b59-a668c1319ea9","resolution":{"observed_at":"2026-08-04T20:53:37.090093Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:53:31.403578Z","title":"Fu, Stefano Ermon, Atri Rudra, and Christopher Ré","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:31.403578Z"},"links":{"citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:de7f59e2b84ce2015459134e937eb647cf51258e4e9866ce5cfdd11348990ad8","observation_id":"d50ab370-f241-4da0-a763-77872ae9e7c8","resolution":{"observed_at":"2026-08-04T20:53:31.403578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:53:36.917346Z","title":null,"venue":null,"work_id":"6896f50d-12ec-49f5-88ee-286cea547474","year":2016},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:31.462940Z"},"links":{"citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:e36edb064944830d921a2ff341cca435defd8df000b9261537d107d37f497df1","observation_id":"7b65c049-19e5-40e2-be0c-6fe88f51a563","resolution":{"observed_at":"2026-08-04T20:53:36.961554Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:53:36.802555Z","title":null,"venue":null,"work_id":"6853aa23-1ded-4f31-bef6-71d7e7666005","year":null},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:31.542101Z"},"links":{"citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:be4d862e447afb2e0789178fc730ba1c3050902d3a94306b73f2f376e868f426","observation_id":"4b67af20-9e6e-4f06-b9d2-dfc50e67c675","resolution":{"observed_at":"2026-08-04T20:53:36.836867Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:53:36.732886Z","title":null,"venue":null,"work_id":"b40fbf65-19b9-4add-b25f-ffa317f1186e","year":1976},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:31.616944Z"},"links":{"citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:f2fed9cbd068c8bd4cb0dad754fff0f651268a6697f70fcaa513542ad1945a71","observation_id":"c6d2838c-0aa1-4ac1-a702-220978ae3875","resolution":{"observed_at":"2026-08-04T20:53:36.769021Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14527","last_updated":"2024-07-22T10:56:19Z","snapshot_observed_at":"2026-07-06T18:04:00.217896Z","submitted_at":"2024-04-22T18:56:18Z","title":"M\\'elange: Cost Efficient Large Language Model Serving by Exploiting GPU Heterogeneity","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14527","snapshot_observed_at":"2026-08-04T20:53:31.694454Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:31.694454Z"},"links":{"cited_paper":"/paper/2404.14527","citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:011d481bec29469174707c5856e463ba512aee5c61d5c0c57fa97a9fde169090","observation_id":"8e3d6901-d154-496e-8359-f7975f57057b","resolution":{"observed_at":"2026-08-04T20:53:31.694454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:53:36.585596Z","title":null,"venue":null,"work_id":"3f2f74f0-4afc-4c98-ac8f-19c34bc93da6","year":2020},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:31.733099Z"},"links":{"citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:2a52dedf7dd1a10df548ff71045c4f655ec7cd4a8bf382f2cb0c2faa6bc20476","observation_id":"fb76c67a-a3bd-4a00-8f44-7e60074990db","resolution":{"observed_at":"2026-08-04T20:53:36.667598Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11421","last_updated":"2024-03-18T02:30:23Z","snapshot_observed_at":"2026-08-06T20:15:05.193939Z","submitted_at":"2024-03-18T02:30:23Z","title":"FastDecode: High-Throughput GPU-Efficient LLM Serving using Heterogeneous Pipelines","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11421","snapshot_observed_at":"2026-08-04T20:53:31.847951Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:31.847951Z"},"links":{"cited_paper":"/paper/2403.11421","citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:cde397d52a9e1bbc676f88eed4c66750967f91a92a8667f3e6f23aadd4c5ee82","observation_id":"3e8225a2-deb0-4c9f-b07a-c421677e2b82","resolution":{"observed_at":"2026-08-04T20:53:31.847951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.11181","last_updated":"2024-01-20T09:43:36Z","snapshot_observed_at":"2026-08-05T23:35:16.350557Z","submitted_at":"2024-01-20T09:43:36Z","title":"Inference without Interference: Disaggregate LLM Inference for Mixed Downstream Workloads","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.11181","snapshot_observed_at":"2026-08-04T20:53:31.939770Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:31.939770Z"},"links":{"cited_paper":"/paper/2401.11181","citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:d8faae2b5e54bcf98c94400ab1378346a8af24421c411e19b89bca4962fc815a","observation_id":"1f96ef1a-0a70-4f5b-96ed-3cd4aff33490","resolution":{"observed_at":"2026-08-04T20:53:31.939770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:53:36.381002Z","title":null,"venue":null,"work_id":"575fbde6-f373-4556-921f-08be92240970","year":2023},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:31.975896Z"},"links":{"citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:df8fb31874b508594c52c1096ab962b9666abeb3e626cee05837b4db7207939e","observation_id":"4b0a3e99-b266-44b6-a4a1-79e02060586d","resolution":{"observed_at":"2026-08-04T20:53:36.463932Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:53:36.266964Z","title":null,"venue":null,"work_id":"c8937928-c41f-4449-be68-7b6825ef7e60","year":2022},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:32.027110Z"},"links":{"citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:f46955a9b3cbed40dd50940dee8e3c0963a023cb3e96cf36b6a86678af490d9b","observation_id":"5e9d1c0e-bfc9-4061-9951-c827e77c27b1","resolution":{"observed_at":"2026-08-04T20:53:36.298639Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:53:36.169626Z","title":null,"venue":null,"work_id":"c983f575-4531-40ef-a086-b42d5a3709f5","year":null},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:32.088532Z"},"links":{"citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:b83b9caf0f82150c0135f6a92a3275ff0a0a3d80bfcdb996ca7cd80d6e893646","observation_id":"3d92674d-fe92-4eb4-b448-ce72ff3e2b20","resolution":{"observed_at":"2026-08-04T20:53:36.224438Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-04T20:53:32.137323Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:32.137323Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:c32515ca9fe16efc9ffb0e89abacb219f8d5e3af58c6488c7cf1856d6438e58d","observation_id":"b686db21-843e-411f-8a6c-c8487b734e0e","resolution":{"observed_at":"2026-08-04T20:53:32.137323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:53:32.178971Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:32.178971Z"},"links":{"citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:27fe879ff7068f5dc1adc12c4ebefa9c1138218beb0e6a2ca8aecff5e1719d78","observation_id":"6fb39267-e2b4-4deb-90a5-527f58a0a076","resolution":{"observed_at":"2026-08-04T20:53:32.178971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:53:35.850179Z","title":null,"venue":null,"work_id":"270cfe2f-85e1-4674-9f0b-16d9d6117e8a","year":2020},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:32.267712Z"},"links":{"citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:fb6bef0fed0f188cbce4fb35550b2350e874326acf15eda86ebfa378186387a7","observation_id":"23e4405d-4b2d-428c-968d-51f0a60d82f1","resolution":{"observed_at":"2026-08-04T20:53:35.915257Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:53:35.774643Z","title":null,"venue":null,"work_id":"090e0272-a756-49bc-a9b0-2c9c5a82f4a6","year":2023},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:32.322858Z"},"links":{"citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:caeb26caf34c2928eb120e67b401335d3e5a4906bb9dea1d1078ae92a4aa08ad","observation_id":"da68e34e-dd69-442d-80c7-d32975ea42b2","resolution":{"observed_at":"2026-08-04T20:53:35.813704Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02669","last_updated":"2024-07-04T15:12:54Z","snapshot_observed_at":"2026-07-06T17:11:55.112404Z","submitted_at":"2024-01-05T06:53:00Z","title":"Infinite-LLM: Efficient LLM Service for Long Context with DistAttention and Distributed KVCache","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02669","snapshot_observed_at":"2026-08-04T20:53:32.388187Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:32.388187Z"},"links":{"cited_paper":"/paper/2401.02669","citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:5cac9b5231fb3d1c8cbaa6529fe27c5ed6424a88acf78be01b0440c90709e2b8","observation_id":"9bb1337b-8b54-4029-a2da-6816ad942ff8","resolution":{"observed_at":"2026-08-04T20:53:32.388187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:53:35.683677Z","title":null,"venue":null,"work_id":"1ad3e7c4-19b9-4730-858b-241d023aee3d","year":2023},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:32.491483Z"},"links":{"citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:6627f7e56f4ac7300e5a8b12fde70f561a6fe8709ec8dcf8803d861a417a86a6","observation_id":"976d2ac0-de8a-4365-a28a-009492e9e362","resolution":{"observed_at":"2026-08-04T20:53:35.726862Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15566","last_updated":"2023-11-27T06:31:17Z","snapshot_observed_at":"2026-07-06T16:52:53.954856Z","submitted_at":"2023-11-27T06:31:17Z","title":"SpotServe: Serving Generative Large Language Models on Preemptible Instances","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15566","snapshot_observed_at":"2026-08-04T20:53:32.528246Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:32.528246Z"},"links":{"cited_paper":"/paper/2311.15566","citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:cd14eef4e67727cbbc19ba57c8975be1075ec16f6059e5d0a6e78ed62ac17216","observation_id":"3dff3f13-9541-48f8-b411-ba022122b361","resolution":{"observed_at":"2026-08-04T20:53:32.528246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:53:35.573792Z","title":null,"venue":null,"work_id":"a09d78f6-c065-4500-b2e0-cba2ec580a1e","year":2024},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:32.597113Z"},"links":{"citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:cf480f94c020a355ab5e666afa2ac2394877a6858ffef4d78aec879e872927b8","observation_id":"4bf2362f-a818-490f-a10b-8b59998f0b5c","resolution":{"observed_at":"2026-08-04T20:53:35.608634Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:53:35.478693Z","title":null,"venue":null,"work_id":"0a141b13-3d55-4eb0-b557-b34a51f2161c","year":2025},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:32.674293Z"},"links":{"citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:37d5520f85f025be8b63c341bd3020b82d2237c5f430608edd5f03a769d79692","observation_id":"b9e7bb2d-d007-4a9f-8803-2415067f8a44","resolution":{"observed_at":"2026-08-04T20:53:35.508255Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:53:35.383957Z","title":null,"venue":null,"work_id":"4a30a81c-7c8b-4855-9003-170578df0e70","year":2024},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:32.700047Z"},"links":{"citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:fb98252d75a547b9441490ebc7c2919224d4bd80878e569881edc86248196bd2","observation_id":"5a22e5ab-74df-420a-a350-74313159d58f","resolution":{"observed_at":"2026-08-04T20:53:35.431599Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:53:35.214956Z","title":null,"venue":null,"work_id":"1853a1a7-a929-4b83-b445-c249ee880f6c","year":2020},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:32.817436Z"},"links":{"citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:4c3487acd407b07187ebea92dca3e6be3574512a5e9adf3dc9b91724b18818b1","observation_id":"f6ef0f0f-0b2e-43ee-a0be-3d6b451b1c9f","resolution":{"observed_at":"2026-08-04T20:53:35.276426Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:53:32.888698Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:32.888698Z"},"links":{"citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:a1f6ed169244751f2999feed24661990eff47ef01288330863f371ccad1fc8e9","observation_id":"2c772b5a-3f88-47a7-a971-2b7825104d01","resolution":{"observed_at":"2026-08-04T20:53:32.888698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:53:32.916183Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:32.916183Z"},"links":{"citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:50afba12d88860d505b288335b74b602a764753abf975e10c5636e59219bb6f4","observation_id":"329816e1-9715-4379-9556-2f2cbb18c181","resolution":{"observed_at":"2026-08-04T20:53:32.916183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:53:35.092886Z","title":null,"venue":null,"work_id":"033fefe1-863d-4292-9547-66abf12ceb45","year":2014},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:32.957225Z"},"links":{"citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:f9baadb748d97b415a965e9f9383fd566b51a62b88c8afb3b28f84bb8e587b7d","observation_id":"ac292109-23c6-468f-81f4-1390387279a7","resolution":{"observed_at":"2026-08-04T20:53:35.140565Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:53:35.022518Z","title":null,"venue":null,"work_id":"602b2f3b-4079-40a4-9592-ed797b0e08b4","year":2019},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:32.977810Z"},"links":{"citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:4216305a1bc6baf8df31fe6400224d9821eafe4bf266dfe4db6a8a5b7b6f97a5","observation_id":"ddbbc322-4944-47ae-b67a-0857d2d3be03","resolution":{"observed_at":"2026-08-04T20:53:35.058157Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:53:33.021674Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:33.021674Z"},"links":{"citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:0a6ddda825525eaeef82e14ea7e140088674caa563f3264fe102e2ef3abd0217","observation_id":"6095cc65-e929-4bb1-b1df-77ddac29c952","resolution":{"observed_at":"2026-08-04T20:53:33.021674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-04T20:53:33.067355Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:33.067355Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:38adc58e347c17931cfbe66196689e5415738fd62cc347221e4d7166605772d9","observation_id":"dbb5ef4c-8faa-46a7-8869-978d9decfa69","resolution":{"observed_at":"2026-08-04T20:53:33.067355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-02T11:57:18.735747Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-04T20:53:33.187123Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:33.187123Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:a0fbd8cf6cf7eb4d7c56d93527ca139454542556d8c095303604ef548721633a","observation_id":"d986cac6-56e8-4fa6-8c8c-03a1c64b43e9","resolution":{"observed_at":"2026-08-04T20:53:33.187123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:53:34.856866Z","title":null,"venue":null,"work_id":"1853b63e-dd33-4ecf-9278-561c22c159a6","year":2024},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:33.254465Z"},"links":{"citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:df6d21ad4b9735601e725b716aa82cfebe3e1086213903bcafd8fb1944dcdb75","observation_id":"df5b6a15-9425-4f83-8a43-786069b96793","resolution":{"observed_at":"2026-08-04T20:53:34.914683Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:53:33.343697Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:33.343697Z"},"links":{"citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:ca529f57f8d1247822e021f4e84c22b1d0a83622c6812bc8db22cd0196acc19c","observation_id":"666ffacb-090f-433a-a9cd-74d0f8055985","resolution":{"observed_at":"2026-08-04T20:53:33.343697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.17644","last_updated":"2025-05-26T16:16:43Z","snapshot_observed_at":"2026-08-06T05:24:39.144385Z","submitted_at":"2024-01-31T07:52:48Z","title":"BurstGPT: A Real-world Workload Dataset to Optimize LLM Serving Systems","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.17644","snapshot_observed_at":"2026-08-04T20:53:33.420816Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:33.420816Z"},"links":{"cited_paper":"/paper/2401.17644","citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:33aab6ee36947e50a9f239ea0759872bebe3edec92a44437da8ff3f0a9fbf0b2","observation_id":"cf06d08f-ec08-47af-8b66-4e8f0b46a461","resolution":{"observed_at":"2026-08-04T20:53:33.420816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:53:34.772807Z","title":null,"venue":null,"work_id":"be2b98ec-0c47-4c31-a99f-4ea50fe71ef2","year":2022},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:33.499490Z"},"links":{"citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:0cad8609359a689668bbdce480dfaa4047c3659cbcf4403d0ce103871f11ddad","observation_id":"b93ecd0e-6ae3-406e-b1c5-8e65fcc55fc2","resolution":{"observed_at":"2026-08-04T20:53:34.803025Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:53:34.689363Z","title":null,"venue":null,"work_id":"243c7ba7-4e76-471c-b301-1cc6b6a0fe2f","year":2019},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:33.639354Z"},"links":{"citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:54a58b263a523d28c4e1c242b41276785614ce7cc7cfe15fd2d0e023b7b2769a","observation_id":"21f0cf2c-fd3a-40a0-8285-e4ed8df6999f","resolution":{"observed_at":"2026-08-04T20:53:34.730050Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:53:34.593086Z","title":null,"venue":null,"work_id":"b57d2766-2d3b-4660-a206-baf7c6221de8","year":2023},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:33.771263Z"},"links":{"citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:5da458e2027e5ca8e6237c6f80975fe4d1edca2b478877e3fd933a0a9d902de3","observation_id":"ec765750-2bd0-4111-9c42-1b624fd7f144","resolution":{"observed_at":"2026-08-04T20:53:34.626700Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:53:34.469265Z","title":null,"venue":null,"work_id":"0389b603-2aad-4fbc-a0b8-3ce2194d97db","year":null},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:33.845686Z"},"links":{"citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:642c47512ff2b9e19c038e2198fcc7d0ce84dbcf49547e66532a674dfe798bda","observation_id":"c083b2f6-9138-4ff6-bfc9-eaafe3d262fc","resolution":{"observed_at":"2026-08-04T20:53:34.505073Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-08-04T20:53:34.002850Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:34.002850Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:6f98f0b093f28b2ae0dd0119b647f55aab78bad8a06ec55b4536a6cac60fdca4","observation_id":"12c864f5-7e26-470e-a535-741ec6502ec5","resolution":{"observed_at":"2026-08-04T20:53:34.002850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:53:34.356530Z","title":"InProceedings of the Nineteenth European Conference on Computer Systems","venue":null,"work_id":"d53ca48d-2a72-49ba-932c-8cd668af2c2b","year":2025},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:33.927177Z"},"links":{"citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:ed1bed208f67ce0db3a4608d9564bd78b0fb1eadc3843d36e9c9ba44164eb57a","observation_id":"6f810480-b13f-4aa8-a392-a9be854e583b","resolution":{"observed_at":"2026-08-04T20:53:34.396862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09670","last_updated":"2024-06-06T15:50:51Z","snapshot_observed_at":"2026-08-05T00:28:57.370523Z","submitted_at":"2024-01-18T01:03:38Z","title":"DistServe: Disaggregating Prefill and Decoding for Goodput-optimized Large Language Model Serving","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.09670","snapshot_observed_at":"2026-08-04T20:53:34.066002Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:34.066002Z"},"links":{"cited_paper":"/paper/2401.09670","citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:2a0f8d623bc3ca13dc478769808b454336d79010c188deed7d0c9e207dd2cd9d","observation_id":"9192a142-3d6c-4fce-86d3-d76f90c84f91","resolution":{"observed_at":"2026-08-04T20:53:34.066002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.01136","last_updated":"2024-03-02T08:40:07Z","snapshot_observed_at":"2026-08-05T08:03:09.194343Z","submitted_at":"2024-03-02T08:40:07Z","title":"LLM-PQ: Serving LLM on Heterogeneous Clusters with Phase-Aware Partition and Adaptive Quantization","version":1},"cited_work":{"arxiv_id":"2403.01136","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.01136","snapshot_observed_at":"2026-08-04T20:53:34.132831Z","title":"LLM-PQ: Serving LLM on Heterogeneous Clusters with Phase-Aware Partition and Adaptive Quantization","venue":"cs.LG","work_id":"3f57085b-02d8-4add-850e-1b10c72bc15d","year":2024},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:34.032926Z"},"links":{"cited_paper":"/paper/2403.01136","citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:4a421f62b415e875e5883420bacdd1f98ede0a535cc5d1826c21c770ae7b1caa","observation_id":"1348a3f9-69bb-46ae-9f58-35a695b08b7d","resolution":{"observed_at":"2026-08-04T20:53:34.170416Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:53:36.049543Z","title":"InForty-first International Conference on Machine Learning","venue":null,"work_id":"dee59275-fd31-4121-8355-fcee3fcc9b2c","year":null},"citing_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-04T20:53:32.113597Z"},"links":{"citing_paper":"/paper/2509.08309"},"observation_digest":"sha256:8ea984f5d4513bec6cce475d3dd9ada21f8ef435f7b6e1663123828443bf388d","observation_id":"08cad4e3-d216-4e00-b78e-5da19ee5768e","resolution":{"observed_at":"2026-08-04T20:53:36.130334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","latest_version":1,"primary_category":"cs.DC","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":48,"verified_exact":1,"verified_fuzzy":4},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 1 inbound Pith citation observation for arXiv:2509.08309."}