{"as_of":"2026-08-04T09:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:92e893155cfc2a586be749120661a345a5394b5612171df47cbf80cc0c70eb44","coverage":[{"denominator":59,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T14:08:03.850772Z","state":"measured"},{"denominator":59,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":59,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.18253/citation-record","integrity":"/paper/2607.18253/integrity","json":"/paper/2607.18253/citation-record.json","paper":"/paper/2607.18253"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:07:57.586536Z","title":"Gulavani, Ramachan- dran Ramjee, and Alexey Tumanov","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-04T04:27:45.677236Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T14:07:57.586536Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:5bde08faa2f8e4cd37edd35f1dbb954e68a10412a74c97c1550c7520b60d7ab4","observation_id":"94c272d0-7507-4284-b9b4-a1a0799f5355","resolution":{"observed_at":"2026-08-02T14:07:57.586536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:07:57.664635Z","title":"Gulavani, Alexey Tumanov, and Ramachandran Ramjee","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-04T04:27:45.677236Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T14:07:57.664635Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:1a5d95d30b7f7542daab1fe5dce72fb1a2e5c39e07857cce96ed165d95eda901","observation_id":"9d553330-0b46-45dc-ae72-9ee05ce21503","resolution":{"observed_at":"2026-08-02T14:07:57.664635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:07:57.765184Z","title":"Alibaba cloud model studio: Model invocation pricing, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-04T04:27:45.677236Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T14:07:57.765184Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:9a0bb5bbc1b25e5a3d2d11ee5d76e703f8347e903ec420e6b716044851878c43","observation_id":"e50a210a-996c-4ce1-a368-50be045c6bfd","resolution":{"observed_at":"2026-08-02T14:07:57.765184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:07:57.847003Z","title":"Federate the router: Learning language model routers with sparse and decentralized evaluations, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-04T04:27:45.677236Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T14:07:57.847003Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:acf404f17de4af66eed3e3feaede2e5432621a75d6596793d2b4ca57f1a82777","observation_id":"1988d571-12fe-4f7b-ab32-c461e4bb4995","resolution":{"observed_at":"2026-08-02T14:07:57.847003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:07:58.016742Z","title":"Optimal scheduling algorithms for llm inference: Theory and practice.Proc","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-04T04:27:45.677236Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T14:07:58.016742Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:4f4c2fae49abee988f4449bace853c6a09b92280b1f1beafb2e5fd168302221e","observation_id":"9eb0e72a-3a9d-4516-ab25-f964eaa85f0f","resolution":{"observed_at":"2026-08-02T14:07:58.016742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:07:58.127113Z","title":"Boerner, Stephen Deems, Thomas R","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-04T04:27:45.677236Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T14:07:58.127113Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:fba33cc3719aeca63a37b173206632c46aa48b5c1051a2d68f39e20b29fd75e4","observation_id":"2882e4c1-6b2d-4506-a53c-8b8f629b6bf4","resolution":{"observed_at":"2026-08-02T14:07:58.127113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:07:58.214930Z","title":"Learning compact representations of llm abilities via item response theory, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-04T04:27:45.677236Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T14:07:58.214930Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:e3c26a613465dbe416d7124779c4147f2fd2fb60cd96a3c09a6af2df781dc6a2","observation_id":"67cb3181-0b62-4b1a-a1b9-ac0a076d55d0","resolution":{"observed_at":"2026-08-02T14:07:58.214930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:07:58.301940Z","title":"Frugalgpt: How to use large language models while reducing cost and improving performance.Transactions on Machine Learning Research, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-04T04:27:45.677236Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T14:07:58.301940Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:825e3fc17ed285f046304ddc61c821e8fd6b88235134c4a9a34bd1d759435e6c","observation_id":"337d635a-df40-4270-a9dc-06f8fabde3ef","resolution":{"observed_at":"2026-08-02T14:07:58.301940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.03611","last_updated":"2025-08-13T17:17:46Z","snapshot_observed_at":"2026-07-06T22:08:12.433302Z","submitted_at":"2025-08-05T16:27:10Z","title":"Block: Balancing Load in LLM Serving with Context, Knowledge and Predictive Scheduling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.03611","snapshot_observed_at":"2026-08-02T14:07:58.436874Z","title":"Block: Balancing load in llm serving with context, knowledge and predictive scheduling, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-04T04:27:45.677236Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T14:07:58.436874Z"},"links":{"cited_paper":"/paper/2508.03611","citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:8cd890f24d27502c113f852d1e624c5b07da4df2545e535935bdce7ee6b2097e","observation_id":"53536e45-15f4-417e-937b-f5844c40d498","resolution":{"observed_at":"2026-08-02T14:07:58.436874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:07:58.544887Z","title":"A unified approach to routing and cascading for LLMs","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-04T04:27:45.677236Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T14:07:58.544887Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:3aebe2493f0c85e78e1c64fd04107e8b29d9c083a7933e15cd5e44d8df79eaa6","observation_id":"ee889630-be2c-4c54-ab3f-9c2fd95a559b","resolution":{"observed_at":"2026-08-02T14:07:58.544887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:07:58.722462Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-04T04:27:45.677236Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T14:07:58.722462Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:f6000766c3a03f2103cb660d72150cf140e6c8e74bf1d7d0a5605470a18c8844","observation_id":"ea5db281-1b53-4154-9325-4490bbd4262a","resolution":{"observed_at":"2026-08-02T14:07:58.722462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:07:58.839066Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-04T04:27:45.677236Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T14:07:58.839066Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:be6e4c2d027a8c761a88ba0d5360886500df09c317e4dd7b4504f358f02b5c81","observation_id":"ba790edc-b622-499e-9cac-c33e551b1ba9","resolution":{"observed_at":"2026-08-02T14:07:58.839066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:07:58.952345Z","title":"Hierarchical neural story generation","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-04T04:27:45.677236Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T14:07:58.952345Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:239b9aef4ac1025f1ad1255acd1bf4bc7ae851c87531e896439b03bd5015e3d3","observation_id":"1427b21b-0e0a-4210-84ac-28623b2307ab","resolution":{"observed_at":"2026-08-02T14:07:58.952345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:07:59.046008Z","title":"The markov-modulated poisson process (mmpp) cookbook","venue":null,"work_id":null,"year":1993},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-04T04:27:45.677236Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T14:07:59.046008Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:bd7118c39e8981b2f072638f9e9b4397938bdfb5a97e04c7a97a31d5e1f3848b","observation_id":"691c541f-f017-4fdf-a61d-6d2781a0ecbc","resolution":{"observed_at":"2026-08-02T14:07:59.046008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:07:59.175611Z","title":"Efficient LLM scheduling by learning to rank","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-04T04:27:45.677236Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T14:07:59.175611Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:7423ffabc2f0cf01778d2bc2271e441a3d692d8c8bb005eea4e23613053c48c1","observation_id":"dd117b2c-c564-4712-be53-68089e231555","resolution":{"observed_at":"2026-08-02T14:07:59.175611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-02T14:07:59.294487Z","title":"Gemini: A family of highly capable multimodal models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-04T04:27:45.677236Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T14:07:59.294487Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:7b0609b836274450622fc479324fb8ba29027051242f67d08e3a0cea97d5a3af","observation_id":"c847f8e6-7bb2-40c9-b76c-0e84965261b6","resolution":{"observed_at":"2026-08-02T14:07:59.294487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:07:59.382553Z","title":"Past-future scheduler for llm serving under sla guarantees","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-04T04:27:45.677236Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T14:07:59.382553Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:741c6756d1ea415883bee259932559384bcaae4b122ed6f7821218c892fd9f8a","observation_id":"c323f8ff-94e5-47e9-ac67-271631dbec0d","resolution":{"observed_at":"2026-08-02T14:07:59.382553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:07:59.462587Z","title":"Li, and Richard Socher","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-04T04:27:45.677236Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T14:07:59.462587Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:42a7cf39d04b8be6677db498b2c79d860a26445d881ae77ba8cafe989a2bf8b8","observation_id":"7c3ddefb-1ac5-4aaa-a9b2-35192348b966","resolution":{"observed_at":"2026-08-02T14:07:59.462587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:07:59.542939Z","title":"Routerbench: A benchmark for multi-LLM routing system","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-04T04:27:45.677236Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T14:07:59.542939Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:54a3764897b08384cd0246328bd816fc27c68f6d971f0731a275881658772512","observation_id":"26770c53-fb4b-4c55-86ba-cfa95541c43a","resolution":{"observed_at":"2026-08-02T14:07:59.542939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14966","last_updated":"2025-06-12T01:39:50Z","snapshot_observed_at":"2026-07-06T21:12:28.608235Z","submitted_at":"2025-04-21T08:48:48Z","title":"SLO-Aware Scheduling for Large Language Model Inferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.14966","snapshot_observed_at":"2026-08-02T14:07:59.627222Z","title":"Slo-aware scheduling for large language model inferences, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-04T04:27:45.677236Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T14:07:59.627222Z"},"links":{"cited_paper":"/paper/2504.14966","citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:ee998231e678f259922d0d304ef06a123dd98d3fc3d2951a816d603f66416f62","observation_id":"03f5a96c-5519-45f6-9c5f-917449ee6274","resolution":{"observed_at":"2026-08-02T14:07:59.627222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:07:59.709780Z","title":"Efficient attentions for long document summarization","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-04T04:27:45.677236Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T14:07:59.709780Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:9d1b6757ad409039cd4be54c7e4f3f2df49abaddd99d81ef0e9b6944e93a053d","observation_id":"d3948040-18a7-42c1-8505-f1f0860984a3","resolution":{"observed_at":"2026-08-02T14:07:59.709780Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:07:59.792244Z","title":"Predicting llm inference latency: A roofline-driven ml method","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-04T04:27:45.677236Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T14:07:59.792244Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:766abd27d9fec43096abc6e79b19762ffcabff2e35a285ae67029b8af27e6e33","observation_id":"e6231b84-e9a5-44f9-a2bb-bab933f79809","resolution":{"observed_at":"2026-08-02T14:07:59.792244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:07:59.951925Z","title":"Universal model routing for efficient LLM inference","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-04T04:27:45.677236Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T14:07:59.951925Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:1f0f02b5f39edb984c339bd5dc580496b34db700ee9c73045d94fc0b8ba4673a","observation_id":"9c32df46-bcf5-4941-8ca6-0959b5d8e5d5","resolution":{"observed_at":"2026-08-02T14:07:59.951925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:08:00.010405Z","title":"Lightgbm: A highly efficient gradient boosting decision tree","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-04T04:27:45.677236Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T14:08:00.010405Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:d1b90236a3696042f89dfd2042575b3b540847d62c6f68a388935956e5f97f4c","observation_id":"99f356c4-6c66-46a0-b2a0-6dd908d90882","resolution":{"observed_at":"2026-08-02T14:08:00.010405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:08:00.095071Z","title":"Efficient memory management for large language model serving with pagedattention","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-04T04:27:45.677236Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T14:08:00.095071Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:f45a9a50cd41fb29908af40c418053e487a8a47980d763861d959db11aa43d2a","observation_id":"f6e95019-0927-4f7a-b511-8c979f44582d","resolution":{"observed_at":"2026-08-02T14:08:00.095071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:08:00.184734Z","title":"Faster, cheaper, just as good: Cost- and latency constrained routing for llms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-04T04:27:45.677236Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T14:08:00.184734Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:ce2da555c9e44f91de799ee8660cf37f5ffe1a4d2493363005097ae88734e088","observation_id":"6f602431-65bb-43a2-96db-3f7d7097cbc2","resolution":{"observed_at":"2026-08-02T14:08:00.184734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:08:00.264011Z","title":"Deterministic non-autoregressive neural sequence modeling by iterative refinement","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-04T04:27:45.677236Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T14:08:00.264011Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:f7ff25b688f3036165b7bd4d8b2b22e1c35fbb9b85e4b40ffa35b011aa9f0a56","observation_id":"764717b5-0207-464d-a481-3ab4dfb704b5","resolution":{"observed_at":"2026-08-02T14:08:00.264011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:08:00.349711Z","title":"Fromgenerationtojudgment: Oppor- tunities and challenges of LLM-as-a-judge","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-04T04:27:45.677236Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T14:08:00.349711Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:fae345dbb74d5ef26962381fac30487d88bc5bf97f8969d9bbbe68feee205d9a","observation_id":"9d90e6cd-18dc-4871-ad47-07d53163657f","resolution":{"observed_at":"2026-08-02T14:08:00.349711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:08:00.435794Z","title":"Diffusion-LM improves controllable text generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-04T04:27:45.677236Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T14:08:00.435794Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:f1c465fd4e075218eab0eaf725f2f27b126c1f5e806e1a3861f38bd53db813e8","observation_id":"eb4577bd-b575-4dae-b524-4eb83a24fdc2","resolution":{"observed_at":"2026-08-02T14:08:00.435794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:08:00.512272Z","title":"Throughput-optimal scheduling algorithms for llm inference and ai agents,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-04T04:27:45.677236Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T14:08:00.512272Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:ed1337c6d237dd6e3e8e469998e8a405341e41bb1a313a2913065108223fdb50","observation_id":"5f5cfe90-3d48-48e0-8a55-7f22b2c44131","resolution":{"observed_at":"2026-08-02T14:08:00.512272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:08:00.736056Z","title":"ROUGE: A package for automatic evaluation of summaries","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-04T04:27:45.677236Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T14:08:00.736056Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:5eaead24039716f71ce58eaf0cba5320077867a8088907675c4b23d4c89b1734","observation_id":"f20963aa-b673-40bb-b283-be782f28f27f","resolution":{"observed_at":"2026-08-02T14:08:00.736056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07545","last_updated":"2025-03-10T17:12:47Z","snapshot_observed_at":"2026-07-06T20:50:05.070886Z","submitted_at":"2025-03-10T17:12:47Z","title":"Queueing, Predictions, and LLMs: Challenges and Open Problems","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07545","snapshot_observed_at":"2026-08-02T14:08:00.817791Z","title":"Queueing, predictions, and llms: Challenges and open problems, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-04T04:27:45.677236Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T14:08:00.817791Z"},"links":{"cited_paper":"/paper/2503.07545","citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:b1a209093975f38c8d9f8aaba67950550a01f3ad79c2e29f4141f1bf94ca5190","observation_id":"b1a212d1-eb34-4a51-8ea6-a0bb161ed5b6","resolution":{"observed_at":"2026-08-02T14:08:00.817791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:08:00.901084Z","title":"Deferred prefill for throughput maximization in llm inference","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-04T04:27:45.677236Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T14:08:00.901084Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:dc95646c71932baf48544cafe5f38ae57d7b6b2419862b497d2612fdbd8f3915","observation_id":"6903b784-b2cf-416b-b325-7ff3bb088384","resolution":{"observed_at":"2026-08-02T14:08:00.901084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:08:00.978274Z","title":"Nvidia h100 pcie gpu — product brief","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-04T04:27:45.677236Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T14:08:00.978274Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:be2479c083ea797342eca93e18a88254e58adcb2ba7f6ee98afed0c245492893","observation_id":"a693ce8b-4157-41f5-a9e0-2ba4dba9d6ca","resolution":{"observed_at":"2026-08-02T14:08:00.978274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:08:01.058602Z","title":"Gonzalez, M Waleed Kadous, and Ion Stoica","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-04T04:27:45.677236Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T14:08:01.058602Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:f8cca6e9fab3019f874c06322a3218a83108216ef1a117904a10e6369d0c0b18","observation_id":"1a93cffa-6aa5-4d34-a6cb-474202ae568c","resolution":{"observed_at":"2026-08-02T14:08:01.058602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:08:01.126930Z","title":"Proxrouter: Proximity-weighted llm query routing for improved robustness to outliers, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-04T04:27:45.677236Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T14:08:01.126930Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:a660baf996f757ea71ed14b477912a19737e094e0b2324abf590d298e00dca71","observation_id":"0f701194-cf7e-4204-ad78-c3bb7a650135","resolution":{"observed_at":"2026-08-02T14:08:01.126930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:08:01.212956Z","title":"Locus: Low-dimensional model embeddings for efficient model exploration, comparison, and selection, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-04T04:27:45.677236Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T14:08:01.212956Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:d870a7d983903a2ccfd9db92cf38a5cad2f4cdbb407c0a82746052d93470d353","observation_id":"cab66dec-5dd7-49ed-90a2-d0afedfaaf6c","resolution":{"observed_at":"2026-08-02T14:08:01.212956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:08:01.324988Z","title":"Queue management for slo-oriented large language model serving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-04T04:27:45.677236Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T14:08:01.324988Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:1ea47d29996db46a8641e2b07633487e0509ea9e807f5824e1e521f002a7b696","observation_id":"b10aa5f2-416a-42e3-b7e6-8d3c79555296","resolution":{"observed_at":"2026-08-02T14:08:01.324988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:08:01.577296Z","title":"Efficiently scaling transformer inference","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-04T04:27:45.677236Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T14:08:01.577296Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:d036037e048bf5ff8220c45f629b424ffaf281b6d15887e6093317c5f6fd8b87","observation_id":"a0cc7d53-d048-4ecf-a8c3-fc982818a9df","resolution":{"observed_at":"2026-08-02T14:08:01.577296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:08:01.708519Z","title":"Kalbarczyk, Tamer Başar, and Ravishankar K","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-04T04:27:45.677236Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T14:08:01.708519Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:6a7b2679b2f7fe0b1c9281ef055c2180325d510e3cfdd5b7cdfe922338c1cbed","observation_id":"40f7be56-8d81-42b3-9471-bc6ae3e318cb","resolution":{"observed_at":"2026-08-02T14:08:01.708519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-02T14:08:01.830316Z","title":"Qwen3 technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-04T04:27:45.677236Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T14:08:01.830316Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:dc5448397e471951681dd38d253c340fcf01cbae7c17cf06a82c15d627539bf1","observation_id":"02f6e61f-ed56-4469-83b8-2b901c125e57","resolution":{"observed_at":"2026-08-02T14:08:01.830316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:08:01.966203Z","title":"Don’t stop me now: Embedding based scheduling for llms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-04T04:27:45.677236Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T14:08:01.966203Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:1ad1b555365abe52f8adf03e9d30d9c7dcc72f06cd8051d951d964e61f06cbfe","observation_id":"f665b1b4-7509-415f-ace1-b0c105c6e4e8","resolution":{"observed_at":"2026-08-02T14:08:01.966203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:08:02.164008Z","title":"IRT-router: Effective and interpretable multi-LLM routing via item response theory","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-04T04:27:45.677236Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T14:08:02.164008Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:d8485b2a9eeac089df042b39fc18d90e4d2e1034fbc39ac2ec989ed797569271","observation_id":"0f12ea98-663a-4c15-87ab-d9c99f031471","resolution":{"observed_at":"2026-08-02T14:08:02.164008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:08:02.387731Z","title":"Llumnix: dynamic scheduling for large language model serving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-04T04:27:45.677236Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-02T14:08:02.387731Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:d396dedab34834b88d281e779e06cc5955a233f8db362dfa856704259b79fe58","observation_id":"a89824c2-a1ff-47ec-aaa9-623a07dc700d","resolution":{"observed_at":"2026-08-02T14:08:02.387731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:08:02.465271Z","title":"Hashimoto","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-04T04:27:45.677236Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-02T14:08:02.465271Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:74c39ed82dff648252dea1ecaa33188d45196dae4e28d3d052673a194f38f607","observation_id":"9c3c6777-309f-45f6-9d8f-14a0c474dafa","resolution":{"observed_at":"2026-08-02T14:08:02.465271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:08:02.276883Z","title":"ISBN 979-8-89176-251-0","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-04T04:27:45.677236Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-02T14:08:02.276883Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:26f78d34dd0d3b435eb8b6890f2a4c7b725615c5f56cef58ffa8bd3dedd5a472","observation_id":"d3331bd0-4fe6-44ea-a110-5a03fc6c2ef9","resolution":{"observed_at":"2026-08-02T14:08:02.276883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:08:02.635380Z","title":null,"venue":null,"work_id":null,"year":1982},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-04T04:27:45.677236Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-02T14:08:02.635380Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:fdcf943a39c3485258e07c21931287196a36f237522c449cddf7d4626cf50ade","observation_id":"a7cf780b-6b9f-4ce5-b1ba-9dbb71b7c262","resolution":{"observed_at":"2026-08-02T14:08:02.635380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:08:02.730723Z","title":"Cohen, Ruslan Salakhutdinov, and Christo- pher D","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-04T04:27:45.677236Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-02T14:08:02.730723Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:618c237f90e2a2dd077998258121e8ccbe2de40c024c7ff73b21976d35ffbcdf","observation_id":"3137dcd9-e144-4847-99c0-fec1d0608697","resolution":{"observed_at":"2026-08-02T14:08:02.730723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:08:02.540327Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-04T04:27:45.677236Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-02T14:08:02.540327Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:8ef00c205be50a03269a96125337b2f2d68f0762c684055833dde241e470360d","observation_id":"f67ff5dd-0810-487c-9c06-2b75c2e36288","resolution":{"observed_at":"2026-08-02T14:08:02.540327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:08:02.980770Z","title":"BARTScore: Evaluating generated text as text generation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-04T04:27:45.677236Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-02T14:08:02.980770Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:cf06e97ebedfa76ba7ea263a7289ffa84559cfdb7f4baf8f3ece07b603aead22","observation_id":"cd3715e1-a84c-4d96-8d8c-e88cbe7c0096","resolution":{"observed_at":"2026-08-02T14:08:02.980770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:08:03.135243Z","title":"PhD thesis, Georgia Institute of Technology, August 2009","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-04T04:27:45.677236Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-02T14:08:03.135243Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:f2ef795ecf6abb95a3c807df78edc1b4ddc9dc90d6b59f161b68b60cbe090bb0","observation_id":"e055f8cc-93bb-42a7-bcd9-de6894a6e278","resolution":{"observed_at":"2026-08-02T14:08:03.135243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:08:02.828169Z","title":"Orca: A distributed serving system for Transformer-Based generative models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-04T04:27:45.677236Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-02T14:08:02.828169Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:fa6ed1e2f7dd2db4a82ca68aa4be555efe80d3376b7dae73e5054a22a24afbdd","observation_id":"89d3d3f6-7723-41d2-a43f-f77cbf056a52","resolution":{"observed_at":"2026-08-02T14:08:02.828169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:08:03.298249Z","title":"scores\". The","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-04T04:27:45.677236Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-02T14:08:03.298249Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:80b906ed58674e15171c74977b5431de80eb78cbc545e034ac21a73f2315db69","observation_id":"817b5903-4bfd-4603-86f3-1b32786bc0ad","resolution":{"observed_at":"2026-08-02T14:08:03.298249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:08:03.437194Z","title":"Alternatively, generation work for queries follows the memoryless distribution [34]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-04T04:27:45.677236Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-02T14:08:03.437194Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:95d8e0f16f3d02933a1e9df7d500affd7c6c2cc7e70b760d4037211022003a2b","observation_id":"86558925-525d-475c-b668-498e388567fb","resolution":{"observed_at":"2026-08-02T14:08:03.437194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:08:03.579451Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-04T04:27:45.677236Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-02T14:08:03.579451Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:38f1744dd41b5a52290acb25e7fa469ad3e5e94bf757b56564a795523bb358d5","observation_id":"719892b6-9c99-490c-ac66-de7083f22cc2","resolution":{"observed_at":"2026-08-02T14:08:03.579451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:08:03.701007Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-04T04:27:45.677236Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-02T14:08:03.701007Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:258ed8e2a4cd5a323450dda34429a80c5a100c7b2c8398db058aa7acdd98f979","observation_id":"0c522c42-823f-4001-8522-057759fabc73","resolution":{"observed_at":"2026-08-02T14:08:03.701007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:08:03.850772Z","title":"State process and stationary distribution.Queries arrive according to a Poisson process of rateαj, so whenever a new query arrives, the state|Rj(t)| increases by one","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-04T04:27:45.677236Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-02T14:08:03.850772Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:92db3ced81c75cabfb278d31b7a47e49ae13b944b9af71f6db989748477ad776","observation_id":"83887fa6-2f98-4762-a30d-28e258d74612","resolution":{"observed_at":"2026-08-02T14:08:03.850772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:08:01.433404Z","title":"ISBN 9798400712869","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-04T04:27:45.677236Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-02T14:08:01.433404Z"},"links":{"citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:93965efca1c0ea0d02a4956d1fbaa0ddbc9451097d58472eb38c5a9e6cb1ea37","observation_id":"4d867fb0-65e6-4968-8f07-0664ac952bbc","resolution":{"observed_at":"2026-08-02T14:08:01.433404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07347","last_updated":"2026-05-18T01:04:46Z","snapshot_observed_at":"2026-08-04T04:26:27.630303Z","submitted_at":"2025-04-10T00:12:12Z","title":"Throughput-Optimal Scheduling Algorithms for LLM Inference and AI Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07347","snapshot_observed_at":"2026-08-02T14:08:00.632928Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","snapshot_observed_at":"2026-08-04T04:27:45.677236Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-02T14:08:00.632928Z"},"links":{"cited_paper":"/paper/2504.07347","citing_paper":"/paper/2607.18253"},"observation_digest":"sha256:c6f05c8b0edbbc0e5d1bef89e7e9ac4d5619489d18837699c08edd9bda18c90a","observation_id":"0dfe617e-386a-40c1-9950-183a1a62f5aa","resolution":{"observed_at":"2026-08-02T14:08:00.632928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.18253","last_updated":"2026-05-13T20:29:09Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-04T04:27:45.677236Z","submitted_at":"2026-05-13T20:29:09Z","title":"Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads"},"reference_resolution":{"displayed":59,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":58,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":59},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 59 of 59 outbound references and 0 inbound Pith citation observations for arXiv:2607.18253."}