{"as_of":"2026-08-08T20:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:93c81cdd455f629fa0df1ba8a838e8dc3d3ee6593b9acf1d9d8ebffdccb2852e","coverage":[{"denominator":74,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":74,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T16:55:38.764173Z","state":"measured"},{"denominator":74,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":74,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.00946/citation-record","integrity":"/paper/2606.00946/integrity","json":"/paper/2606.00946/citation-record.json","paper":"/paper/2606.00946"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:55:38.764173Z","title":"https://docs.nvidia.com/ dynamo/latest/","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00946","last_updated":"2026-05-31T01:31:02Z","snapshot_observed_at":"2026-07-06T23:41:34.459700Z","submitted_at":"2026-05-31T01:31:02Z","title":"Lodestar: An Online-Learning LLM Inference Router","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-28T16:55:38.764173Z"},"links":{"citing_paper":"/paper/2606.00946"},"observation_digest":"sha256:d4ffd7b4e13b8a4c8e2b24b619829c124e1523283866694130976e2db0191e97","observation_id":"9f7dd599-168a-4cf0-b45f-b334a535f38d","resolution":{"observed_at":"2026-06-28T16:55:38.764173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:55:38.764173Z","title":"https: //www.amd.com/en/products/accelerators/ instinct/mi300/mi300a.html, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.00946","last_updated":"2026-05-31T01:31:02Z","snapshot_observed_at":"2026-07-06T23:41:34.459700Z","submitted_at":"2026-05-31T01:31:02Z","title":"Lodestar: An Online-Learning LLM Inference Router","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-28T16:55:38.764173Z"},"links":{"citing_paper":"/paper/2606.00946"},"observation_digest":"sha256:487dd3158e2c0eafc7d1a88b6b08df622643472181cf444877c7b0dfd917f0d5","observation_id":"190a7156-ae26-42bc-8c2f-fb109f879d15","resolution":{"observed_at":"2026-06-28T16:55:38.764173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:55:38.764173Z","title":"https://sharegpt.com, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.00946","last_updated":"2026-05-31T01:31:02Z","snapshot_observed_at":"2026-07-06T23:41:34.459700Z","submitted_at":"2026-05-31T01:31:02Z","title":"Lodestar: An Online-Learning LLM Inference Router","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-28T16:55:38.764173Z"},"links":{"citing_paper":"/paper/2606.00946"},"observation_digest":"sha256:cca9c9f7e68a373208bad5953e7cca38df23c77378ea9b088f1f1b892de51598","observation_id":"24e3687e-2f6f-48bc-855d-32af14203f7a","resolution":{"observed_at":"2026-06-28T16:55:38.764173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:55:38.764173Z","title":"https: //www.nvidia.com/en-us/data-center/ technologies/blackwell-architecture/, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.00946","last_updated":"2026-05-31T01:31:02Z","snapshot_observed_at":"2026-07-06T23:41:34.459700Z","submitted_at":"2026-05-31T01:31:02Z","title":"Lodestar: An Online-Learning LLM Inference Router","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-28T16:55:38.764173Z"},"links":{"citing_paper":"/paper/2606.00946"},"observation_digest":"sha256:28b0396153bc6d728032ea0bad1f5908cf436d9f8a8925812b36a0a53b4d8683","observation_id":"4fd6016f-04d1-4c93-80c5-7c54bf6a2fb0","resolution":{"observed_at":"2026-06-28T16:55:38.764173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:55:38.764173Z","title":"https:// blog.google/products/google-cloud/ ironwood-tpu-age-of-inference/, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00946","last_updated":"2026-05-31T01:31:02Z","snapshot_observed_at":"2026-07-06T23:41:34.459700Z","submitted_at":"2026-05-31T01:31:02Z","title":"Lodestar: An Online-Learning LLM Inference Router","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-28T16:55:38.764173Z"},"links":{"citing_paper":"/paper/2606.00946"},"observation_digest":"sha256:68482f777e147b91b1d931a05f54e18545aa2a3dd77d0b6775a65000d6839cd8","observation_id":"48fda3e4-0676-4de7-8153-3e50d78e51bb","resolution":{"observed_at":"2026-06-28T16:55:38.764173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:55:38.764173Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00946","last_updated":"2026-05-31T01:31:02Z","snapshot_observed_at":"2026-07-06T23:41:34.459700Z","submitted_at":"2026-05-31T01:31:02Z","title":"Lodestar: An Online-Learning LLM Inference Router","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-28T16:55:38.764173Z"},"links":{"citing_paper":"/paper/2606.00946"},"observation_digest":"sha256:97890164bfdac276659ca3808d92ac2cda8b433932c025a0fc6b12957a0705cd","observation_id":"a479ea20-edd7-45ab-ade5-69527b8cf52e","resolution":{"observed_at":"2026-06-28T16:55:38.764173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:55:38.764173Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00946","last_updated":"2026-05-31T01:31:02Z","snapshot_observed_at":"2026-07-06T23:41:34.459700Z","submitted_at":"2026-05-31T01:31:02Z","title":"Lodestar: An Online-Learning LLM Inference Router","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-28T16:55:38.764173Z"},"links":{"citing_paper":"/paper/2606.00946"},"observation_digest":"sha256:02cd048351333148bc7d2ceb3cc5f938de5f85edfa7f055fb784642ad1973b43","observation_id":"c1056ea5-d11e-451e-8ddc-8055d6c6db02","resolution":{"observed_at":"2026-06-28T16:55:38.764173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:55:38.764173Z","title":"https://www.nvidia","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00946","last_updated":"2026-05-31T01:31:02Z","snapshot_observed_at":"2026-07-06T23:41:34.459700Z","submitted_at":"2026-05-31T01:31:02Z","title":"Lodestar: An Online-Learning LLM Inference Router","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-28T16:55:38.764173Z"},"links":{"citing_paper":"/paper/2606.00946"},"observation_digest":"sha256:e35c264b842ab7375b052acd27fd3585d25614c34c96bdaf0a508dbc4fe5df8a","observation_id":"ad9bd619-381c-44f9-bd11-f76beb1689d9","resolution":{"observed_at":"2026-06-28T16:55:38.764173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:55:38.764173Z","title":"Gulavani, Alexey Tu- manov, and Ramachandran Ramjee","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.00946","last_updated":"2026-05-31T01:31:02Z","snapshot_observed_at":"2026-07-06T23:41:34.459700Z","submitted_at":"2026-05-31T01:31:02Z","title":"Lodestar: An Online-Learning LLM Inference Router","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-28T16:55:38.764173Z"},"links":{"citing_paper":"/paper/2606.00946"},"observation_digest":"sha256:c64a54979c48bbf3e9155227bb586eeb0e6a5c65cef0e8962f7d3daf6dc58d10","observation_id":"ca0cac6d-5049-4b39-8bf9-131699c9e227","resolution":{"observed_at":"2026-06-28T16:55:38.764173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:55:38.764173Z","title":"Gulavani, and Ramachandran Ramjee","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.00946","last_updated":"2026-05-31T01:31:02Z","snapshot_observed_at":"2026-07-06T23:41:34.459700Z","submitted_at":"2026-05-31T01:31:02Z","title":"Lodestar: An Online-Learning LLM Inference Router","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-28T16:55:38.764173Z"},"links":{"citing_paper":"/paper/2606.00946"},"observation_digest":"sha256:e0f53856023cfe6c07ea7a5d8ba1880b60da347b7ac80eaeafd2bd5248d3453d","observation_id":"c929397f-6926-4c31-bb91-84380c8cac1e","resolution":{"observed_at":"2026-06-28T16:55:38.764173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:55:38.764173Z","title":"Llmrank: Under- standing llm strengths for model routing, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00946","last_updated":"2026-05-31T01:31:02Z","snapshot_observed_at":"2026-07-06T23:41:34.459700Z","submitted_at":"2026-05-31T01:31:02Z","title":"Lodestar: An Online-Learning LLM Inference Router","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-28T16:55:38.764173Z"},"links":{"citing_paper":"/paper/2606.00946"},"observation_digest":"sha256:44d44b2f52fa9e02a46c2949ccd27ca74a5b8795065504e2a7f9b83c6f391429","observation_id":"9d6ca5de-04c0-4990-9a18-7392e18f86a3","resolution":{"observed_at":"2026-06-28T16:55:38.764173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:55:38.764173Z","title":"Deepspeed inference: Enabling efficient inference of transformer models at unprecedented scale, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.00946","last_updated":"2026-05-31T01:31:02Z","snapshot_observed_at":"2026-07-06T23:41:34.459700Z","submitted_at":"2026-05-31T01:31:02Z","title":"Lodestar: An Online-Learning LLM Inference Router","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-28T16:55:38.764173Z"},"links":{"citing_paper":"/paper/2606.00946"},"observation_digest":"sha256:9746373520860194a3976e673bcd014cb1eafff9c80f3d04fce33de4e88d5bd7","observation_id":"51d1edb8-a932-4be0-a6ae-786e59a75d06","resolution":{"observed_at":"2026-06-28T16:55:38.764173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:55:38.764173Z","title":"L-Eval: Insti- tuting standardized evaluation for long context language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.00946","last_updated":"2026-05-31T01:31:02Z","snapshot_observed_at":"2026-07-06T23:41:34.459700Z","submitted_at":"2026-05-31T01:31:02Z","title":"Lodestar: An Online-Learning LLM Inference Router","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-28T16:55:38.764173Z"},"links":{"citing_paper":"/paper/2606.00946"},"observation_digest":"sha256:eace5ec588cc7df5f6401cdd2f5a7a4c981768baef7d96bda749560607449272","observation_id":"c589907a-e087-40c4-ba17-39f7b8bc8ce2","resolution":{"observed_at":"2026-06-28T16:55:38.764173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:55:38.764173Z","title":"Lee, Deming Chen, and Tri Dao","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.00946","last_updated":"2026-05-31T01:31:02Z","snapshot_observed_at":"2026-07-06T23:41:34.459700Z","submitted_at":"2026-05-31T01:31:02Z","title":"Lodestar: An Online-Learning LLM Inference Router","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-28T16:55:38.764173Z"},"links":{"citing_paper":"/paper/2606.00946"},"observation_digest":"sha256:2cab79be1def0dc9450dc5be9f4bb642072b1194834ebf8f8e96a0a4324643ca","observation_id":"5d55f80d-c599-46e3-bdd7-a82f8fb18a74","resolution":{"observed_at":"2026-06-28T16:55:38.764173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.05176","last_updated":"2023-05-09T05:11:02Z","snapshot_observed_at":"2026-07-31T18:33:34.529799Z","submitted_at":"2023-05-09T05:11:02Z","title":"FrugalGPT: How to Use Large Language Models While Reducing Cost and Improving Performance","version":1},"cited_work":{"arxiv_id":"2305.05176","doi":"10.48550/arxiv.2305.05176","metadata_source":"pith","pith_arxiv_id":"2305.05176","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FrugalGPT: How to Use Large Language Models While Reducing Cost and Improving Performance","venue":"cs.LG","work_id":"5c567414-35de-4373-ae7a-1790da594e8d","year":2023},"citing_paper":{"arxiv_id":"2606.00946","last_updated":"2026-05-31T01:31:02Z","snapshot_observed_at":"2026-07-06T23:41:34.459700Z","submitted_at":"2026-05-31T01:31:02Z","title":"Lodestar: An Online-Learning LLM Inference Router","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-28T16:55:38.764173Z"},"links":{"cited_paper":"/paper/2305.05176","citing_paper":"/paper/2606.00946"},"observation_digest":"sha256:01112ea09d77ca8866cf98a5049285be1167a5cd96846825f7ac45b61f787ed7","observation_id":"fe43942d-e2f1-48dc-973a-3028fa51f1ce","resolution":{"observed_at":"2026-06-28T17:02:24.562310Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-14T18:20:20.871342+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T18:20:20.871342+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:55:38.764173Z","title":"{IMPRESS}: An {Importance- Informed}{Multi-Tier} prefix {KV} storage system for large language model inference","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00946","last_updated":"2026-05-31T01:31:02Z","snapshot_observed_at":"2026-07-06T23:41:34.459700Z","submitted_at":"2026-05-31T01:31:02Z","title":"Lodestar: An Online-Learning LLM Inference Router","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-28T16:55:38.764173Z"},"links":{"citing_paper":"/paper/2606.00946"},"observation_digest":"sha256:ef2e6d9a185fc3a233984f572cff55375849ced8cd138e1a9b700bf2bc576569","observation_id":"85419afe-fa21-45fd-acb2-a0cf6012d6fe","resolution":{"observed_at":"2026-06-28T16:55:38.764173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.09665","doi":"10.48550/arxiv.2510.09665","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Lmcache: An efficient kv cache layer for enterprise-scale llm inference","venue":"arXiv (Cornell University)","work_id":"089b937e-f3f9-4525-a792-524ef0f7db1d","year":2025},"citing_paper":{"arxiv_id":"2606.00946","last_updated":"2026-05-31T01:31:02Z","snapshot_observed_at":"2026-07-06T23:41:34.459700Z","submitted_at":"2026-05-31T01:31:02Z","title":"Lodestar: An Online-Learning LLM Inference Router","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-28T16:55:38.764173Z"},"links":{"citing_paper":"/paper/2606.00946"},"observation_digest":"sha256:4ed3df378dd11e543c3fe62dbdf1cc0aae84d2ae920835d57f2f320040681d66","observation_id":"2147a59c-35cb-434b-ab12-9c6a5b9719ee","resolution":{"observed_at":"2026-06-28T17:02:24.549335Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:55:38.764173Z","title":"Angelopoulos, Tianle Li, Dacheng Li, Banghua Zhu, Hao Zhang, Michael I","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.00946","last_updated":"2026-05-31T01:31:02Z","snapshot_observed_at":"2026-07-06T23:41:34.459700Z","submitted_at":"2026-05-31T01:31:02Z","title":"Lodestar: An Online-Learning LLM Inference Router","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-28T16:55:38.764173Z"},"links":{"citing_paper":"/paper/2606.00946"},"observation_digest":"sha256:445903cdfc7bfa0b1ef82be178b235fb319333c596ef1bf7bbbdfdac6ac63a27","observation_id":"39ca9c60-8c50-4295-8b11-4ba9f553a169","resolution":{"observed_at":"2026-06-28T16:55:38.764173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:55:38.764173Z","title":"Lmdeploy: A toolkit for com- pressing, deploying, and serving llm","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.00946","last_updated":"2026-05-31T01:31:02Z","snapshot_observed_at":"2026-07-06T23:41:34.459700Z","submitted_at":"2026-05-31T01:31:02Z","title":"Lodestar: An Online-Learning LLM Inference Router","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-28T16:55:38.764173Z"},"links":{"citing_paper":"/paper/2606.00946"},"observation_digest":"sha256:503c3f3837bb3871a25e76745f828a31c0dcc445a77bb95793da1489d0bd8dc5","observation_id":"a3740445-e3d1-4ecf-9b3e-92bd626f5dc9","resolution":{"observed_at":"2026-06-28T16:55:38.764173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:55:38.764173Z","title":"Flashattention: Fast and memory- efficient exact attention with io-awareness.Advances in neural information processing systems, 35:16344– 16359, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.00946","last_updated":"2026-05-31T01:31:02Z","snapshot_observed_at":"2026-07-06T23:41:34.459700Z","submitted_at":"2026-05-31T01:31:02Z","title":"Lodestar: An Online-Learning LLM Inference Router","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-28T16:55:38.764173Z"},"links":{"citing_paper":"/paper/2606.00946"},"observation_digest":"sha256:85ef98c0d1dafd8f3488db395409cc1297694b7576eaa025ef9763d46e7d0f12","observation_id":"3e1bbab2-f7df-425b-9f6f-e61d33b47bd5","resolution":{"observed_at":"2026-06-28T16:55:38.764173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:55:38.764173Z","title":"Pre- fillonly: An inference engine for prefill-only workloads in large language model applications","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00946","last_updated":"2026-05-31T01:31:02Z","snapshot_observed_at":"2026-07-06T23:41:34.459700Z","submitted_at":"2026-05-31T01:31:02Z","title":"Lodestar: An Online-Learning LLM Inference Router","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-28T16:55:38.764173Z"},"links":{"citing_paper":"/paper/2606.00946"},"observation_digest":"sha256:83f3b25e16281ffa6b0684ba747747bb11c67eddb7d0ad7640e1a2de869702bd","observation_id":"b882e2f7-ec03-46ab-8647-d525197141ba","resolution":{"observed_at":"2026-06-28T16:55:38.764173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:55:38.764173Z","title":"Turbotransformers: an efficient gpu serving system for transformer models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.00946","last_updated":"2026-05-31T01:31:02Z","snapshot_observed_at":"2026-07-06T23:41:34.459700Z","submitted_at":"2026-05-31T01:31:02Z","title":"Lodestar: An Online-Learning LLM Inference Router","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-28T16:55:38.764173Z"},"links":{"citing_paper":"/paper/2606.00946"},"observation_digest":"sha256:f79c0dff7a393ec8d41141a74f3fb8fe1229cf0c74dd9702cd357f10151de8d1","observation_id":"86673f0d-d64f-4f8b-84fc-4f6965eda18a","resolution":{"observed_at":"2026-06-28T16:55:38.764173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:55:38.764173Z","title":"Efficient llm scheduling by learn- ing to rank","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.00946","last_updated":"2026-05-31T01:31:02Z","snapshot_observed_at":"2026-07-06T23:41:34.459700Z","submitted_at":"2026-05-31T01:31:02Z","title":"Lodestar: An Online-Learning LLM Inference Router","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-28T16:55:38.764173Z"},"links":{"citing_paper":"/paper/2606.00946"},"observation_digest":"sha256:7168aba16abc18ff15ed51ab1e495cc304debae4395ba0a084086e4a6f9cde2a","observation_id":"8d6fc379-d2b5-427e-9514-0c4e22900ae5","resolution":{"observed_at":"2026-06-28T16:55:38.764173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:55:38.764173Z","title":"Cost-effective attention reuse across multi-turn conversations in large language model serv- ing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.00946","last_updated":"2026-05-31T01:31:02Z","snapshot_observed_at":"2026-07-06T23:41:34.459700Z","submitted_at":"2026-05-31T01:31:02Z","title":"Lodestar: An Online-Learning LLM Inference Router","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-28T16:55:38.764173Z"},"links":{"citing_paper":"/paper/2606.00946"},"observation_digest":"sha256:e0b0d917b9e70d474178ae1da1b47d315a5a024dcbefaf71ce1603aabc47cf7d","observation_id":"1b6f85b8-045a-46f0-812a-d622a6b04285","resolution":{"observed_at":"2026-06-28T16:55:38.764173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:55:38.764173Z","title":"Prompt cache: Modular attention reuse for low-latency inference.Pro- ceedings of Machine Learning and Systems, 6:325–338, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.00946","last_updated":"2026-05-31T01:31:02Z","snapshot_observed_at":"2026-07-06T23:41:34.459700Z","submitted_at":"2026-05-31T01:31:02Z","title":"Lodestar: An Online-Learning LLM Inference Router","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-28T16:55:38.764173Z"},"links":{"citing_paper":"/paper/2606.00946"},"observation_digest":"sha256:7fa1e607cf84d0bb417f0ab5b4e44b925801070849c9990143222671c60de7a9","observation_id":"2c522d51-e640-4c4d-86d2-e2cccc761687","resolution":{"observed_at":"2026-06-28T16:55:38.764173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:55:38.764173Z","title":"Serving DNNs like clockwork: Performance predictability from the bottom up","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.00946","last_updated":"2026-05-31T01:31:02Z","snapshot_observed_at":"2026-07-06T23:41:34.459700Z","submitted_at":"2026-05-31T01:31:02Z","title":"Lodestar: An Online-Learning LLM Inference Router","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-28T16:55:38.764173Z"},"links":{"citing_paper":"/paper/2606.00946"},"observation_digest":"sha256:e2543010d08e2b6384aeb9b7845aa3416e175a2de4ecef81a4e25c6a9dfcca38","observation_id":"17759f6a-02d2-4bb7-b9be-777e62cf6013","resolution":{"observed_at":"2026-06-28T16:55:38.764173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2606.00946","last_updated":"2026-05-31T01:31:02Z","snapshot_observed_at":"2026-07-06T23:41:34.459700Z","submitted_at":"2026-05-31T01:31:02Z","title":"Lodestar: An Online-Learning LLM Inference Router","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-28T16:55:38.764173Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2606.00946"},"observation_digest":"sha256:359c954935e7a03838546341a2a0a540c38edd4d3f7e267b0fd9252fbf3dfb64","observation_id":"055cef4e-f1aa-4688-ad03-158f227f08f0","resolution":{"observed_at":"2026-06-28T17:02:24.557623Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:55:38.764173Z","title":"Towards generalized routing: Model and agent orchestration for adaptive and efficient inference, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00946","last_updated":"2026-05-31T01:31:02Z","snapshot_observed_at":"2026-07-06T23:41:34.459700Z","submitted_at":"2026-05-31T01:31:02Z","title":"Lodestar: An Online-Learning LLM Inference Router","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-28T16:55:38.764173Z"},"links":{"citing_paper":"/paper/2606.00946"},"observation_digest":"sha256:90e1a09464b5030dbed24234127f4c0d08a2166037004e0fb35c67e94a339d5c","observation_id":"1f3ae500-8a88-495f-8716-ff28bf8275d9","resolution":{"observed_at":"2026-06-28T16:55:38.764173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:55:38.764173Z","title":"RULER: What’s the real context size of your long-context language models? InFirst Conference on Language Modeling, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.00946","last_updated":"2026-05-31T01:31:02Z","snapshot_observed_at":"2026-07-06T23:41:34.459700Z","submitted_at":"2026-05-31T01:31:02Z","title":"Lodestar: An Online-Learning LLM Inference Router","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-28T16:55:38.764173Z"},"links":{"citing_paper":"/paper/2606.00946"},"observation_digest":"sha256:d7bcf0c69e8edd65a844b95f58e6787f86daffb60165604e74783265a30059c7","observation_id":"5acf9b31-e44a-47fe-b6f2-542f22627a24","resolution":{"observed_at":"2026-06-28T16:55:38.764173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":"2412.16720","doi":"10.48550/arxiv.2412.16720","metadata_source":"pith","pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"OpenAI o1 System Card","venue":"cs.AI","work_id":"68d3c334-0fc9-49e3-b7b0-a69afae933e2","year":2024},"citing_paper":{"arxiv_id":"2606.00946","last_updated":"2026-05-31T01:31:02Z","snapshot_observed_at":"2026-07-06T23:41:34.459700Z","submitted_at":"2026-05-31T01:31:02Z","title":"Lodestar: An Online-Learning LLM Inference Router","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-28T16:55:38.764173Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2606.00946"},"observation_digest":"sha256:eec97757437da047967b461f062a1f3bdadf09730b39d23bf17f8ef13504a922","observation_id":"65d54678-6bab-4544-a354-fc78f5640786","resolution":{"observed_at":"2026-06-28T17:02:24.559829Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:55:38.764173Z","title":"Gonza- lez, Hao Zhang, and Ion Stoica","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.00946","last_updated":"2026-05-31T01:31:02Z","snapshot_observed_at":"2026-07-06T23:41:34.459700Z","submitted_at":"2026-05-31T01:31:02Z","title":"Lodestar: An Online-Learning LLM Inference Router","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-28T16:55:38.764173Z"},"links":{"citing_paper":"/paper/2606.00946"},"observation_digest":"sha256:618ba7bb91e5b039db3daac830336396688f9052ae7a176432953df777fca04a","observation_id":"5a4349a9-6535-4616-b5a4-20ef43dfde06","resolution":{"observed_at":"2026-06-28T16:55:38.764173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:55:38.764173Z","title":"InfiniGen: Efficient generative inference of large language models with dynamic KV cache management","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.00946","last_updated":"2026-05-31T01:31:02Z","snapshot_observed_at":"2026-07-06T23:41:34.459700Z","submitted_at":"2026-05-31T01:31:02Z","title":"Lodestar: An Online-Learning LLM Inference Router","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-28T16:55:38.764173Z"},"links":{"citing_paper":"/paper/2606.00946"},"observation_digest":"sha256:6cb9d6035a4c4248d1ce003c0b2a97ca6908437b9221e99ac111640a5116e651","observation_id":"aa873f7c-f135-4aef-8d40-e1c0a05a4f64","resolution":{"observed_at":"2026-06-28T16:55:38.764173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:55:38.764173Z","title":"Fast inference from transformers via speculative decoding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.00946","last_updated":"2026-05-31T01:31:02Z","snapshot_observed_at":"2026-07-06T23:41:34.459700Z","submitted_at":"2026-05-31T01:31:02Z","title":"Lodestar: An Online-Learning LLM Inference Router","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-28T16:55:38.764173Z"},"links":{"citing_paper":"/paper/2606.00946"},"observation_digest":"sha256:b6fa8ba0b359dfa7a026a539f800345f8a0545c43e2bb504ff5fbd4041add1c9","observation_id":"3e96d14a-d539-4cd9-bae1-2b39a1d9d862","resolution":{"observed_at":"2026-06-28T16:55:38.764173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:55:38.764173Z","title":"LooGLE: Can long-context language models understand long contexts?, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.00946","last_updated":"2026-05-31T01:31:02Z","snapshot_observed_at":"2026-07-06T23:41:34.459700Z","submitted_at":"2026-05-31T01:31:02Z","title":"Lodestar: An Online-Learning LLM Inference Router","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-28T16:55:38.764173Z"},"links":{"citing_paper":"/paper/2606.00946"},"observation_digest":"sha256:45f6998f8ed0d972ce1a5aff1ea0e8cb8558a6b2aa20e1a5a6c04c9242d252c0","observation_id":"4794d1b5-6320-4c98-a69b-a557df98b478","resolution":{"observed_at":"2026-06-28T16:55:38.764173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:55:38.764173Z","title":"Eagle: speculative sampling requires rethinking feature uncertainty","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.00946","last_updated":"2026-05-31T01:31:02Z","snapshot_observed_at":"2026-07-06T23:41:34.459700Z","submitted_at":"2026-05-31T01:31:02Z","title":"Lodestar: An Online-Learning LLM Inference Router","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-28T16:55:38.764173Z"},"links":{"citing_paper":"/paper/2606.00946"},"observation_digest":"sha256:1070d918cfcf7329c76b0d824d5dd9336a24c2ad0d2b1f64a55456fd0964c768","observation_id":"98b445e0-3438-4855-bffa-b2663de4b2e6","resolution":{"observed_at":"2026-06-28T16:55:38.764173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:55:38.764173Z","title":"Opportunities and challenges in service layer traffic engineering","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.00946","last_updated":"2026-05-31T01:31:02Z","snapshot_observed_at":"2026-07-06T23:41:34.459700Z","submitted_at":"2026-05-31T01:31:02Z","title":"Lodestar: An Online-Learning LLM Inference Router","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-28T16:55:38.764173Z"},"links":{"citing_paper":"/paper/2606.00946"},"observation_digest":"sha256:3a79b46d922d8eb0b693761e3826e87ac10edfaee176844e8b6959a0a86b8235","observation_id":"cedb02ee-7bd4-4086-b802-149f6f69fb6c","resolution":{"observed_at":"2026-06-28T16:55:38.764173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:55:38.764173Z","title":"KV-Cache Indexer: Architecture","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.00946","last_updated":"2026-05-31T01:31:02Z","snapshot_observed_at":"2026-07-06T23:41:34.459700Z","submitted_at":"2026-05-31T01:31:02Z","title":"Lodestar: An Online-Learning LLM Inference Router","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-28T16:55:38.764173Z"},"links":{"citing_paper":"/paper/2606.00946"},"observation_digest":"sha256:297a349665b9c964e1803ec34af5f154d5326e6c2be27aa90cbb94ee0f11ec78","observation_id":"82069fb6-7952-48ab-b879-fcb3427066b8","resolution":{"observed_at":"2026-06-28T16:55:38.764173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:55:38.764173Z","title":"Helix: Serving large language models over heterogeneous gpus and net- work via max-flow","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00946","last_updated":"2026-05-31T01:31:02Z","snapshot_observed_at":"2026-07-06T23:41:34.459700Z","submitted_at":"2026-05-31T01:31:02Z","title":"Lodestar: An Online-Learning LLM Inference Router","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-28T16:55:38.764173Z"},"links":{"citing_paper":"/paper/2606.00946"},"observation_digest":"sha256:7227642bf7cfca5c315d7c0a6ba622cff8eae4abe8a91dfcaa0cbbb8265dd39f","observation_id":"e221b453-dbd2-4f84-b55c-9c0ea4890778","resolution":{"observed_at":"2026-06-28T16:55:38.764173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:55:38.764173Z","title":"Mitzenmacher","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2606.00946","last_updated":"2026-05-31T01:31:02Z","snapshot_observed_at":"2026-07-06T23:41:34.459700Z","submitted_at":"2026-05-31T01:31:02Z","title":"Lodestar: An Online-Learning LLM Inference Router","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-28T16:55:38.764173Z"},"links":{"citing_paper":"/paper/2606.00946"},"observation_digest":"sha256:fe30e32e26004022c2d0821f261faee1f2894179c0f0410742b781ca59593a53","observation_id":"20f5535f-5f0c-4fd4-bd60-749185cfbce6","resolution":{"observed_at":"2026-06-28T16:55:38.764173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:55:38.764173Z","title":"Heterogeneity-aware cluster scheduling policies for deep learning workloads","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.00946","last_updated":"2026-05-31T01:31:02Z","snapshot_observed_at":"2026-07-06T23:41:34.459700Z","submitted_at":"2026-05-31T01:31:02Z","title":"Lodestar: An Online-Learning LLM Inference Router","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-28T16:55:38.764173Z"},"links":{"citing_paper":"/paper/2606.00946"},"observation_digest":"sha256:9313a4b7a20fa248e2615b978c9ce13109b03355e0af9e6cc3e1e591791ea4ce","observation_id":"b5e66b18-7c11-46d6-8934-1ecfbeda1a50","resolution":{"observed_at":"2026-06-28T16:55:38.764173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:55:38.764173Z","title":"Fastertransformer","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.00946","last_updated":"2026-05-31T01:31:02Z","snapshot_observed_at":"2026-07-06T23:41:34.459700Z","submitted_at":"2026-05-31T01:31:02Z","title":"Lodestar: An Online-Learning LLM Inference Router","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-28T16:55:38.764173Z"},"links":{"citing_paper":"/paper/2606.00946"},"observation_digest":"sha256:8d3b0fc925702973e9094a07676c1d5b0dc6d2f80f40bbae7b1ccb6e0dc358f3","observation_id":"b780eadb-ea65-4bd3-9c02-5d50ef0e6615","resolution":{"observed_at":"2026-06-28T16:55:38.764173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:55:38.764173Z","title":"Dynamo kv-aware router","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00946","last_updated":"2026-05-31T01:31:02Z","snapshot_observed_at":"2026-07-06T23:41:34.459700Z","submitted_at":"2026-05-31T01:31:02Z","title":"Lodestar: An Online-Learning LLM Inference Router","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-28T16:55:38.764173Z"},"links":{"citing_paper":"/paper/2606.00946"},"observation_digest":"sha256:651aea71fc034eefdcbb219d74a0cbb16f73a6fdbca36760d5107000eb3428b4","observation_id":"a4af8685-210a-4673-ba4b-ae5ba9b37bb3","resolution":{"observed_at":"2026-06-28T16:55:38.764173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:55:38.764173Z","title":"Gonzalez, M Waleed Kadous, and Ion Stoica","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.00946","last_updated":"2026-05-31T01:31:02Z","snapshot_observed_at":"2026-07-06T23:41:34.459700Z","submitted_at":"2026-05-31T01:31:02Z","title":"Lodestar: An Online-Learning LLM Inference Router","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-28T16:55:38.764173Z"},"links":{"citing_paper":"/paper/2606.00946"},"observation_digest":"sha256:d93e7297aa71f3e328a60a2b4562ed837db216609eed2897bd0432db6750f1d5","observation_id":"5287d493-bb4f-4427-879d-058d9c70b93f","resolution":{"observed_at":"2026-06-28T16:55:38.764173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:55:38.764173Z","title":"Mar- coni: Prefix caching for the era of hybrid llms, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00946","last_updated":"2026-05-31T01:31:02Z","snapshot_observed_at":"2026-07-06T23:41:34.459700Z","submitted_at":"2026-05-31T01:31:02Z","title":"Lodestar: An Online-Learning LLM Inference Router","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-28T16:55:38.764173Z"},"links":{"citing_paper":"/paper/2606.00946"},"observation_digest":"sha256:4c6d578a2d953688eab68bbc9bab4ac8448172ac787e5aede0d83002a04ec8e8","observation_id":"f6e73064-1291-42f8-8f6b-c333f898fe91","resolution":{"observed_at":"2026-06-28T16:55:38.764173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:55:38.764173Z","title":"Prefill-as-a-service: Kvcache of next-generation models could go cross-datacenter, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.00946","last_updated":"2026-05-31T01:31:02Z","snapshot_observed_at":"2026-07-06T23:41:34.459700Z","submitted_at":"2026-05-31T01:31:02Z","title":"Lodestar: An Online-Learning LLM Inference Router","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-28T16:55:38.764173Z"},"links":{"citing_paper":"/paper/2606.00946"},"observation_digest":"sha256:014faa017a1a682dc4da8800027d10dbbf585cf23770b473716b937ba9e0d3ce","observation_id":"93d98791-af58-4947-a6a0-7b9d7ed33313","resolution":{"observed_at":"2026-06-28T16:55:38.764173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:55:38.764173Z","title":"Mooncake: Trading more storage for less computation — a KVCache-centric architecture for serving LLM chatbot","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00946","last_updated":"2026-05-31T01:31:02Z","snapshot_observed_at":"2026-07-06T23:41:34.459700Z","submitted_at":"2026-05-31T01:31:02Z","title":"Lodestar: An Online-Learning LLM Inference Router","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-28T16:55:38.764173Z"},"links":{"citing_paper":"/paper/2606.00946"},"observation_digest":"sha256:14563f4cbfae25c09fb65f51b8a6d6901392b12b3a69fd12a8ae883c5345d301","observation_id":"0c4297fe-f408-4521-9957-4ed5fe7e9d3e","resolution":{"observed_at":"2026-06-28T16:55:38.764173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:55:38.764173Z","title":"A reduction of imitation learning and structured prediction to no-regret online learning","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2606.00946","last_updated":"2026-05-31T01:31:02Z","snapshot_observed_at":"2026-07-06T23:41:34.459700Z","submitted_at":"2026-05-31T01:31:02Z","title":"Lodestar: An Online-Learning LLM Inference Router","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-28T16:55:38.764173Z"},"links":{"citing_paper":"/paper/2606.00946"},"observation_digest":"sha256:c012841f6e8188f8b245ee4dfeec99f9a4b39ac4114fdbef563324a4a4474ce5","observation_id":"4612b1b2-40eb-409d-a22f-ea62176fa68c","resolution":{"observed_at":"2026-06-28T16:55:38.764173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:55:38.764173Z","title":"Dynaserve: Unified and elastic execution for dynamic disaggregated llm serving, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00946","last_updated":"2026-05-31T01:31:02Z","snapshot_observed_at":"2026-07-06T23:41:34.459700Z","submitted_at":"2026-05-31T01:31:02Z","title":"Lodestar: An Online-Learning LLM Inference Router","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-28T16:55:38.764173Z"},"links":{"citing_paper":"/paper/2606.00946"},"observation_digest":"sha256:91fc586df975e5a86a6a636b383da0486c7fce0fed6421ccca032bf3afb5ab4b","observation_id":"8abb5e58-9a2f-45bc-8e41-9bcbc798ee3e","resolution":{"observed_at":"2026-06-28T16:55:38.764173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:55:38.764173Z","title":"Campbell, Aditya Akella, Christopher J","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00946","last_updated":"2026-05-31T01:31:02Z","snapshot_observed_at":"2026-07-06T23:41:34.459700Z","submitted_at":"2026-05-31T01:31:02Z","title":"Lodestar: An Online-Learning LLM Inference Router","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-28T16:55:38.764173Z"},"links":{"citing_paper":"/paper/2606.00946"},"observation_digest":"sha256:a4f6a8268b5e0be09b440e611862183869b89d34af197fd40656d4c73bb6fd33","observation_id":"0ca3c0c0-4d2a-4853-ade6-8eceea901812","resolution":{"observed_at":"2026-06-28T16:55:38.764173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:55:38.764173Z","title":"Aibrix: Towards scalable, cost-effective large language model inference infrastructure, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00946","last_updated":"2026-05-31T01:31:02Z","snapshot_observed_at":"2026-07-06T23:41:34.459700Z","submitted_at":"2026-05-31T01:31:02Z","title":"Lodestar: An Online-Learning LLM Inference Router","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-28T16:55:38.764173Z"},"links":{"citing_paper":"/paper/2606.00946"},"observation_digest":"sha256:b12460e2d5f9a6ab4db56371d5575bcbf0355c98efbf0a920710fd255a80ce97","observation_id":"ada47784-d3be-4e00-9aa3-939c6efa2be9","resolution":{"observed_at":"2026-06-28T16:55:38.764173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:55:38.764173Z","title":"Preble: Efficient distributed prompt scheduling for llm serving, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.00946","last_updated":"2026-05-31T01:31:02Z","snapshot_observed_at":"2026-07-06T23:41:34.459700Z","submitted_at":"2026-05-31T01:31:02Z","title":"Lodestar: An Online-Learning LLM Inference Router","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-28T16:55:38.764173Z"},"links":{"citing_paper":"/paper/2606.00946"},"observation_digest":"sha256:00961eac7bdd93060b4b73438c282cd14907b8559dce72c3997f6a1c9b76246f","observation_id":"0ebc635f-8421-4801-bfb7-fa3336cdc759","resolution":{"observed_at":"2026-06-28T16:55:38.764173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:55:38.764173Z","title":"C3: Cutting tail latency in cloud data stores via adaptive replica selection","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2606.00946","last_updated":"2026-05-31T01:31:02Z","snapshot_observed_at":"2026-07-06T23:41:34.459700Z","submitted_at":"2026-05-31T01:31:02Z","title":"Lodestar: An Online-Learning LLM Inference Router","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-28T16:55:38.764173Z"},"links":{"citing_paper":"/paper/2606.00946"},"observation_digest":"sha256:e38ae058ce36aa4646a0b5302e1ade49936021fedb955e268f0ec2889914e13c","observation_id":"5b1e04f9-3c62-4630-b2d2-efb2d9060953","resolution":{"observed_at":"2026-06-28T16:55:38.764173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:55:38.764173Z","title":"AIBrix Gateway: Pre- fix Cache and Load-Aware Routing","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00946","last_updated":"2026-05-31T01:31:02Z","snapshot_observed_at":"2026-07-06T23:41:34.459700Z","submitted_at":"2026-05-31T01:31:02Z","title":"Lodestar: An Online-Learning LLM Inference Router","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-28T16:55:38.764173Z"},"links":{"citing_paper":"/paper/2606.00946"},"observation_digest":"sha256:880176b4dcf39788c0757ecde14e3cfa96e49a36dba064ec7752a7dde03e37e7","observation_id":"3fc3ce4f-aaed-4b43-b981-eedc271ef35d","resolution":{"observed_at":"2026-06-28T16:55:38.764173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:55:38.764173Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.00946","last_updated":"2026-05-31T01:31:02Z","snapshot_observed_at":"2026-07-06T23:41:34.459700Z","submitted_at":"2026-05-31T01:31:02Z","title":"Lodestar: An Online-Learning LLM Inference Router","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-28T16:55:38.764173Z"},"links":{"citing_paper":"/paper/2606.00946"},"observation_digest":"sha256:90917202c09ee39a70df3017cdc5001e3f499c446ab45843ea56266a6b678e2d","observation_id":"e345937a-b83c-48fd-b915-d87576571e0e","resolution":{"observed_at":"2026-06-28T16:55:38.764173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:55:38.764173Z","title":"SGLang model gate- way: prefix_hash routing policy","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00946","last_updated":"2026-05-31T01:31:02Z","snapshot_observed_at":"2026-07-06T23:41:34.459700Z","submitted_at":"2026-05-31T01:31:02Z","title":"Lodestar: An Online-Learning LLM Inference Router","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-28T16:55:38.764173Z"},"links":{"citing_paper":"/paper/2606.00946"},"observation_digest":"sha256:a981c847277bc1f69870318a6ce6894342fdeeb9cf9a4f524a80bb8aae41c2e3","observation_id":"8640fdd2-5c02-4d10-9fe4-c3a137768e46","resolution":{"observed_at":"2026-06-28T16:55:38.764173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:55:38.764173Z","title":"GCR: Gradient coreset based re- play buffer selection for continual learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.00946","last_updated":"2026-05-31T01:31:02Z","snapshot_observed_at":"2026-07-06T23:41:34.459700Z","submitted_at":"2026-05-31T01:31:02Z","title":"Lodestar: An Online-Learning LLM Inference Router","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-28T16:55:38.764173Z"},"links":{"citing_paper":"/paper/2606.00946"},"observation_digest":"sha256:edc1117994844de46ce9d80c9dd103f81e5b309488328df3e0828e5fa2d92be5","observation_id":"670a084f-13b7-4ab0-8038-305efdcfc822","resolution":{"observed_at":"2026-06-28T16:55:38.764173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:55:38.764173Z","title":"vllm seman- tic router","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00946","last_updated":"2026-05-31T01:31:02Z","snapshot_observed_at":"2026-07-06T23:41:34.459700Z","submitted_at":"2026-05-31T01:31:02Z","title":"Lodestar: An Online-Learning LLM Inference Router","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-28T16:55:38.764173Z"},"links":{"citing_paper":"/paper/2606.00946"},"observation_digest":"sha256:c0768a0fd276b6c31ab06d6424d54f081e0e98f65a0d9fd5a3e7566db26cc07f","observation_id":"a6f083d1-1100-4d28-9889-90e76f050c6e","resolution":{"observed_at":"2026-06-28T16:55:38.764173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:55:38.764173Z","title":"Kvcache cache in the wild: Char- acterizing and optimizing kvcache cache at a large cloud provider","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00946","last_updated":"2026-05-31T01:31:02Z","snapshot_observed_at":"2026-07-06T23:41:34.459700Z","submitted_at":"2026-05-31T01:31:02Z","title":"Lodestar: An Online-Learning LLM Inference Router","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-06-28T16:55:38.764173Z"},"links":{"citing_paper":"/paper/2606.00946"},"observation_digest":"sha256:705d76536841bd3943c997baf8d180ad3a3633530031cab3d17384d1ff108eb0","observation_id":"d9ed94db-cdac-4a23-9cd0-70e47834b267","resolution":{"observed_at":"2026-06-28T16:55:38.764173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08309","last_updated":"2025-09-10T06:06:51Z","snapshot_observed_at":"2026-08-06T05:24:56.655402Z","submitted_at":"2025-09-10T06:06:51Z","title":"Hetis: Serving LLMs in Heterogeneous GPU Clusters with Fine-grained and Dynamic Parallelism","version":1},"cited_work":{"arxiv_id":"2509.08309","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.08309","snapshot_observed_at":"2026-06-28T17:02:24.553672Z","title":"Hetis: Serving LLMs in heterogeneous GPU clusters with fine-grained and dynamic parallelism","venue":null,"work_id":"6db5da0b-6198-4750-867a-778296c60994","year":2025},"citing_paper":{"arxiv_id":"2606.00946","last_updated":"2026-05-31T01:31:02Z","snapshot_observed_at":"2026-07-06T23:41:34.459700Z","submitted_at":"2026-05-31T01:31:02Z","title":"Lodestar: An Online-Learning LLM Inference Router","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-06-28T16:55:38.764173Z"},"links":{"cited_paper":"/paper/2509.08309","citing_paper":"/paper/2606.00946"},"observation_digest":"sha256:f793531d4218fdf44a08f59937be06e71c7f9e88b2100c4d1890c5b0f980d655","observation_id":"38e3bb4d-7a66-4493-afca-66643d3f92db","resolution":{"observed_at":"2026-06-28T17:02:24.555133Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:55:38.764173Z","title":"MLaaS in the wild: Workload analysis and scheduling in large-scale heterogeneous GPU clus- ters","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.00946","last_updated":"2026-05-31T01:31:02Z","snapshot_observed_at":"2026-07-06T23:41:34.459700Z","submitted_at":"2026-05-31T01:31:02Z","title":"Lodestar: An Online-Learning LLM Inference Router","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-06-28T16:55:38.764173Z"},"links":{"citing_paper":"/paper/2606.00946"},"observation_digest":"sha256:992b9c70a712e4a3bbe06a690f99499cc9874366788ab7fa08e3abf136a4b8f2","observation_id":"2b2819f6-a766-4164-912d-ae396f199382","resolution":{"observed_at":"2026-06-28T16:55:38.764173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:55:38.764173Z","title":"Fast distributed inference serving for large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.00946","last_updated":"2026-05-31T01:31:02Z","snapshot_observed_at":"2026-07-06T23:41:34.459700Z","submitted_at":"2026-05-31T01:31:02Z","title":"Lodestar: An Online-Learning LLM Inference Router","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-06-28T16:55:38.764173Z"},"links":{"citing_paper":"/paper/2606.00946"},"observation_digest":"sha256:58e9ba40d9a6cafea9a1f2be6494e7af0d9abaa9624509f2133707e9cf5d32a1","observation_id":"05e0ed30-c358-4b29-9e7f-d4d318e45bb4","resolution":{"observed_at":"2026-06-28T16:55:38.764173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:55:38.764173Z","title":"Deserve: Towards affordable offline llm inference via decentralization, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00946","last_updated":"2026-05-31T01:31:02Z","snapshot_observed_at":"2026-07-06T23:41:34.459700Z","submitted_at":"2026-05-31T01:31:02Z","title":"Lodestar: An Online-Learning LLM Inference Router","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-06-28T16:55:38.764173Z"},"links":{"citing_paper":"/paper/2606.00946"},"observation_digest":"sha256:5d043a7e5afa32e5288f3cb6755d9d3b4e963d4e4a145ea84d828b2d5cf7db7c","observation_id":"c47311ce-efc5-496e-8bfd-636041df4c50","resolution":{"observed_at":"2026-06-28T16:55:38.764173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:55:38.764173Z","title":"Rum- ble, and Aaron Archer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00946","last_updated":"2026-05-31T01:31:02Z","snapshot_observed_at":"2026-07-06T23:41:34.459700Z","submitted_at":"2026-05-31T01:31:02Z","title":"Lodestar: An Online-Learning LLM Inference Router","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-06-28T16:55:38.764173Z"},"links":{"citing_paper":"/paper/2606.00946"},"observation_digest":"sha256:2abb952b9d95f70992b16ba02ab658f6031ebc6258a8463f65f32870d3fbbee8","observation_id":"05ee2cbb-5abb-45e3-893d-368014039462","resolution":{"observed_at":"2026-06-28T16:55:38.764173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.08448","last_updated":"2025-08-11T20:11:43Z","snapshot_observed_at":"2026-08-05T21:32:53.021643Z","submitted_at":"2025-08-11T20:11:43Z","title":"Towards Efficient and Practical GPU Multitasking in the Era of LLM","version":1},"cited_work":{"arxiv_id":"2508.08448","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.08448","snapshot_observed_at":"2026-06-28T17:02:24.558075Z","title":"Towards efficient and practical gpu multitasking in the era of llm.arXiv preprint arXiv:2508.08448, 2025","venue":null,"work_id":"5c3a90c4-a851-492a-883c-24bffb0afb63","year":2025},"citing_paper":{"arxiv_id":"2606.00946","last_updated":"2026-05-31T01:31:02Z","snapshot_observed_at":"2026-07-06T23:41:34.459700Z","submitted_at":"2026-05-31T01:31:02Z","title":"Lodestar: An Online-Learning LLM Inference Router","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-06-28T16:55:38.764173Z"},"links":{"cited_paper":"/paper/2508.08448","citing_paper":"/paper/2606.00946"},"observation_digest":"sha256:7c4c5da438f4844ba102e064b454f0bd42f1931ac69acbfb6cbfc943e18d5907","observation_id":"e3d61e0b-d6b7-46e0-8b5e-788e6e1d3500","resolution":{"observed_at":"2026-06-28T17:02:24.559538Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:55:38.764173Z","title":"Orca: A distributed serving system for Transformer-Based generative mod- els","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.00946","last_updated":"2026-05-31T01:31:02Z","snapshot_observed_at":"2026-07-06T23:41:34.459700Z","submitted_at":"2026-05-31T01:31:02Z","title":"Lodestar: An Online-Learning LLM Inference Router","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-06-28T16:55:38.764173Z"},"links":{"citing_paper":"/paper/2606.00946"},"observation_digest":"sha256:52d8eb06966c1d74866ad64711ba7a625b9705fc4c7200b04dd0c004cd330136","observation_id":"01b6bb0e-0428-4928-9221-6553eb7016fd","resolution":{"observed_at":"2026-06-28T16:55:38.764173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04021","last_updated":"2026-06-10T23:04:53Z","snapshot_observed_at":"2026-08-07T15:49:22.835029Z","submitted_at":"2025-05-06T23:38:33Z","title":"Prism: Cost-Efficient Multi-LLM Serving via GPU Memory Ballooning","version":3},"cited_work":{"arxiv_id":"2505.04021","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.04021","snapshot_observed_at":"2026-07-03T17:18:43.284498Z","title":"Prism: Unleashing gpu sharing for cost-efficient multi- llm serving","venue":"cs.DC","work_id":"b06d977c-d2bf-4367-bdeb-cd88d2f6fa4f","year":2025},"citing_paper":{"arxiv_id":"2606.00946","last_updated":"2026-05-31T01:31:02Z","snapshot_observed_at":"2026-07-06T23:41:34.459700Z","submitted_at":"2026-05-31T01:31:02Z","title":"Lodestar: An Online-Learning LLM Inference Router","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-06-28T16:55:38.764173Z"},"links":{"cited_paper":"/paper/2505.04021","citing_paper":"/paper/2606.00946"},"observation_digest":"sha256:2eab8c5e853de0194b46bb03c3125d98d3143ebf0507fae4903fa349326526b8","observation_id":"42673797-0ccd-42bd-983b-6fee4797fffd","resolution":{"observed_at":"2026-06-28T17:02:24.546059Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:55:38.764173Z","title":"Gonzalez, Ion Stoica, and Hao Zhang","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.00946","last_updated":"2026-05-31T01:31:02Z","snapshot_observed_at":"2026-07-06T23:41:34.459700Z","submitted_at":"2026-05-31T01:31:02Z","title":"Lodestar: An Online-Learning LLM Inference Router","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-06-28T16:55:38.764173Z"},"links":{"citing_paper":"/paper/2606.00946"},"observation_digest":"sha256:b55c086420987dd15b1f70b91c35e23e4f7a771dcb2c18215183afbb2fc0a5bb","observation_id":"0d267371-f70c-480c-962c-75eaec5c2d82","resolution":{"observed_at":"2026-06-28T16:55:38.764173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:55:38.764173Z","title":"Gonzalez, Clark Bar- rett, and Ying Sheng","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.00946","last_updated":"2026-05-31T01:31:02Z","snapshot_observed_at":"2026-07-06T23:41:34.459700Z","submitted_at":"2026-05-31T01:31:02Z","title":"Lodestar: An Online-Learning LLM Inference Router","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-06-28T16:55:38.764173Z"},"links":{"citing_paper":"/paper/2606.00946"},"observation_digest":"sha256:5920e1df40b35b516bcc011c7c5d9090376ed8ecbdca81d1aa716196fc76ba87","observation_id":"0d2f0d1f-3605-4787-96ff-95db13dea2ca","resolution":{"observed_at":"2026-06-28T16:55:38.764173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:55:38.764173Z","title":"Dist- serve: disaggregating prefill and decoding for goodput- optimized large language model serving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.00946","last_updated":"2026-05-31T01:31:02Z","snapshot_observed_at":"2026-07-06T23:41:34.459700Z","submitted_at":"2026-05-31T01:31:02Z","title":"Lodestar: An Online-Learning LLM Inference Router","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-06-28T16:55:38.764173Z"},"links":{"citing_paper":"/paper/2606.00946"},"observation_digest":"sha256:69ea93c038ba4e767b7b25545494fb3aedbe83d26c909b856e10e60957c12e0c","observation_id":"e3bbbe73-3f06-42a9-8ff9-f5359946746a","resolution":{"observed_at":"2026-06-28T16:55:38.764173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:55:38.764173Z","title":"NanoFlow: Towards optimal large language model serving through- put","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00946","last_updated":"2026-05-31T01:31:02Z","snapshot_observed_at":"2026-07-06T23:41:34.459700Z","submitted_at":"2026-05-31T01:31:02Z","title":"Lodestar: An Online-Learning LLM Inference Router","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-06-28T16:55:38.764173Z"},"links":{"citing_paper":"/paper/2606.00946"},"observation_digest":"sha256:631eeaabfe17924bb7277cd6575b06c0cc0249e053aef90c688459bbd48f2495","observation_id":"4284b26d-ad33-40c0-b6a2-18c6630bfce8","resolution":{"observed_at":"2026-06-28T16:55:38.764173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:55:38.764173Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00946","last_updated":"2026-05-31T01:31:02Z","snapshot_observed_at":"2026-07-06T23:41:34.459700Z","submitted_at":"2026-05-31T01:31:02Z","title":"Lodestar: An Online-Learning LLM Inference Router","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-06-28T16:55:38.764173Z"},"links":{"citing_paper":"/paper/2606.00946"},"observation_digest":"sha256:70180c47dfc62743c24e2e6e4f8c9b5e0ecee9a316c43a220069077dcf7b34c8","observation_id":"820e302b-728c-4eb3-bc88-a401534a9313","resolution":{"observed_at":"2026-06-28T16:55:38.764173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:55:38.764173Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00946","last_updated":"2026-05-31T01:31:02Z","snapshot_observed_at":"2026-07-06T23:41:34.459700Z","submitted_at":"2026-05-31T01:31:02Z","title":"Lodestar: An Online-Learning LLM Inference Router","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-06-28T16:55:38.764173Z"},"links":{"citing_paper":"/paper/2606.00946"},"observation_digest":"sha256:e9670b150ddde4d9c00923129baca23a29f453437cd3b795a1d2ccea004c37eb","observation_id":"cc6439f7-3c9c-4829-9d77-69565faf5d48","resolution":{"observed_at":"2026-06-28T16:55:38.764173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:55:38.764173Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00946","last_updated":"2026-05-31T01:31:02Z","snapshot_observed_at":"2026-07-06T23:41:34.459700Z","submitted_at":"2026-05-31T01:31:02Z","title":"Lodestar: An Online-Learning LLM Inference Router","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-06-28T16:55:38.764173Z"},"links":{"citing_paper":"/paper/2606.00946"},"observation_digest":"sha256:515cc48330fa6dc251070b8b975d25fe41bcd0a6f698a9a03208c8aa176ee6f7","observation_id":"58538f88-857b-43d9-98a4-b1b7c2afd3c1","resolution":{"observed_at":"2026-06-28T16:55:38.764173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T16:55:38.764173Z","title":"bitsandbytes is a popular on-the-fly quantization method that compress FP16 KV into INT4/INT8 when storing them","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00946","last_updated":"2026-05-31T01:31:02Z","snapshot_observed_at":"2026-07-06T23:41:34.459700Z","submitted_at":"2026-05-31T01:31:02Z","title":"Lodestar: An Online-Learning LLM Inference Router","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-06-28T16:55:38.764173Z"},"links":{"citing_paper":"/paper/2606.00946"},"observation_digest":"sha256:0ee630754a777ec190958e1181513a8dd52dca9d4e72b9496cb210e5803243f9","observation_id":"aead39e7-0333-471e-b78d-49076ff277b3","resolution":{"observed_at":"2026-06-28T16:55:38.764173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.00946","last_updated":"2026-05-31T01:31:02Z","latest_version":1,"primary_category":"cs.DC","snapshot_observed_at":"2026-07-06T23:41:34.459700Z","submitted_at":"2026-05-31T01:31:02Z","title":"Lodestar: An Online-Learning LLM Inference Router"},"reference_resolution":{"displayed":74,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":67,"verified_exact":6,"verified_fuzzy":0},"total_outbound_references":74},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 74 of 74 outbound references and 0 inbound Pith citation observations for arXiv:2606.00946."}