{"as_of":"2026-08-18T06:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4fdd5cc509fb823b1b89394d1bbbc4072679e2a2e89d7ac7b12f4c55333c7259","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T22:15:13.851365Z","state":"measured"},{"denominator":56,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":56,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:56:29.078219Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-15T20:56:29.568260Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"cited_work":{"arxiv_id":"2505.07680","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.07680","snapshot_observed_at":"2026-08-15T20:56:29.568260Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","venue":"cs.LG","work_id":"53c8106e-dbf9-4f20-aeaa-b71ffbdfe7eb","year":2025},"citing_paper":{"arxiv_id":"2506.01986","last_updated":"2025-05-16T22:12:29Z","snapshot_observed_at":"2026-08-17T19:26:28.026855Z","submitted_at":"2025-05-16T22:12:29Z","title":"SpecMemo: Speculative Decoding is in Your Pocket","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T20:56:29.078219Z"},"links":{"cited_paper":"/paper/2505.07680","citing_paper":"/paper/2506.01986"},"observation_digest":"sha256:6a19af9f841608ded0ad71d6a78213c6384ef91388e2c737658e516b3146db57","observation_id":"1cd74e9e-5057-4edf-ae45-d6f027a4af6e","resolution":{"observed_at":"2026-08-15T20:56:29.575242Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.07680/citation-record","integrity":"/paper/2505.07680/integrity","json":"/paper/2505.07680/citation-record.json","paper":"/paper/2505.07680"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:15:15.097719Z","title":"Scaling laws for generative mixed-modal language models","venue":null,"work_id":"49c90d54-8814-492c-b16c-2001bd0521bd","year":2023},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.553760Z"},"links":{"citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:a9bcb1288ce547d1254090c8ad2138f7579b7e0edbad87c23707cd8c8e31ad07","observation_id":"d2995a8d-f036-4819-a308-32611d4ef6f6","resolution":{"observed_at":"2026-08-15T22:15:15.103664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:15:15.067932Z","title":"S., Ramjee, R., and Tumanov, A","venue":null,"work_id":"3fe14e1e-8791-4553-8aaf-b3175a18952b","year":2024},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.559495Z"},"links":{"citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:6c47beb494d769be9df5b15d223d08142fe8b149eb92948e66f9ce21387677d2","observation_id":"51e7ce4e-9530-4bdd-8c55-dfab99b32278","resolution":{"observed_at":"2026-08-15T22:15:15.080205Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:15:15.046653Z","title":"In 18th USENIX Symposium on Operating Systems Design and Implementation (OSDI 24) (2024), pp","venue":null,"work_id":"c7589a1b-47f9-4883-9d25-3839ac42fa2c","year":2024},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.565871Z"},"links":{"citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:00f277947553679f9b3fa28995244bbb18fb1b664440ab84b17e02ba87593eb8","observation_id":"cd7a78cc-0220-445f-a606-f1bd28d5b8c3","resolution":{"observed_at":"2026-08-15T22:15:15.053511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10774","last_updated":"2024-06-14T23:32:32Z","snapshot_observed_at":"2026-08-17T10:13:54.763177Z","submitted_at":"2024-01-19T15:48:40Z","title":"Medusa: Simple LLM Inference Acceleration Framework with Multiple Decoding Heads","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10774","snapshot_observed_at":"2026-08-15T22:15:13.571386Z","title":"D., Chen, D., and Dao, T","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.571386Z"},"links":{"cited_paper":"/paper/2401.10774","citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:8e01cc6ebb9094504f880469a74abcf6198f1f35d44f8e7d61f8e8c666f5b305","observation_id":"6e03aba7-2a99-4de8-b68c-905a25151e7b","resolution":{"observed_at":"2026-08-15T22:15:13.571386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:15:15.022362Z","title":"On the entropy of language models in getting semantic from tokens","venue":null,"work_id":"cfd76e26-14ea-4aa3-95b7-6490f47a4294","year":null},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.577705Z"},"links":{"citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:752dd658d8f9342531ae6abb26908a0c2a17813f2eaf91f31e3d4b43d983808a","observation_id":"3bd13680-5b00-4892-ba00-a6a56f0361de","resolution":{"observed_at":"2026-08-15T22:15:15.029177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-15T22:15:13.583159Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.583159Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:78396e537cf44ce2509ebe5e8f35b66114235b8cac00452bb909e560da4b0b7c","observation_id":"99f3d4a4-63b4-45a4-b8af-57f28d8c9084","resolution":{"observed_at":"2026-08-15T22:15:13.583159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:15:15.003019Z","title":"Advances in Neural Information Processing Systems 37 (2024), 86226–86242","venue":null,"work_id":"7c659452-f2a4-4798-abc6-3081b966610e","year":2024},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.588329Z"},"links":{"citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:e4355be60b4cbd90644a20943f0c12ebd47b581ca3eb394730994f9bb9874479","observation_id":"fbb67b4f-8283-428e-a768-e65ff7139b35","resolution":{"observed_at":"2026-08-15T22:15:15.009246Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:15:14.984304Z","title":"Nvidia a100 gpu: Performance & innovation for gpu computing","venue":null,"work_id":"caa507da-cad4-4507-9024-9f14a38f1fd4","year":2020},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.594918Z"},"links":{"citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:249210d1fdd1f698eee000969d9ff6220fb9134726e5dfb2cb3cb2f0c0fb138c","observation_id":"054900d8-8fcd-4289-8adb-ba16e784ed72","resolution":{"observed_at":"2026-08-15T22:15:14.990425Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:15:14.966610Z","title":"W., Sutton, C., Gehrmann, S., et al","venue":null,"work_id":"ae096f48-4483-4755-aae0-596a8ee479ae","year":2023},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.600193Z"},"links":{"citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:64fc1f04d35616deea5973e5e050f0d544afc3857511668a47efb8e7f2e46a48","observation_id":"74c27c97-03d4-4224-883c-4c6c176fcbe5","resolution":{"observed_at":"2026-08-15T22:15:14.972225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:15:14.950340Z","title":"Unified scaling laws for routed language models","venue":null,"work_id":"4f11eef4-52d7-43d3-95fb-484df090d646","year":2022},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.605893Z"},"links":{"citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:b66dcfc7dff713b6c0c11741a6a33d522681874d131cfc0479fea66ef18afc91","observation_id":"11b0c632-31d9-43db-9df0-60dff021d1da","resolution":{"observed_at":"2026-08-15T22:15:14.955648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-15T22:15:13.611689Z","title":"Train- ing verifiers to solve math word problems, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.611689Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:63a5c0a332be343247326a6d7acacf7f7da17b00ef35bc4aae1604bb2b2f03e4","observation_id":"47e1aba1-1411-4734-a441-fb0c8731d684","resolution":{"observed_at":"2026-08-15T22:15:13.611689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:15:14.931531Z","title":"J., Gonzalez, J","venue":null,"work_id":"91444502-3ad7-4356-816d-5c78dc89e28b","year":2017},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.617019Z"},"links":{"citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:4385a24161f540ae4a4af5235c56fd00c0363db77938d4908df1944390e92dcc","observation_id":"3d63a160-07f7-446b-a26d-ae2a40851224","resolution":{"observed_at":"2026-08-15T22:15:14.937357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10277","last_updated":"2024-08-17T15:47:39Z","snapshot_observed_at":"2026-08-16T13:25:49.911468Z","submitted_at":"2024-08-17T15:47:39Z","title":"Increasing transformer token length with a Maximum Entropy Principle Method","version":1},"cited_work":{"arxiv_id":"2408.10277","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.10277","snapshot_observed_at":"2026-08-15T22:15:14.264434Z","title":"Increasing transformer token length with a Maximum Entropy Principle Method","venue":"cs.LG","work_id":"0978416a-cd3b-4607-ac12-cd009e734907","year":2024},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.622247Z"},"links":{"cited_paper":"/paper/2408.10277","citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:a022763a60fc60866a6aab3866dd459f8496947d9bc3ef6ca1e589ced181f5c3","observation_id":"28cd6802-0e0e-4d37-8765-71c051e19b11","resolution":{"observed_at":"2026-08-15T22:15:14.272768Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:15:14.912821Z","title":"Graphrouter: A graph-based router for llm selections","venue":null,"work_id":"a3f3de95-7e22-46da-af6e-75a74bfde46a","year":2024},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.627914Z"},"links":{"citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:aadb085a071d5699a2fd83b415033c6f4424e64469d7d8907910ce947b173a5e","observation_id":"44e5dcae-d9db-4653-aafd-ccdfede57688","resolution":{"observed_at":"2026-08-15T22:15:14.918581Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:15:14.896435Z","title":"{ServerlessLLM}:{Low-Latency} serverless inference for large language models","venue":null,"work_id":"49e34deb-a2a0-437a-89d7-6621c4a7c738","year":2024},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.632648Z"},"links":{"citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:9c4eed24e1dbd0c917e9192a8bfd61e1906ef7c844c71ee3e56794ff3488b50b","observation_id":"f876072d-4cdb-4f27-853f-bd923e951340","resolution":{"observed_at":"2026-08-15T22:15:14.901868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-15T22:15:13.637412Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.637412Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:7cf53c6bdf647a3b81acd3994c91dd94cf41229306d861cb7b09c2aecfaa76bd","observation_id":"c795fa38-6b7c-4592-8de1-5c8294cff007","resolution":{"observed_at":"2026-08-15T22:15:13.637412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:15:14.875966Z","title":"In 21st USENIX Symposium on Networked Systems Design and Implementation (NSDI 24) (2024), pp","venue":null,"work_id":"15793131-716c-46f6-90fa-aba7613f0b99","year":2024},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.642920Z"},"links":{"citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:41540faff66b8ed852f4d0eaac9bc26c8a09905326fe527034252bca7cd8941d","observation_id":"da1d88a5-dcc1-4579-bea9-726441ed5dc3","resolution":{"observed_at":"2026-08-15T22:15:14.882826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:15:13.647987Z","title":"Specserve: Efficient and slo-aware large language model serving with adaptive speculative decoding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.647987Z"},"links":{"citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:1c3a65208cd5bb2425d549936551465bb776fd2f312588de8f3755a208124650","observation_id":"9a354ea9-a7f3-41ee-b45f-0613632006cd","resolution":{"observed_at":"2026-08-15T22:15:13.647987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:15:14.856562Z","title":null,"venue":null,"work_id":"c7614dc4-a03e-4dce-8089-1faf6858e192","year":1986},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.652985Z"},"links":{"citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:3db27ee21add29e8b4bbea9d62f20871faad2dc66a6cc6a682161b03b5811bf8","observation_id":"57506a0d-7b31-45ab-be90-760a58573601","resolution":{"observed_at":"2026-08-15T22:15:14.862814Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:15:14.840290Z","title":null,"venue":null,"work_id":"7fe1468a-1180-4e59-8054-81f19f45993b","year":2024},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.659048Z"},"links":{"citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:8af1e020d075b0dc3984ea640cfbbc59847f08550edfcc10380d8bd828164978","observation_id":"b4fc5202-ea58-4a94-86d7-83e88ba75fa7","resolution":{"observed_at":"2026-08-15T22:15:14.845396Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-15T22:15:13.664620Z","title":"B., Chess, B., Child, R., Gray, S., Radford, A., Wu, J., and Amodei, D.Scaling laws for neural language models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.664620Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:ff0fd7948cadc468c5d9d4315fc85d207b9f2a42fb954a24047b2c3620e1a57e","observation_id":"c85f4f96-ec80-4b5c-8a18-36a0533d44e4","resolution":{"observed_at":"2026-08-15T22:15:13.664620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:15:14.822872Z","title":"H., Gonza- lez, J","venue":null,"work_id":"449ecd4a-943f-4901-be92-371212a2d807","year":2023},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.670542Z"},"links":{"citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:15829f3287b8037e0a4e5534043640f863dfe562afa3b9b3519521e211319481","observation_id":"63c2c6a9-3775-4983-bcfc-232358a10a72","resolution":{"observed_at":"2026-08-15T22:15:14.828587Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:15:14.803194Z","title":null,"venue":null,"work_id":"1dd08a61-f4d4-49c1-acfd-a38d2c8b9aaa","year":2023},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.676139Z"},"links":{"citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:487384861d4224a99b96b88593dd7930d4d2935dca66549d840610c9208e19eb","observation_id":"80794bdd-b602-4d3d-8d05-6805d9ac8e73","resolution":{"observed_at":"2026-08-15T22:15:14.808680Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:15:14.786662Z","title":"In 18th USENIX Symposium on Operating Systems Design and Implementation (OSDI 24) (2024), pp","venue":null,"work_id":"0d04f655-0a6d-433b-9ee3-52c3ad7be9e9","year":2024},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.681405Z"},"links":{"citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:77f996431de8453b81b82b4cab4835df8fd17b36004b3074af913cb31f74d018","observation_id":"03c90b20-eb62-403b-ac10-66239d09b33b","resolution":{"observed_at":"2026-08-15T22:15:14.792041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:15:13.686186Z","title":"Fast inference from transformers via speculative decoding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.686186Z"},"links":{"citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:36754383c499863f0d1fb1ef74cb411f4eef9b6ecdc0aa091fc259a98b79c4ca","observation_id":"f546f64c-c898-48d4-bf16-cecf5f431917","resolution":{"observed_at":"2026-08-15T22:15:13.686186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:15:14.756645Z","title":"Static batching of irregular workloads on gpus: Framework and application to efficient moe model inference, 2025","venue":null,"work_id":"a4d376dd-59f1-4245-91ec-ba077eed66dc","year":2025},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.691282Z"},"links":{"citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:22cb556dff2c4335e8bcfb0cd9fc417de2371fdad9a4b2a579bc42eaf16dd2b1","observation_id":"b2e63812-374d-4dc8-9e00-d9f8644c0db3","resolution":{"observed_at":"2026-08-15T22:15:14.763032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:15:14.738887Z","title":"In International Conference on Machine Learning (2024)","venue":null,"work_id":"b00765f3-1022-4c43-ac70-ab02462d3ce9","year":2024},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.696497Z"},"links":{"citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:721cd6640ae73147a288207fd143e7b9eb4c0de415aa7e4ba7e7b3d3db0aa91f","observation_id":"00425c87-dad2-4973-920f-b39b6da1dfc8","resolution":{"observed_at":"2026-08-15T22:15:14.743595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:15:14.721210Z","title":"EAGLE-3: Scaling up in- ference acceleration of large language models via training-time test, 2025","venue":null,"work_id":"b68103d7-ea0b-4147-8bcd-ae3973279f24","year":2025},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.701403Z"},"links":{"citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:e709cb8e10c27d7c5cfc27345221947cabf3524ce3ff384cc94335ca03bbeffc","observation_id":"8aab46b4-5e4a-4bbe-a148-bb81d92b6af3","resolution":{"observed_at":"2026-08-15T22:15:14.726931Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12162","last_updated":"2025-05-17T07:09:10Z","snapshot_observed_at":"2026-08-14T19:50:19.511079Z","submitted_at":"2025-01-21T14:15:01Z","title":"AdaServe: Accelerating Multi-SLO LLM Serving with SLO-Customized Speculative Decoding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12162","snapshot_observed_at":"2026-08-15T22:15:13.707025Z","title":"Adaserve: Slo-customized llm serving with fine-grained speculative decoding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.707025Z"},"links":{"cited_paper":"/paper/2501.12162","citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:ddcee032ee917a29b27fcac71c1d749b612294d04d1afa2b1e1c4b1e16ecba2a","observation_id":"0f9ab5f9-6cbb-49bd-a34e-65ac06638bbe","resolution":{"observed_at":"2026-08-15T22:15:13.707025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02669","last_updated":"2024-07-04T15:12:54Z","snapshot_observed_at":"2026-08-17T04:58:55.259763Z","submitted_at":"2024-01-05T06:53:00Z","title":"Infinite-LLM: Efficient LLM Service for Long Context with DistAttention and Distributed KVCache","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02669","snapshot_observed_at":"2026-08-15T22:15:13.711912Z","title":"Infinite-llm: Efficient llm service for long context with distattention and distributed kvcache.arXiv preprint arXiv:2401.02669 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.711912Z"},"links":{"cited_paper":"/paper/2401.02669","citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:70a59fef1b27159053d64adba7ed3292bf9159d17b35bd893947fef1a3b6ad79","observation_id":"3d83a165-af28-4402-96b4-3953b225a919","resolution":{"observed_at":"2026-08-15T22:15:13.711912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:15:14.700316Z","title":"Parrot: Efficient serving of{LLM-based} applications with semantic variable","venue":null,"work_id":"9c12d1fa-4e1b-4735-953a-34ee33570390","year":2024},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.717686Z"},"links":{"citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:015d968682ca6f56193cc75a2501d34a96204796714569db1bd8f66ceab02426","observation_id":"8cefd015-1403-487b-a0c4-3f0db079b6aa","resolution":{"observed_at":"2026-08-15T22:15:14.708536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-15T17:27:11.980940Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-15T22:15:13.723164Z","title":"Deepseek-v3 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.723164Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:32d92fb9271f85b83ac730276ca7e4584e80a592f1f45c9926a24f4eea8c07c3","observation_id":"e9fe6c4a-47e6-4876-b6f9-f274be228282","resolution":{"observed_at":"2026-08-15T22:15:13.723164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:15:14.681427Z","title":"In The Thirteenth International Conference on Learning Representations (2025)","venue":null,"work_id":"cb3473f9-2044-46fa-89dd-154ef2fa45b6","year":2025},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.729212Z"},"links":{"citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:5b503e2367f9ac093bd3f51c5df45a8afdf252a65156e85c346c76c25046655e","observation_id":"c2989215-92c3-4a70-8037-c845dcfddde8","resolution":{"observed_at":"2026-08-15T22:15:14.686809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:15:14.659236Z","title":"A., Xie, G., Zhan, J., Zhang, H., Hjálmt `ysson, G., and Greenberg, A","venue":null,"work_id":"507e3a11-cef4-4e3a-bc56-24f9f7399d15","year":2004},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.734325Z"},"links":{"citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:b81c1f18bf0ab54f27129052044c3b1ea25c5ce30af4c876c4609f476f89d1e4","observation_id":"0d188986-b388-4c14-b1ef-744f74994c0d","resolution":{"observed_at":"2026-08-15T22:15:14.665357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:15:14.636555Z","title":null,"venue":null,"work_id":"1b0b6bd3-67e5-49c6-978f-729c70d729d6","year":2024},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.740476Z"},"links":{"citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:1d38a8f47a666920267115746f701f5772c2b0cd5cf04ce2faa92a5296cd602b","observation_id":"cbdd3b13-c800-4b6f-96f9-632a2fbfd003","resolution":{"observed_at":"2026-08-15T22:15:14.642339Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:15:14.610645Z","title":"E., Kadous, M","venue":null,"work_id":"c1ddb295-9442-4ced-acb6-ebb506f057ba","year":2024},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.746940Z"},"links":{"citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:fea9be0ce1588b9daa254a535f4673e78f24aebd8a6e74fa30117f735a7ea31c","observation_id":"929e9577-67e5-4aa3-bb8b-17e59335794b","resolution":{"observed_at":"2026-08-15T22:15:14.615755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.01703","last_updated":"2019-12-03T22:06:05Z","snapshot_observed_at":"2026-07-06T08:41:49.632205Z","submitted_at":"2019-12-03T22:06:05Z","title":"PyTorch: An Imperative Style, High-Performance Deep Learning Library","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.01703","snapshot_observed_at":"2026-08-15T22:15:13.752670Z","title":"Pytorch: An imperative style, high-performance deep learning library","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.752670Z"},"links":{"cited_paper":"/paper/1912.01703","citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:bbc12902466c6ae57d67c589dcb813b3d38e8e21a97607d5b166040f9786b17a","observation_id":"69e60518-c607-4f91-87c7-b2fcb5e1152e","resolution":{"observed_at":"2026-08-15T22:15:13.752670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:15:14.593096Z","title":"Mooncake: Trading more storage for less computation—a {KVCache-centric} architecture for serving{LLM} chatbot","venue":null,"work_id":"24ddc506-3498-4191-bbe1-b3b12fafcad0","year":2025},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.758219Z"},"links":{"citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:568001ba5f5f85dc69bfcb8ac5373026de2e12acba45b571a5d9b94172574fd2","observation_id":"134d94a4-9a71-4a1a-8de2-3918edd1cbe4","resolution":{"observed_at":"2026-08-15T22:15:14.598715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:15:14.575725Z","title":"S., Jha, S., Kalbarczyk, Z","venue":null,"work_id":"cf2e7297-f7de-4e9f-b9c8-1c54893adccc","year":2020},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.763812Z"},"links":{"citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:6911b57873205ed4549c1dfdc25840b0b5a8e069b064b8b87b4a7e34933db652","observation_id":"109e5710-3256-4ac8-8fde-fb1d9ac954f4","resolution":{"observed_at":"2026-08-15T22:15:14.580875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03057","last_updated":"2022-10-06T17:03:34Z","snapshot_observed_at":"2026-07-06T14:00:37.875054Z","submitted_at":"2022-10-06T17:03:34Z","title":"Language Models are Multilingual Chain-of-Thought Reasoners","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03057","snapshot_observed_at":"2026-08-15T22:15:13.770008Z","title":"W., Tay, Y., Ruder, S., Zhou, D., et al","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.770008Z"},"links":{"cited_paper":"/paper/2210.03057","citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:826bbe3f19b08b1dc45331662fa8ae45fbd8a5509ad1a7875b9d6bae1ac1ea30","observation_id":"f33d1552-9d73-4d98-a5f2-64ffd0f1c1e6","resolution":{"observed_at":"2026-08-15T22:15:13.770008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:15:14.557721Z","title":"In Proceedings of the ACM SIGOPS 30th Symposium on Operating Systems Principles(2024), pp","venue":null,"work_id":"86e81db4-58fe-467f-95f8-a62d5c1c7992","year":2024},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.775595Z"},"links":{"citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:b67a83271a920d4c2f17bb30207aaa7b032948b22381e967e6035509252062e5","observation_id":"e425b137-2575-495e-9973-86f42dce87ac","resolution":{"observed_at":"2026-08-15T22:15:14.564202Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:15:14.540810Z","title":"Llumnix: Dynamic scheduling for large language model serving","venue":null,"work_id":"06744d78-cbab-4293-8dec-f077d35cdff9","year":2024},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.780511Z"},"links":{"citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:4ff00d1ea384f02c419a91236c91da4123de2d14e0f6caa88c9fd8b2acf11f49","observation_id":"6a6dc703-de01-4f34-ae88-a4ce4fb2e85b","resolution":{"observed_at":"2026-08-15T22:15:14.546263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-15T22:15:13.786730Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.786730Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:7cbe07858d7497e0aa2ea14f08b0f30560e8a19475b131158f6705b6f6e9947d","observation_id":"e14f3436-8cb5-40fd-8527-d71aff84aa03","resolution":{"observed_at":"2026-08-15T22:15:13.786730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:15:14.520546Z","title":"N., Kaiser, Ł., and Polosukhin, I","venue":null,"work_id":"3e9b8c00-49e7-41fe-927e-2d3e0ee99c57","year":2017},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.791983Z"},"links":{"citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:fde8a4e13161197978e440ccec152076ac7d702e3dcbae9489d04cf7cc6c6d0b","observation_id":"8a8beda3-dd0c-4dd6-b58d-2b3621bd4fc0","resolution":{"observed_at":"2026-08-15T22:15:14.526139Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:15:14.501756Z","title":"In Proceedings of the 2020 conference on empirical methods in natural language processing: system demonstrations (2020), pp","venue":null,"work_id":"0a40f02f-8217-45b2-bd19-401adaf325f3","year":2020},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.797021Z"},"links":{"citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:f95ffe3d1c61568d53252360ff2b008dca2bf78451b91cb05c68e3330130aab3","observation_id":"a004264e-896b-429b-9c36-1ce0ea5e3a8b","resolution":{"observed_at":"2026-08-15T22:15:14.507776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:15:14.480867Z","title":"Loongserve: Efficiently serving long-context large language models with elastic se- quence parallelism","venue":null,"work_id":"13a06d7a-aee2-48fc-84f9-93195122b4b5","year":2024},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.802740Z"},"links":{"citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:e1654948150b377db034a884c2879f92d70a96ce90a161e88a9c87d8e1b0e636","observation_id":"5fc0c6f5-5a40-40b9-b4af-56e9949e3cb1","resolution":{"observed_at":"2026-08-15T22:15:14.489109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:15:14.459924Z","title":"Advances in Neural Information Processing Systems 37 (2024), 128082–128117","venue":null,"work_id":"80e99d97-3268-4aef-86e1-058ce66f631c","year":2024},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.807607Z"},"links":{"citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:75889bde12ec8d6923858a6a561a924d392b9b070ab0d93d2f29f62872a96141","observation_id":"f7782d39-c43a-4d1c-93e2-9c6abe52c1a9","resolution":{"observed_at":"2026-08-15T22:15:14.466002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:15:14.442540Z","title":"S., Kim, G.-W., Kim, S., and Chun, B.-G","venue":null,"work_id":"28e88b07-5770-4fcc-81ba-ff3d4ec60414","year":2022},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.812611Z"},"links":{"citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:9790de168b75ce5c5250d17f3d5519f346e8898f3e650a980873679bd39b42d1","observation_id":"66bbdaa8-5bcd-4e26-850e-7403018ef09d","resolution":{"observed_at":"2026-08-15T22:15:14.447709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:15:14.423981Z","title":"Fast and live model auto scaling with o(1) host caching, 2024","venue":null,"work_id":"d5307826-7490-4ebf-8053-aca1335cad37","year":2024},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.817817Z"},"links":{"citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:19f4ebab5588bdc72122c67657ca3ae749f8881727cb74df33b42eb49ca65812","observation_id":"51c3b9f8-a77b-4815-afb2-bc691f243a19","resolution":{"observed_at":"2026-08-15T22:15:14.430057Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11021","last_updated":"2025-02-16T07:08:47Z","snapshot_observed_at":"2026-08-16T12:58:03.551106Z","submitted_at":"2025-02-16T07:08:47Z","title":"Leveraging Uncertainty Estimation for Efficient LLM Routing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11021","snapshot_observed_at":"2026-08-15T22:15:13.822890Z","title":"Leveraging uncertainty estimation for efficient llm routing","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.822890Z"},"links":{"cited_paper":"/paper/2502.11021","citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:a7a02337fb643aa26b90f0a3ca1034de2c58f198d206885f955e460aec4d64e3","observation_id":"6739893d-ff97-475b-91e0-401f09fa0b41","resolution":{"observed_at":"2026-08-15T22:15:13.822890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:15:14.403201Z","title":"Judging llm-as-a-judge with mt- bench and chatbot arena","venue":null,"work_id":"81c08571-9e35-4008-84eb-8a6cdcf245bc","year":2023},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.827969Z"},"links":{"citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:346e0a7aec104cbab4c8cbbe69877c4456f1c6a41636c94e505d8b0482afd4d7","observation_id":"41c72e65-dc45-4332-8e6f-e4cbc9b76dab","resolution":{"observed_at":"2026-08-15T22:15:14.409915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:15:14.385380Z","title":"L., Huang, J., Yu, C","venue":null,"work_id":"c7826d77-01ab-4e90-8eb2-7bd715584709","year":2024},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.833773Z"},"links":{"citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:70ea1aae0aafcc813a4e7858e0651f52457317e791f1051a2710ab3bd9d5dd58","observation_id":"c05f7756-4730-43c9-9071-9a9e784ab483","resolution":{"observed_at":"2026-08-15T22:15:14.391163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:15:14.364493Z","title":"{DistServe}: Disaggregating prefill and decoding for goodput- optimized large language model serving","venue":null,"work_id":"2411cac4-3fd5-4fbe-868d-9a29db330377","year":2024},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.840499Z"},"links":{"citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:f451e64db3b6863a35abe3caf0fb53e7076a1bc7c1d267fa79ed6e8979cab0c3","observation_id":"3471d54a-77c1-469b-b20a-0bd0201c21c2","resolution":{"observed_at":"2026-08-15T22:15:14.371621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14294","last_updated":"2024-07-19T04:47:36Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T15:53:08Z","title":"A Survey on Efficient Inference for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14294","snapshot_observed_at":"2026-08-15T22:15:13.845648Z","title":"A survey on efficient inference for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.845648Z"},"links":{"cited_paper":"/paper/2404.14294","citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:571db35d485ef64f4b0debe970452d54040b5fd5dcec0e5b6c5131b833675c87","observation_id":"f6701ae3-4171-4835-b23e-104270ec9493","resolution":{"observed_at":"2026-08-15T22:15:13.845648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.08461","last_updated":"2025-03-11T14:10:58Z","snapshot_observed_at":"2026-08-16T13:46:00.829569Z","submitted_at":"2025-03-11T14:10:58Z","title":"FastCache: Optimizing Multimodal LLM Serving through Lightweight KV-Cache Compression Framework","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.08461","snapshot_observed_at":"2026-08-15T22:15:13.851365Z","title":"arXiv preprint arXiv:2503.08461 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T22:15:13.851365Z"},"links":{"cited_paper":"/paper/2503.08461","citing_paper":"/paper/2505.07680"},"observation_digest":"sha256:da17900a61e000c81564819bd3328720965464647074dd08ba22f07104b8e351","observation_id":"9493b1f5-425f-4d97-b9d1-ed847f7de737","resolution":{"observed_at":"2026-08-15T22:15:13.851365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.07680","last_updated":"2025-05-12T15:46:28Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-16T23:08:06.180581Z","submitted_at":"2025-05-12T15:46:28Z","title":"SpecRouter: Adaptive Routing for Multi-Level Speculative Decoding in Large Language Models"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":1,"verified_fuzzy":34},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 1 inbound Pith citation observation for arXiv:2505.07680."}