{"as_of":"2026-08-17T18:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b832fc3cd9f8686da1e621f3567c0336c719359a84d2eb4d4b671dd859fbc171","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:11:02.936052Z","state":"measured"},{"denominator":34,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":34,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.17074/citation-record","integrity":"/paper/2505.17074/integrity","json":"/paper/2505.17074/citation-record.json","paper":"/paper/2505.17074"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:11:03.364685Z","title":"Tam- ing throughput-latency tradeoff in llm inference with sarathi-serve","venue":null,"work_id":"afb8908d-b71f-49d7-bbcb-984f26a322bf","year":2024},"citing_paper":{"arxiv_id":"2505.17074","last_updated":"2025-05-20T04:12:37Z","snapshot_observed_at":"2026-08-15T23:43:38.164393Z","submitted_at":"2025-05-20T04:12:37Z","title":"Semi-Clairvoyant Scheduling of Speculative Decoding Requests to Minimize LLM Inference Latency","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T20:11:02.785380Z"},"links":{"citing_paper":"/paper/2505.17074"},"observation_digest":"sha256:6b36b34ff2bd7e4772a5f9ec049a684aea36bebf62858e7a4533d8e4760ea844","observation_id":"42d5a527-ab7b-4ab9-8743-244263d7e28b","resolution":{"observed_at":"2026-08-15T20:11:03.368899Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:11:02.807182Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.17074","last_updated":"2025-05-20T04:12:37Z","snapshot_observed_at":"2026-08-15T23:43:38.164393Z","submitted_at":"2025-05-20T04:12:37Z","title":"Semi-Clairvoyant Scheduling of Speculative Decoding Requests to Minimize LLM Inference Latency","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T20:11:02.807182Z"},"links":{"citing_paper":"/paper/2505.17074"},"observation_digest":"sha256:555d2e6c73bba3a7e0bf217cd5041051d45b7131f5083ea3de542a584d666867","observation_id":"9a25e2fb-e788-40b3-b8a5-063e15e7b745","resolution":{"observed_at":"2026-08-15T20:11:02.807182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.01318","last_updated":"2023-02-02T18:44:11Z","snapshot_observed_at":"2026-08-13T23:55:57.074762Z","submitted_at":"2023-02-02T18:44:11Z","title":"Accelerating Large Language Model Decoding with Speculative Sampling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.01318","snapshot_observed_at":"2026-08-15T20:11:02.817294Z","title":"Accelerating large language model de- coding with speculative sampling","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17074","last_updated":"2025-05-20T04:12:37Z","snapshot_observed_at":"2026-08-15T23:43:38.164393Z","submitted_at":"2025-05-20T04:12:37Z","title":"Semi-Clairvoyant Scheduling of Speculative Decoding Requests to Minimize LLM Inference Latency","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T20:11:02.817294Z"},"links":{"cited_paper":"/paper/2302.01318","citing_paper":"/paper/2505.17074"},"observation_digest":"sha256:2d154bd1bcdb5ac5b4c6741c8c6240dcf98e667cd6db88da7e9454d17eb3cdf1","observation_id":"8a0c9b30-9bfa-472d-9dfc-1f4b53200f03","resolution":{"observed_at":"2026-08-15T20:11:02.817294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:11:03.312279Z","title":"Luan, Zhou Su, and Jing Deng","venue":null,"work_id":"7d600eff-853b-46e7-a41b-45d1ed982cf2","year":2025},"citing_paper":{"arxiv_id":"2505.17074","last_updated":"2025-05-20T04:12:37Z","snapshot_observed_at":"2026-08-15T23:43:38.164393Z","submitted_at":"2025-05-20T04:12:37Z","title":"Semi-Clairvoyant Scheduling of Speculative Decoding Requests to Minimize LLM Inference Latency","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T20:11:02.825252Z"},"links":{"citing_paper":"/paper/2505.17074"},"observation_digest":"sha256:8e38b0097615b6436abc99d5d64eb2a089008651a3a33552bff26ab9cc0041a1","observation_id":"31283eb5-b362-4c02-b03b-7dab19401254","resolution":{"observed_at":"2026-08-15T20:11:03.315834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19715","last_updated":"2025-07-11T01:33:18Z","snapshot_observed_at":"2026-08-16T13:47:55.108954Z","submitted_at":"2024-05-30T05:49:38Z","title":"SpecDec++: Boosting Speculative Decoding via Adaptive Candidate Lengths","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19715","snapshot_observed_at":"2026-08-15T20:11:02.834235Z","title":"Specdec++: Boosting speculative de- coding via adaptive candidate lengths","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17074","last_updated":"2025-05-20T04:12:37Z","snapshot_observed_at":"2026-08-15T23:43:38.164393Z","submitted_at":"2025-05-20T04:12:37Z","title":"Semi-Clairvoyant Scheduling of Speculative Decoding Requests to Minimize LLM Inference Latency","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T20:11:02.834235Z"},"links":{"cited_paper":"/paper/2405.19715","citing_paper":"/paper/2505.17074"},"observation_digest":"sha256:a5765d4a3da48fda9b5293193515cd4e155168e2e79b0800f0609d70c5442008","observation_id":"869aa006-063e-4a71-99e2-52cb0abc13e4","resolution":{"observed_at":"2026-08-15T20:11:02.834235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.07447","last_updated":"2026-07-05T13:47:06Z","snapshot_observed_at":"2026-08-16T13:00:58.873725Z","submitted_at":"2024-11-12T00:10:34Z","title":"Saving GPU Hours in LLM Inference System Development and Online Workloads with Simulation and DBMS-Inspired Cache Replacement Policies","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.07447","snapshot_observed_at":"2026-08-15T20:11:02.838412Z","title":"The effect of schedul- ing and preemption on the efficiency of llm inference serv- ing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17074","last_updated":"2025-05-20T04:12:37Z","snapshot_observed_at":"2026-08-15T23:43:38.164393Z","submitted_at":"2025-05-20T04:12:37Z","title":"Semi-Clairvoyant Scheduling of Speculative Decoding Requests to Minimize LLM Inference Latency","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T20:11:02.838412Z"},"links":{"cited_paper":"/paper/2411.07447","citing_paper":"/paper/2505.17074"},"observation_digest":"sha256:53122b1ede11437bf670018b247bc6148800fddc9962742219082c6057d97fac","observation_id":"301a5537-351b-43a9-8537-4fcb47795eab","resolution":{"observed_at":"2026-08-15T20:11:02.838412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:11:03.289313Z","title":"Efficient memory management for large language model serving with pagedattention","venue":null,"work_id":"be59103f-4fc7-4061-a243-bf9075a87e5e","year":2023},"citing_paper":{"arxiv_id":"2505.17074","last_updated":"2025-05-20T04:12:37Z","snapshot_observed_at":"2026-08-15T23:43:38.164393Z","submitted_at":"2025-05-20T04:12:37Z","title":"Semi-Clairvoyant Scheduling of Speculative Decoding Requests to Minimize LLM Inference Latency","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T20:11:02.844144Z"},"links":{"citing_paper":"/paper/2505.17074"},"observation_digest":"sha256:30cfe5c20fdb3bb347d2f1238dc2b31aa16d6fb7850b2055daf32842fee7010c","observation_id":"aded8af9-435f-40c4-b563-86738ff85e69","resolution":{"observed_at":"2026-08-15T20:11:03.294279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:11:03.278413Z","title":"Incorporating spec- ulative execution into scheduling of control-flow-intensive designs","venue":null,"work_id":"7bf9284d-2010-454c-a782-1029477e17fa","year":2000},"citing_paper":{"arxiv_id":"2505.17074","last_updated":"2025-05-20T04:12:37Z","snapshot_observed_at":"2026-08-15T23:43:38.164393Z","submitted_at":"2025-05-20T04:12:37Z","title":"Semi-Clairvoyant Scheduling of Speculative Decoding Requests to Minimize LLM Inference Latency","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T20:11:02.848432Z"},"links":{"citing_paper":"/paper/2505.17074"},"observation_digest":"sha256:4383c4a7241c0e6538fdd4a07d5f1b6366fe0e961eae3c047aea48245fee2c79","observation_id":"7ef105d9-26f5-4bb8-83a3-fbbb544b1ef4","resolution":{"observed_at":"2026-08-15T20:11:03.281661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:11:03.255712Z","title":"Al- paserve: Statistical multiplexing with model parallelism for deep learning serving","venue":null,"work_id":"49a8a8a4-8f43-4547-9988-85b89cd3fd1b","year":2023},"citing_paper":{"arxiv_id":"2505.17074","last_updated":"2025-05-20T04:12:37Z","snapshot_observed_at":"2026-08-15T23:43:38.164393Z","submitted_at":"2025-05-20T04:12:37Z","title":"Semi-Clairvoyant Scheduling of Speculative Decoding Requests to Minimize LLM Inference Latency","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T20:11:02.855382Z"},"links":{"citing_paper":"/paper/2505.17074"},"observation_digest":"sha256:e00f2ffa524f224d3f48b0f80b6389c58e2d7a2b0b2139ab0ee5eb8d9f2c26c4","observation_id":"ddd5ed51-0972-44ff-8844-db2124302450","resolution":{"observed_at":"2026-08-15T20:11:03.259600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:11:03.244646Z","title":"Specpim: Accel- erating speculative inference on pim-enabled system via architecture-dataflow co-exploration","venue":null,"work_id":"de9ab60f-c14c-42fa-ad43-3e9472996099","year":2024},"citing_paper":{"arxiv_id":"2505.17074","last_updated":"2025-05-20T04:12:37Z","snapshot_observed_at":"2026-08-15T23:43:38.164393Z","submitted_at":"2025-05-20T04:12:37Z","title":"Semi-Clairvoyant Scheduling of Speculative Decoding Requests to Minimize LLM Inference Latency","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T20:11:02.859162Z"},"links":{"citing_paper":"/paper/2505.17074"},"observation_digest":"sha256:e52ff339d4ede297ea324b67d5c97983e9ddde9d082045ac81a756ccde32ac40","observation_id":"9f98bf74-a110-4dce-994d-1b19faa538de","resolution":{"observed_at":"2026-08-15T20:11:03.248622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14066","last_updated":"2025-07-27T03:20:41Z","snapshot_observed_at":"2026-08-16T13:41:12.991651Z","submitted_at":"2024-06-20T07:43:33Z","title":"TurboSpec: Closed-loop Speculation Control System for Optimizing LLM Serving Goodput","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14066","snapshot_observed_at":"2026-08-15T20:11:02.863388Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.17074","last_updated":"2025-05-20T04:12:37Z","snapshot_observed_at":"2026-08-15T23:43:38.164393Z","submitted_at":"2025-05-20T04:12:37Z","title":"Semi-Clairvoyant Scheduling of Speculative Decoding Requests to Minimize LLM Inference Latency","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T20:11:02.863388Z"},"links":{"cited_paper":"/paper/2406.14066","citing_paper":"/paper/2505.17074"},"observation_digest":"sha256:9da9d704d2ed0a82d7f777235e2b0ee69a5e812938948a7ae184e6ca46608706","observation_id":"d7ef7902-2662-4bc2-be5c-3e0e13f69e92","resolution":{"observed_at":"2026-08-15T20:11:02.863388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:11:03.232714Z","title":"Specinfer: Accelerating large language model serv- ing with tree-based speculative inference and verification","venue":null,"work_id":"d367f094-ee73-493c-a634-80e9af05e966","year":2024},"citing_paper":{"arxiv_id":"2505.17074","last_updated":"2025-05-20T04:12:37Z","snapshot_observed_at":"2026-08-15T23:43:38.164393Z","submitted_at":"2025-05-20T04:12:37Z","title":"Semi-Clairvoyant Scheduling of Speculative Decoding Requests to Minimize LLM Inference Latency","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T20:11:02.867632Z"},"links":{"citing_paper":"/paper/2505.17074"},"observation_digest":"sha256:51f6b57597980adf466687bfec150c2e53344e605d10e2f244dfcba9e48a3658","observation_id":"b65a138e-aa24-41dc-9fd6-eb007cd29222","resolution":{"observed_at":"2026-08-15T20:11:03.236879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:11:03.222106Z","title":"Exegpt: Constraint-aware resource scheduling for llm inference","venue":null,"work_id":"318d11e8-fedd-4172-9699-967ceb58ce4b","year":2024},"citing_paper":{"arxiv_id":"2505.17074","last_updated":"2025-05-20T04:12:37Z","snapshot_observed_at":"2026-08-15T23:43:38.164393Z","submitted_at":"2025-05-20T04:12:37Z","title":"Semi-Clairvoyant Scheduling of Speculative Decoding Requests to Minimize LLM Inference Latency","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T20:11:02.871684Z"},"links":{"citing_paper":"/paper/2505.17074"},"observation_digest":"sha256:30c4b69467eec611a169dc16e2fd182da75c485788dfc35ba1b0890a0e466fa9","observation_id":"90743ccd-240a-4d0b-a89e-1cc33b704102","resolution":{"observed_at":"2026-08-15T20:11:03.225889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:11:03.211317Z","title":"Splitwise: Efficient generative llm infer- ence using phase splitting","venue":null,"work_id":"1e99e9c4-0be1-445f-83c9-3d7d3bafd9e6","year":2024},"citing_paper":{"arxiv_id":"2505.17074","last_updated":"2025-05-20T04:12:37Z","snapshot_observed_at":"2026-08-15T23:43:38.164393Z","submitted_at":"2025-05-20T04:12:37Z","title":"Semi-Clairvoyant Scheduling of Speculative Decoding Requests to Minimize LLM Inference Latency","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T20:11:02.877104Z"},"links":{"citing_paper":"/paper/2505.17074"},"observation_digest":"sha256:7b174587562681424bb0805e9471379b792564ad47821c6ef00a6182ed8be391","observation_id":"296aaf70-217a-475d-b61c-66badd4cbc96","resolution":{"observed_at":"2026-08-15T20:11:03.214905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:11:03.199230Z","title":"Efficient interactive llm serving with proxy model-based sequence length prediction","venue":null,"work_id":"985544ed-a9b1-42f9-a0a9-f1723d4376e4","year":2024},"citing_paper":{"arxiv_id":"2505.17074","last_updated":"2025-05-20T04:12:37Z","snapshot_observed_at":"2026-08-15T23:43:38.164393Z","submitted_at":"2025-05-20T04:12:37Z","title":"Semi-Clairvoyant Scheduling of Speculative Decoding Requests to Minimize LLM Inference Latency","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T20:11:02.881471Z"},"links":{"citing_paper":"/paper/2505.17074"},"observation_digest":"sha256:9bad03d2c1257ecdfdd01935a7397243a3d1380229a38d72e0232df5faa25c09","observation_id":"4bb9ad2f-1c62-47ad-8acf-56a4bf3d2ade","resolution":{"observed_at":"2026-08-15T20:11:03.203413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:11:03.186066Z","title":"Analysis of las scheduling for job size distributions with high variance","venue":null,"work_id":"86ece967-a18c-4d4f-98c1-275e8e4ec46b","year":2003},"citing_paper":{"arxiv_id":"2505.17074","last_updated":"2025-05-20T04:12:37Z","snapshot_observed_at":"2026-08-15T23:43:38.164393Z","submitted_at":"2025-05-20T04:12:37Z","title":"Semi-Clairvoyant Scheduling of Speculative Decoding Requests to Minimize LLM Inference Latency","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T20:11:02.885616Z"},"links":{"citing_paper":"/paper/2505.17074"},"observation_digest":"sha256:e7bd9e620a92b3612e52d94947a6942e2b38e4d97715541c76a1af69b5afb301","observation_id":"89138bb7-517d-4086-aeab-928cdd3abadd","resolution":{"observed_at":"2026-08-15T20:11:03.190453Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:11:03.158467Z","title":"Specexec: Massively parallel speculative de- coding for interactive LLM inference on consumer de- vices","venue":null,"work_id":"087b24ba-c593-4374-974f-983e1fb9b2c0","year":2024},"citing_paper":{"arxiv_id":"2505.17074","last_updated":"2025-05-20T04:12:37Z","snapshot_observed_at":"2026-08-15T23:43:38.164393Z","submitted_at":"2025-05-20T04:12:37Z","title":"Semi-Clairvoyant Scheduling of Speculative Decoding Requests to Minimize LLM Inference Latency","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T20:11:02.896303Z"},"links":{"citing_paper":"/paper/2505.17074"},"observation_digest":"sha256:26985d96e7e024083d284c93dd02abe8103ce2443eb9da7602685b22ce67f07a","observation_id":"178b3282-06a9-4c07-be6f-fc38ab9859c7","resolution":{"observed_at":"2026-08-15T20:11:03.163232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-15T20:11:02.899697Z","title":"Llama: Open and efficient founda- tion language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17074","last_updated":"2025-05-20T04:12:37Z","snapshot_observed_at":"2026-08-15T23:43:38.164393Z","submitted_at":"2025-05-20T04:12:37Z","title":"Semi-Clairvoyant Scheduling of Speculative Decoding Requests to Minimize LLM Inference Latency","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T20:11:02.899697Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.17074"},"observation_digest":"sha256:9f38f04fed19b34e64256fca9f410ecf1051934a02e8f22eba2115741d637924","observation_id":"14604ae9-a14e-4f5d-8f30-adad5c27cf0b","resolution":{"observed_at":"2026-08-15T20:11:02.899697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15678","last_updated":"2024-10-30T02:10:46Z","snapshot_observed_at":"2026-08-17T08:56:33.476484Z","submitted_at":"2024-02-24T01:45:35Z","title":"Minions: Accelerating Large Language Model Inference with Aggregated Speculative Execution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15678","snapshot_observed_at":"2026-08-15T20:11:02.903168Z","title":"Minions: Accelerating large language model inference with adap- tive and collective speculative decoding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17074","last_updated":"2025-05-20T04:12:37Z","snapshot_observed_at":"2026-08-15T23:43:38.164393Z","submitted_at":"2025-05-20T04:12:37Z","title":"Semi-Clairvoyant Scheduling of Speculative Decoding Requests to Minimize LLM Inference Latency","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T20:11:02.903168Z"},"links":{"cited_paper":"/paper/2402.15678","citing_paper":"/paper/2505.17074"},"observation_digest":"sha256:6e30ae279944ae6a53eee5a461db73cdeff6879a63f2e8a47f27a7d2adf9e8fe","observation_id":"61a5eb0a-65c0-45c4-8197-a90c3fe99502","resolution":{"observed_at":"2026-08-15T20:11:02.903168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.05920","last_updated":"2024-09-25T05:57:51Z","snapshot_observed_at":"2026-08-16T21:53:57.298060Z","submitted_at":"2023-05-10T06:17:50Z","title":"Fast Distributed Inference Serving for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.05920","snapshot_observed_at":"2026-08-15T20:11:02.907610Z","title":"Fast distributed infer- ence serving for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17074","last_updated":"2025-05-20T04:12:37Z","snapshot_observed_at":"2026-08-15T23:43:38.164393Z","submitted_at":"2025-05-20T04:12:37Z","title":"Semi-Clairvoyant Scheduling of Speculative Decoding Requests to Minimize LLM Inference Latency","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T20:11:02.907610Z"},"links":{"cited_paper":"/paper/2305.05920","citing_paper":"/paper/2505.17074"},"observation_digest":"sha256:9cd74a524c0b98b4172ba9e98154706263992f0c05776c23e7860cd9bd88d444","observation_id":"9b312937-4012-43cf-bcfa-512bafb608ca","resolution":{"observed_at":"2026-08-15T20:11:02.907610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:11:03.144932Z","title":"Mini- thinky dataset","venue":null,"work_id":"010d89c2-24f6-4e0f-9b37-b835df594d8a","year":2024},"citing_paper":{"arxiv_id":"2505.17074","last_updated":"2025-05-20T04:12:37Z","snapshot_observed_at":"2026-08-15T23:43:38.164393Z","submitted_at":"2025-05-20T04:12:37Z","title":"Semi-Clairvoyant Scheduling of Speculative Decoding Requests to Minimize LLM Inference Latency","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T20:11:02.912226Z"},"links":{"citing_paper":"/paper/2505.17074"},"observation_digest":"sha256:9d9b60f7fdb890ab8e3821b039bad1de7eb75c503a0773ea5d3c14ce70700286","observation_id":"0f6e6be7-143a-463a-8bd3-bb5065bb8bfa","resolution":{"observed_at":"2026-08-15T20:11:03.149262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14636","last_updated":"2024-05-23T14:41:22Z","snapshot_observed_at":"2026-08-16T13:50:10.567683Z","submitted_at":"2024-05-23T14:41:22Z","title":"PerLLM: Personalized Inference Scheduling with Edge-Cloud Collaboration for Diverse LLM Services","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14636","snapshot_observed_at":"2026-08-15T20:11:02.915966Z","title":"Perllm: Person- alized inference scheduling with edge-cloud collaboration for diverse llm services","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17074","last_updated":"2025-05-20T04:12:37Z","snapshot_observed_at":"2026-08-15T23:43:38.164393Z","submitted_at":"2025-05-20T04:12:37Z","title":"Semi-Clairvoyant Scheduling of Speculative Decoding Requests to Minimize LLM Inference Latency","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T20:11:02.915966Z"},"links":{"cited_paper":"/paper/2405.14636","citing_paper":"/paper/2505.17074"},"observation_digest":"sha256:9c5171706bef48d491877ae29dcfeb753057800e2b1291f45f54a55c94818132","observation_id":"c2f06694-8e64-48aa-9b9d-ee68be606a25","resolution":{"observed_at":"2026-08-15T20:11:02.915966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:11:03.131381Z","title":"Tree of thoughts: Deliberate problem solving with large language models","venue":null,"work_id":"e1bf6212-f1d6-4c5e-862e-9ff04b256634","year":2024},"citing_paper":{"arxiv_id":"2505.17074","last_updated":"2025-05-20T04:12:37Z","snapshot_observed_at":"2026-08-15T23:43:38.164393Z","submitted_at":"2025-05-20T04:12:37Z","title":"Semi-Clairvoyant Scheduling of Speculative Decoding Requests to Minimize LLM Inference Latency","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T20:11:02.920303Z"},"links":{"citing_paper":"/paper/2505.17074"},"observation_digest":"sha256:cddd81e34ba01f6081fc81305057489e8e60cc4d6876e50f7632fd10bb07b13e","observation_id":"8bc61a95-1e31-42f2-b78a-040c81c82a86","resolution":{"observed_at":"2026-08-15T20:11:03.135718Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:11:03.117597Z","title":"Adap- tive batch budget for llm inference","venue":null,"work_id":"fb743401-d734-4e7d-8e93-a3ccfd7df843","year":2024},"citing_paper":{"arxiv_id":"2505.17074","last_updated":"2025-05-20T04:12:37Z","snapshot_observed_at":"2026-08-15T23:43:38.164393Z","submitted_at":"2025-05-20T04:12:37Z","title":"Semi-Clairvoyant Scheduling of Speculative Decoding Requests to Minimize LLM Inference Latency","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T20:11:02.923723Z"},"links":{"citing_paper":"/paper/2505.17074"},"observation_digest":"sha256:682e6ed3fa11874c315acd99fd1bfbde26f69ca2b28d59b386b91ae0d9ad92ac","observation_id":"d45109dd-5775-4e1d-a6ca-cebc8f2d65d9","resolution":{"observed_at":"2026-08-15T20:11:03.122914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:11:03.106984Z","title":"Re- sponse length perception and sequence scheduling: An llm-empowered llm inference pipeline","venue":null,"work_id":"1192a1ee-b1cd-467b-8787-6efdf803c31f","year":2024},"citing_paper":{"arxiv_id":"2505.17074","last_updated":"2025-05-20T04:12:37Z","snapshot_observed_at":"2026-08-15T23:43:38.164393Z","submitted_at":"2025-05-20T04:12:37Z","title":"Semi-Clairvoyant Scheduling of Speculative Decoding Requests to Minimize LLM Inference Latency","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T20:11:02.927453Z"},"links":{"citing_paper":"/paper/2505.17074"},"observation_digest":"sha256:0104ffb7da126651b68c5728b7b900bbef470edbf18c54c1fa9c17b881448dcb","observation_id":"04a7b48d-01fa-4a22-aef5-f541461b2fbe","resolution":{"observed_at":"2026-08-15T20:11:03.110445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:11:03.095005Z","title":"Response length perception and sequence scheduling: An llm-empowered llm inference pipeline","venue":null,"work_id":"f004390d-1de0-4455-9cf6-80ac4ef805a9","year":2024},"citing_paper":{"arxiv_id":"2505.17074","last_updated":"2025-05-20T04:12:37Z","snapshot_observed_at":"2026-08-15T23:43:38.164393Z","submitted_at":"2025-05-20T04:12:37Z","title":"Semi-Clairvoyant Scheduling of Speculative Decoding Requests to Minimize LLM Inference Latency","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T20:11:02.931101Z"},"links":{"citing_paper":"/paper/2505.17074"},"observation_digest":"sha256:d8e72728526ad5ce2da301b951d9b4d3dfcea438c5398d99702f3cc916deba34","observation_id":"45407d40-2d41-471f-b43a-9ed12450fee1","resolution":{"observed_at":"2026-08-15T20:11:03.099166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:11:03.079727Z","title":"Toolqa: A dataset for llm question answering with external tools","venue":null,"work_id":"16619564-f216-4fab-8364-35e30d2a73fe","year":2024},"citing_paper":{"arxiv_id":"2505.17074","last_updated":"2025-05-20T04:12:37Z","snapshot_observed_at":"2026-08-15T23:43:38.164393Z","submitted_at":"2025-05-20T04:12:37Z","title":"Semi-Clairvoyant Scheduling of Speculative Decoding Requests to Minimize LLM Inference Latency","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T20:11:02.936052Z"},"links":{"citing_paper":"/paper/2505.17074"},"observation_digest":"sha256:cc7e1b6cdaa021962fa3464377f8a9d6ae94340b66278cce14982d6683b8ea76","observation_id":"fb78d568-5fe3-4870-8910-1e9137894864","resolution":{"observed_at":"2026-08-15T20:11:03.085461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:11:03.267260Z","title":"Fast inference from transformers via speculative decoding","venue":null,"work_id":"41fb8d03-70e4-4b3b-a9c9-4ee0c44b4b18","year":2023},"citing_paper":{"arxiv_id":"2505.17074","last_updated":"2025-05-20T04:12:37Z","snapshot_observed_at":"2026-08-15T23:43:38.164393Z","submitted_at":"2025-05-20T04:12:37Z","title":"Semi-Clairvoyant Scheduling of Speculative Decoding Requests to Minimize LLM Inference Latency","version":1},"reference_index":2000,"source":"pdf_text","source_observed_at":"2026-08-15T20:11:02.851841Z"},"links":{"citing_paper":"/paper/2505.17074"},"observation_digest":"sha256:ee5f1e66222f2b8c62d7d883dcdeb3a3d55949a03b40668dc6162ce2428489ca","observation_id":"76187568-019d-4aa1-8ebb-82dd39117b18","resolution":{"observed_at":"2026-08-15T20:11:03.271405Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:11:03.172949Z","title":"Accelerating LLM inference with staged speculative decoding","venue":null,"work_id":"d1aa137b-c347-468e-b031-91f994a8f5d1","year":2023},"citing_paper":{"arxiv_id":"2505.17074","last_updated":"2025-05-20T04:12:37Z","snapshot_observed_at":"2026-08-15T23:43:38.164393Z","submitted_at":"2025-05-20T04:12:37Z","title":"Semi-Clairvoyant Scheduling of Speculative Decoding Requests to Minimize LLM Inference Latency","version":1},"reference_index":2003,"source":"pdf_text","source_observed_at":"2026-08-15T20:11:02.891871Z"},"links":{"citing_paper":"/paper/2505.17074"},"observation_digest":"sha256:af9adb73ebcc81071b789d0013a61eb05dc4f45681f453ef6de855484eb898d0","observation_id":"3cb0c213-b22a-45f9-affa-f5a5d523fd6e","resolution":{"observed_at":"2026-08-15T20:11:03.177782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:11:03.323049Z","title":"Lee, Deming Chen, and Tri Dao","venue":null,"work_id":"920bec93-d38c-4d98-8925-d52d9721d7b4","year":2024},"citing_paper":{"arxiv_id":"2505.17074","last_updated":"2025-05-20T04:12:37Z","snapshot_observed_at":"2026-08-15T23:43:38.164393Z","submitted_at":"2025-05-20T04:12:37Z","title":"Semi-Clairvoyant Scheduling of Speculative Decoding Requests to Minimize LLM Inference Latency","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-15T20:11:02.812256Z"},"links":{"citing_paper":"/paper/2505.17074"},"observation_digest":"sha256:77f091981d376e0ff7fb2e28c56f9b0be94b3f049331148ae1a67bda76fe59bf","observation_id":"d23c522d-39b5-4e2d-ba31-d39aaf79a327","resolution":{"observed_at":"2026-08-15T20:11:03.326987Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:11:03.341481Z","title":"Speculative streaming: Fast llm infer- ence without auxiliary models","venue":null,"work_id":"50d49fe4-0a29-4030-b71d-3f2af99d21cf","year":2024},"citing_paper":{"arxiv_id":"2505.17074","last_updated":"2025-05-20T04:12:37Z","snapshot_observed_at":"2026-08-15T23:43:38.164393Z","submitted_at":"2025-05-20T04:12:37Z","title":"Semi-Clairvoyant Scheduling of Speculative Decoding Requests to Minimize LLM Inference Latency","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-15T20:11:02.801375Z"},"links":{"citing_paper":"/paper/2505.17074"},"observation_digest":"sha256:a86bdff64ae161d4dd98a1a577667bd7f6c5299c8786162b36e0342e0de455d9","observation_id":"57646099-8362-43cc-a5a8-75c58368988f","resolution":{"observed_at":"2026-08-15T20:11:03.345380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-15T17:40:38.050939Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-15T20:11:02.796594Z","title":"Program synthesis with large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.17074","last_updated":"2025-05-20T04:12:37Z","snapshot_observed_at":"2026-08-15T23:43:38.164393Z","submitted_at":"2025-05-20T04:12:37Z","title":"Semi-Clairvoyant Scheduling of Speculative Decoding Requests to Minimize LLM Inference Latency","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-15T20:11:02.796594Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2505.17074"},"observation_digest":"sha256:98fe05c98f280666f7d6777b50c5e62f4f88850581672ec9d4a412c338c9c23d","observation_id":"57c104ff-bea9-483e-bdb8-b21201bdca93","resolution":{"observed_at":"2026-08-15T20:11:02.796594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:11:03.353044Z","title":"Chatbot instruc- tion prompts","venue":null,"work_id":"2a6e7234-26cb-4212-be5c-d9809cecf4de","year":2023},"citing_paper":{"arxiv_id":"2505.17074","last_updated":"2025-05-20T04:12:37Z","snapshot_observed_at":"2026-08-15T23:43:38.164393Z","submitted_at":"2025-05-20T04:12:37Z","title":"Semi-Clairvoyant Scheduling of Speculative Decoding Requests to Minimize LLM Inference Latency","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-15T20:11:02.792451Z"},"links":{"citing_paper":"/paper/2505.17074"},"observation_digest":"sha256:3af9c148881c6eb2fcbca04b92b859f9c41d37dd6af499f2ecc98a323ed223f5","observation_id":"e85c7fc4-dc85-4928-b59a-e47dcd8f6101","resolution":{"observed_at":"2026-08-15T20:11:03.356812Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:11:03.301829Z","title":"Glide with a cape: A low-hassle method to accelerate speculative decoding","venue":null,"work_id":"f61e0ed7-1e25-4965-9e7a-07c68d4d4718","year":2024},"citing_paper":{"arxiv_id":"2505.17074","last_updated":"2025-05-20T04:12:37Z","snapshot_observed_at":"2026-08-15T23:43:38.164393Z","submitted_at":"2025-05-20T04:12:37Z","title":"Semi-Clairvoyant Scheduling of Speculative Decoding Requests to Minimize LLM Inference Latency","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-15T20:11:02.830448Z"},"links":{"citing_paper":"/paper/2505.17074"},"observation_digest":"sha256:80017f8eea6fef030cd2c632c3e4c6a687a79db46805225d91696a00568ae16e","observation_id":"b0aff8b5-208e-482c-8364-7401f37171f3","resolution":{"observed_at":"2026-08-15T20:11:03.305348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.17074","last_updated":"2025-05-20T04:12:37Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-15T23:43:38.164393Z","submitted_at":"2025-05-20T04:12:37Z","title":"Semi-Clairvoyant Scheduling of Speculative Decoding Requests to Minimize LLM Inference Latency"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":10,"verified_exact":0,"verified_fuzzy":24},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 0 inbound Pith citation observations for arXiv:2505.17074."}