{"as_of":"2026-08-08T06:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:15405dc798dc3b7cbbebb1238f7ddd6bea1867949dbc1d97255f72eb0d07cfa0","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-19T21:44:11.735963Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.16786/citation-record","integrity":"/paper/2605.16786/integrity","json":"/paper/2605.16786/citation-record.json","paper":"/paper/2605.16786"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llm in a flash: Efficient large language model inference with limited memory","venue":null,"work_id":"a9c527dd-dab9-4723-894f-c136b3e1ccaf","year":2024},"citing_paper":{"arxiv_id":"2605.16786","last_updated":"2026-05-16T03:43:10Z","snapshot_observed_at":"2026-07-06T23:27:52.850836Z","submitted_at":"2026-05-16T03:43:10Z","title":"Lever: Speculative LLM Inference on Smartphones","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-19T21:44:11.735963Z"},"links":{"citing_paper":"/paper/2605.16786"},"observation_digest":"sha256:b1cc7e855dcd15f4123c70255719bf081fa3ba055f831785eba04a35a16ef60a","observation_id":"4a55a98f-0f50-4dfc-8666-f184dcc78f19","resolution":{"observed_at":"2026-05-19T21:53:14.777804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hydra: Sequentially-dependent draft heads for medusa decoding","venue":null,"work_id":"c49cff9c-dcd0-4434-ad6b-51534aca2b2f","year":2024},"citing_paper":{"arxiv_id":"2605.16786","last_updated":"2026-05-16T03:43:10Z","snapshot_observed_at":"2026-07-06T23:27:52.850836Z","submitted_at":"2026-05-16T03:43:10Z","title":"Lever: Speculative LLM Inference on Smartphones","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-19T21:44:11.735963Z"},"links":{"citing_paper":"/paper/2605.16786"},"observation_digest":"sha256:efc691651f504c2a0b956b469977ebcb0650cada0eb496364f261535b7509f6f","observation_id":"7ab4b8d0-a37f-4544-9947-f5bc2cfc998b","resolution":{"observed_at":"2026-05-19T21:53:14.759875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-02T19:23:53.535075Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":"2108.07732","doi":"10.1007/s11390-025-5518-5","metadata_source":"pith","pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Program Synthesis with Large Language Models","venue":"cs.PL","work_id":"fd241a05-03b9-4de2-9588-9d77ce176125","year":2021},"citing_paper":{"arxiv_id":"2605.16786","last_updated":"2026-05-16T03:43:10Z","snapshot_observed_at":"2026-07-06T23:27:52.850836Z","submitted_at":"2026-05-16T03:43:10Z","title":"Lever: Speculative LLM Inference on Smartphones","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-19T21:44:11.735963Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2605.16786"},"observation_digest":"sha256:139908a3c4c43f35c0f354c2c1283f1e6e241d997802668cd99e1c166c25c744","observation_id":"c806b47d-9bf4-41f2-8609-b9e8e2630af3","resolution":{"observed_at":"2026-05-19T21:47:48.480677Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10774","last_updated":"2024-06-14T23:32:32Z","snapshot_observed_at":"2026-07-06T17:17:56.276857Z","submitted_at":"2024-01-19T15:48:40Z","title":"Medusa: Simple LLM Inference Acceleration Framework with Multiple Decoding Heads","version":3},"cited_work":{"arxiv_id":"2401.10774","doi":"10.48550/arxiv.2401.10774","metadata_source":"pith","pith_arxiv_id":"2401.10774","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Medusa: Simple LLM Inference Acceleration Framework with Multiple Decoding Heads","venue":"cs.LG","work_id":"f6202cd1-1a78-4c19-8242-688acf4952b6","year":2024},"citing_paper":{"arxiv_id":"2605.16786","last_updated":"2026-05-16T03:43:10Z","snapshot_observed_at":"2026-07-06T23:27:52.850836Z","submitted_at":"2026-05-16T03:43:10Z","title":"Lever: Speculative LLM Inference on Smartphones","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-19T21:44:11.735963Z"},"links":{"cited_paper":"/paper/2401.10774","citing_paper":"/paper/2605.16786"},"observation_digest":"sha256:807d3a8c2c34a25a38ad91216b97ad1989e93d053e370e51c036a4828fea73ef","observation_id":"f20d8a99-77b4-4a30-b5f4-534c8b326dcc","resolution":{"observed_at":"2026-05-19T21:47:48.477935Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.01318","last_updated":"2023-02-02T18:44:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-02T18:44:11Z","title":"Accelerating Large Language Model Decoding with Speculative Sampling","version":1},"cited_work":{"arxiv_id":"2302.01318","doi":"10.48550/arxiv.2302.01318","metadata_source":"pith","pith_arxiv_id":"2302.01318","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Accelerating Large Language Model Decoding with Speculative Sampling","venue":"cs.CL","work_id":"b53b11e5-8613-439d-9d9d-0e2a9090d79f","year":2023},"citing_paper":{"arxiv_id":"2605.16786","last_updated":"2026-05-16T03:43:10Z","snapshot_observed_at":"2026-07-06T23:27:52.850836Z","submitted_at":"2026-05-16T03:43:10Z","title":"Lever: Speculative LLM Inference on Smartphones","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-19T21:44:11.735963Z"},"links":{"cited_paper":"/paper/2302.01318","citing_paper":"/paper/2605.16786"},"observation_digest":"sha256:efce126fbdab58878added7a61b31c9fec8e5f2fded063187ef2b0a265bb9414","observation_id":"47ac8862-a568-4d7e-ac26-d6cc41891747","resolution":{"observed_at":"2026-05-19T21:47:48.468798Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T04:13:14.044604Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":"2107.03374","doi":"10.48550/arxiv.2107.03374","metadata_source":"pith","pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Evaluating Large Language Models Trained on Code","venue":"cs.LG","work_id":"042493e9-b26f-4b4e-bbde-382072ca9b08","year":2021},"citing_paper":{"arxiv_id":"2605.16786","last_updated":"2026-05-16T03:43:10Z","snapshot_observed_at":"2026-07-06T23:27:52.850836Z","submitted_at":"2026-05-16T03:43:10Z","title":"Lever: Speculative LLM Inference on Smartphones","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-19T21:44:11.735963Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2605.16786"},"observation_digest":"sha256:7169d0655f37e7e6bb55cfa44b5ea669a45b266676b3d69164294e4ed0893007","observation_id":"f5320cb9-4837-416c-8ebe-3085916cd432","resolution":{"observed_at":"2026-05-19T21:47:48.474946Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sequoia: Scalable and robust speculative decoding","venue":null,"work_id":"d6cb23db-17eb-4ca1-9520-139f430037ab","year":2024},"citing_paper":{"arxiv_id":"2605.16786","last_updated":"2026-05-16T03:43:10Z","snapshot_observed_at":"2026-07-06T23:27:52.850836Z","submitted_at":"2026-05-16T03:43:10Z","title":"Lever: Speculative LLM Inference on Smartphones","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-19T21:44:11.735963Z"},"links":{"citing_paper":"/paper/2605.16786"},"observation_digest":"sha256:0aded6d459ec86dcf51b4b3f98a46a904c710a77ecb5c71a50d2a9ecdfad8ba6","observation_id":"2b9bf438-a235-4596-a35f-05d1cbc2a091","resolution":{"observed_at":"2026-05-19T21:53:14.768038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":"2110.14168","doi":"10.1002/j.1545-","metadata_source":"pith","pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Training Verifiers to Solve Math Word Problems","venue":"cs.LG","work_id":"acab1aa8-b4d6-40e0-a3ee-25341701dca2","year":2021},"citing_paper":{"arxiv_id":"2605.16786","last_updated":"2026-05-16T03:43:10Z","snapshot_observed_at":"2026-07-06T23:27:52.850836Z","submitted_at":"2026-05-16T03:43:10Z","title":"Lever: Speculative LLM Inference on Smartphones","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-19T21:44:11.735963Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2605.16786"},"observation_digest":"sha256:12c54c2afa25dc5eb62534d8864947f300946b33d1a1d6280cacb4485727e14b","observation_id":"5583c18f-e631-4dc9-a91a-306e7e3061d1","resolution":{"observed_at":"2026-05-19T21:47:48.492084Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"LayerSkip: Enabling early exit inference and self-speculative decoding","venue":null,"work_id":"9bc8ba29-778f-4cfe-8dda-975b5cfcb6e8","year":2024},"citing_paper":{"arxiv_id":"2605.16786","last_updated":"2026-05-16T03:43:10Z","snapshot_observed_at":"2026-07-06T23:27:52.850836Z","submitted_at":"2026-05-16T03:43:10Z","title":"Lever: Speculative LLM Inference on Smartphones","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-19T21:44:11.735963Z"},"links":{"citing_paper":"/paper/2605.16786"},"observation_digest":"sha256:90dd2cc4da5eb2615dd8bacf3d8ef23ee85ff060284d0aec6afceb39e68f28b0","observation_id":"fd0e143f-51f9-4f33-8f11-8b2fc3925402","resolution":{"observed_at":"2026-05-19T21:53:14.753660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"GPTQ: Accurate post-training quantization for generative pre-trained transformers","venue":null,"work_id":"37a3e780-ba80-47b5-af05-d972e657d4a5","year":2023},"citing_paper":{"arxiv_id":"2605.16786","last_updated":"2026-05-16T03:43:10Z","snapshot_observed_at":"2026-07-06T23:27:52.850836Z","submitted_at":"2026-05-16T03:43:10Z","title":"Lever: Speculative LLM Inference on Smartphones","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-19T21:44:11.735963Z"},"links":{"citing_paper":"/paper/2605.16786"},"observation_digest":"sha256:748b5336ea6a331b0e7e991ba36b6ef390b9bdc6ebe56ae1a76f34b31dce4fbc","observation_id":"929d8eb6-4ac7-428f-acae-2fcdd069c586","resolution":{"observed_at":"2026-05-19T21:53:14.751773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Break the se- quential dependency of LLM inference using lookahead decoding","venue":null,"work_id":"e410fce2-53f0-470d-a35b-7c4d8852c474","year":2024},"citing_paper":{"arxiv_id":"2605.16786","last_updated":"2026-05-16T03:43:10Z","snapshot_observed_at":"2026-07-06T23:27:52.850836Z","submitted_at":"2026-05-16T03:43:10Z","title":"Lever: Speculative LLM Inference on Smartphones","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-19T21:44:11.735963Z"},"links":{"citing_paper":"/paper/2605.16786"},"observation_digest":"sha256:2887d9059b95dab83ab618ddbee4e82f28d1c07bea2cd1b89e7afe60dbb0e420","observation_id":"8480fb3a-0047-4799-89d4-b0aac697cf86","resolution":{"observed_at":"2026-05-19T21:53:14.783523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02829","last_updated":"2025-06-08T00:57:21Z","snapshot_observed_at":"2026-07-06T19:45:21.541944Z","submitted_at":"2024-11-05T06:00:27Z","title":"CE-CoLLM: Efficient and Adaptive Large Language Models Through Cloud-Edge Collaboration","version":2},"cited_work":{"arxiv_id":"2411.02829","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.02829","snapshot_observed_at":"2026-07-04T09:49:44.102369Z","title":"CE-CoLLM: Efficient and adap- tive large language models through cloud-edge collaboration","venue":null,"work_id":"0e6b81e0-85d4-47d0-8088-84fad83bdc40","year":2024},"citing_paper":{"arxiv_id":"2605.16786","last_updated":"2026-05-16T03:43:10Z","snapshot_observed_at":"2026-07-06T23:27:52.850836Z","submitted_at":"2026-05-16T03:43:10Z","title":"Lever: Speculative LLM Inference on Smartphones","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-19T21:44:11.735963Z"},"links":{"cited_paper":"/paper/2411.02829","citing_paper":"/paper/2605.16786"},"observation_digest":"sha256:0ba3834551b8fa2abcafdb62acc3897c7b0ee44a35363c01e8aa1ce89e8933b7","observation_id":"b142e5f8-67fb-4ed2-955b-b1203d0c774c","resolution":{"observed_at":"2026-05-19T21:47:48.472228Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T12:53:51.199808Z","title":"Fast inference from transformers via speculative decoding","venue":null,"work_id":"1fbe276e-0625-47a5-88b5-ded8d9608969","year":2023},"citing_paper":{"arxiv_id":"2605.16786","last_updated":"2026-05-16T03:43:10Z","snapshot_observed_at":"2026-07-06T23:27:52.850836Z","submitted_at":"2026-05-16T03:43:10Z","title":"Lever: Speculative LLM Inference on Smartphones","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-19T21:44:11.735963Z"},"links":{"citing_paper":"/paper/2605.16786"},"observation_digest":"sha256:5f259f3825f24864bcaa76427f4fe6927e548a59664284bfc5b50eb617a64d2b","observation_id":"0e4091ae-1c7c-4a78-a8d0-ed50d983fe06","resolution":{"observed_at":"2026-05-19T21:53:14.763054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"EAGLE-2: Faster inference of language models with dynamic draft trees","venue":null,"work_id":"ce29921f-4f6d-4d4b-b0bd-669f4b1adaa1","year":2024},"citing_paper":{"arxiv_id":"2605.16786","last_updated":"2026-05-16T03:43:10Z","snapshot_observed_at":"2026-07-06T23:27:52.850836Z","submitted_at":"2026-05-16T03:43:10Z","title":"Lever: Speculative LLM Inference on Smartphones","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-19T21:44:11.735963Z"},"links":{"citing_paper":"/paper/2605.16786"},"observation_digest":"sha256:71b488249d23dcc336b9977c6bf4b80b439370bf20d66532740e74a91f008b75","observation_id":"0109dac0-2377-4400-aa27-26221df8c522","resolution":{"observed_at":"2026-05-19T21:53:14.781676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"EA- GLE: Speculative sampling requires rethinking feature uncertainty","venue":null,"work_id":"81e73d3b-752c-495c-9ab8-87dea48412e5","year":2024},"citing_paper":{"arxiv_id":"2605.16786","last_updated":"2026-05-16T03:43:10Z","snapshot_observed_at":"2026-07-06T23:27:52.850836Z","submitted_at":"2026-05-16T03:43:10Z","title":"Lever: Speculative LLM Inference on Smartphones","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-19T21:44:11.735963Z"},"links":{"citing_paper":"/paper/2605.16786"},"observation_digest":"sha256:22a977558146664b1a552e5be061e38a3ebdce9289545eacd9320219312aa419","observation_id":"43fa5db7-7f3c-4c18-828b-8390a1667344","resolution":{"observed_at":"2026-05-19T21:53:14.787736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01840","last_updated":"2025-04-23T07:08:17Z","snapshot_observed_at":"2026-07-06T20:45:55.263034Z","submitted_at":"2025-03-03T18:59:04Z","title":"EAGLE-3: Scaling up Inference Acceleration of Large Language Models via Training-Time Test","version":3},"cited_work":{"arxiv_id":"2503.01840","doi":"10.48550/arxiv.2503.01840","metadata_source":"pith","pith_arxiv_id":"2503.01840","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EAGLE-3: Scaling up Inference Acceleration of Large Language Models via Training-Time Test","venue":"cs.CL","work_id":"323c1b68-aec5-4444-944f-155a771bd8c6","year":2025},"citing_paper":{"arxiv_id":"2605.16786","last_updated":"2026-05-16T03:43:10Z","snapshot_observed_at":"2026-07-06T23:27:52.850836Z","submitted_at":"2026-05-16T03:43:10Z","title":"Lever: Speculative LLM Inference on Smartphones","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-19T21:44:11.735963Z"},"links":{"cited_paper":"/paper/2503.01840","citing_paper":"/paper/2605.16786"},"observation_digest":"sha256:93ef666bf39a9d9bd7a328f45b05927a90cf436e24cacb384f7e4d419b430a57","observation_id":"471a3735-ebdb-49f2-8f51-f3cbaebe3b6e","resolution":{"observed_at":"2026-05-19T21:47:48.489421Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Awq: Activation-aware weight quantization for on-device llm compression and acceleration.Proceedings of machine learning and systems, 6:87–100","venue":null,"work_id":"741bcff9-7b82-4e95-8561-846aa395b63a","year":2024},"citing_paper":{"arxiv_id":"2605.16786","last_updated":"2026-05-16T03:43:10Z","snapshot_observed_at":"2026-07-06T23:27:52.850836Z","submitted_at":"2026-05-16T03:43:10Z","title":"Lever: Speculative LLM Inference on Smartphones","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-19T21:44:11.735963Z"},"links":{"citing_paper":"/paper/2605.16786"},"observation_digest":"sha256:82ac12601e684bd278f1c05689de6e6be3fe11a88729e5677074411f770aa999","observation_id":"d8c7925e-1f15-489b-a754-914c6a258623","resolution":{"observed_at":"2026-05-19T21:53:14.779676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"FastBERT: a self-distilling BERT with adaptive inference time","venue":null,"work_id":"55e1d457-a64d-486e-830f-09e8232d352b","year":2020},"citing_paper":{"arxiv_id":"2605.16786","last_updated":"2026-05-16T03:43:10Z","snapshot_observed_at":"2026-07-06T23:27:52.850836Z","submitted_at":"2026-05-16T03:43:10Z","title":"Lever: Speculative LLM Inference on Smartphones","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-19T21:44:11.735963Z"},"links":{"citing_paper":"/paper/2605.16786"},"observation_digest":"sha256:115661faa931833db77907da57ee16ee3c379e77bf27da423ea7984917d845bb","observation_id":"da23b84a-0465-454a-b284-4f10f56fc600","resolution":{"observed_at":"2026-05-19T21:53:14.747754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"MobileLLM: Optimizing sub-billion parameter language models for on-device use cases","venue":null,"work_id":"4aab6c44-c15c-4974-838c-33c80e65d099","year":2024},"citing_paper":{"arxiv_id":"2605.16786","last_updated":"2026-05-16T03:43:10Z","snapshot_observed_at":"2026-07-06T23:27:52.850836Z","submitted_at":"2026-05-16T03:43:10Z","title":"Lever: Speculative LLM Inference on Smartphones","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-19T21:44:11.735963Z"},"links":{"citing_paper":"/paper/2605.16786"},"observation_digest":"sha256:c2373a80f7a12284d2dd9bf8bbe6467247e41967da7b9a517621f7958d3fc276","observation_id":"9cbfb044-abdd-4fa9-b2af-c53ab62e940d","resolution":{"observed_at":"2026-05-19T21:53:14.750145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deja vu: Contextual sparsity for efficient llms at inference time","venue":null,"work_id":"7d7b993d-91eb-4f1c-8001-9ac2330d4200","year":2023},"citing_paper":{"arxiv_id":"2605.16786","last_updated":"2026-05-16T03:43:10Z","snapshot_observed_at":"2026-07-06T23:27:52.850836Z","submitted_at":"2026-05-16T03:43:10Z","title":"Lever: Speculative LLM Inference on Smartphones","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-19T21:44:11.735963Z"},"links":{"citing_paper":"/paper/2605.16786"},"observation_digest":"sha256:940ebe1a2e476280d3e85d9a3de7218670eee0c1ebc8d9749ec141ca5052b8f4","observation_id":"e134dff8-012a-410d-9661-19996f42d2be","resolution":{"observed_at":"2026-05-19T21:53:14.736382Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llm-pruner: On the structural pruning of large language models.Advances in neural information processing systems, 36:21702–21720","venue":null,"work_id":"abf5ec7c-e913-4143-b94a-1edb17204fea","year":2023},"citing_paper":{"arxiv_id":"2605.16786","last_updated":"2026-05-16T03:43:10Z","snapshot_observed_at":"2026-07-06T23:27:52.850836Z","submitted_at":"2026-05-16T03:43:10Z","title":"Lever: Speculative LLM Inference on Smartphones","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-19T21:44:11.735963Z"},"links":{"citing_paper":"/paper/2605.16786"},"observation_digest":"sha256:30929193e7ad90ca5866708325996411f6d7708f8898b8164862c114fca81887","observation_id":"d3bf30dc-e7e5-4930-a343-054dc590740b","resolution":{"observed_at":"2026-05-19T21:53:14.765787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Specinfer: Accelerating large language model serving with tree-based speculative inference and verification","venue":null,"work_id":"73ae58b9-161d-45fa-82c3-8d3e0c8c62f0","year":2024},"citing_paper":{"arxiv_id":"2605.16786","last_updated":"2026-05-16T03:43:10Z","snapshot_observed_at":"2026-07-06T23:27:52.850836Z","submitted_at":"2026-05-16T03:43:10Z","title":"Lever: Speculative LLM Inference on Smartphones","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-19T21:44:11.735963Z"},"links":{"citing_paper":"/paper/2605.16786"},"observation_digest":"sha256:2090b40932324e88d5738b2de4ac07545ccda7cddf5493d81061a83688b44b99","observation_id":"b742bc4f-9bd9-4f55-82bf-18906314c159","resolution":{"observed_at":"2026-05-19T21:53:14.758095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fu, Zhiqiang Xie, Beidi Chen, Clark Barrett, Joseph E","venue":null,"work_id":"3786e165-1a1d-48b8-9372-5fad0743adba","year":2023},"citing_paper":{"arxiv_id":"2605.16786","last_updated":"2026-05-16T03:43:10Z","snapshot_observed_at":"2026-07-06T23:27:52.850836Z","submitted_at":"2026-05-16T03:43:10Z","title":"Lever: Speculative LLM Inference on Smartphones","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-19T21:44:11.735963Z"},"links":{"citing_paper":"/paper/2605.16786"},"observation_digest":"sha256:a80ecada11a59dc7d2c717eaddd4aa669df187d9299fcf2bfcbd67e7589ac30b","observation_id":"e71a7583-867b-4fab-a4c8-66420eab21f3","resolution":{"observed_at":"2026-05-19T21:53:14.772721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Blockwise parallel decoding for deep autoregressive models","venue":null,"work_id":"c8889e6d-0a98-435e-82b9-6a3080665ea2","year":2018},"citing_paper":{"arxiv_id":"2605.16786","last_updated":"2026-05-16T03:43:10Z","snapshot_observed_at":"2026-07-06T23:27:52.850836Z","submitted_at":"2026-05-16T03:43:10Z","title":"Lever: Speculative LLM Inference on Smartphones","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-19T21:44:11.735963Z"},"links":{"citing_paper":"/paper/2605.16786"},"observation_digest":"sha256:c490bbe5024cdd98b2b93954c618ab0cdb3e3124d3c0365460564740ec11149c","observation_id":"349c404d-c796-40dd-91a8-5f9ea9d9a8a2","resolution":{"observed_at":"2026-05-19T21:53:14.775372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"cited_work":{"arxiv_id":"2310.11453","doi":"10.48550/arxiv.2310.11453","metadata_source":"pith","pith_arxiv_id":"2310.11453","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","venue":"cs.CL","work_id":"28ad8f61-4291-4894-b120-1d42fc9937a3","year":2023},"citing_paper":{"arxiv_id":"2605.16786","last_updated":"2026-05-16T03:43:10Z","snapshot_observed_at":"2026-07-06T23:27:52.850836Z","submitted_at":"2026-05-16T03:43:10Z","title":"Lever: Speculative LLM Inference on Smartphones","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-19T21:44:11.735963Z"},"links":{"cited_paper":"/paper/2310.11453","citing_paper":"/paper/2605.16786"},"observation_digest":"sha256:bcebe83f5d10ec673212c931b8161a171f658e3840ca0acd2cf0443a0064e2ba","observation_id":"e5b61e7b-8026-4c81-9064-08b3d4a162c9","resolution":{"observed_at":"2026-05-19T21:47:48.486580Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"OPT-tree: Speculative decoding with adaptive draft tree structure.Transactions of the Association for Computational Linguistics, 13:188–199","venue":null,"work_id":"f29b6ada-4907-4a4a-ad65-c5db40181bc4","year":2025},"citing_paper":{"arxiv_id":"2605.16786","last_updated":"2026-05-16T03:43:10Z","snapshot_observed_at":"2026-07-06T23:27:52.850836Z","submitted_at":"2026-05-16T03:43:10Z","title":"Lever: Speculative LLM Inference on Smartphones","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-19T21:44:11.735963Z"},"links":{"citing_paper":"/paper/2605.16786"},"observation_digest":"sha256:c4eb5677a5712adc600382d47adc69a9777fb869e476c736d593f017ddb51458","observation_id":"a6c2edc2-a107-41ca-a1b9-f6615c9ff43d","resolution":{"observed_at":"2026-05-19T21:53:14.734189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"JENGA: Enhancing LLM Long-Context fine-tuning with con- textual token sparsity","venue":null,"work_id":"4fa40a6a-a625-4b0e-a6f3-3b605ee35758","year":2025},"citing_paper":{"arxiv_id":"2605.16786","last_updated":"2026-05-16T03:43:10Z","snapshot_observed_at":"2026-07-06T23:27:52.850836Z","submitted_at":"2026-05-16T03:43:10Z","title":"Lever: Speculative LLM Inference on Smartphones","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-19T21:44:11.735963Z"},"links":{"citing_paper":"/paper/2605.16786"},"observation_digest":"sha256:7aa6139343be23ee5ee336182f2b04dcc5bcaae843a63901c3e13cb62212e892","observation_id":"b9334896-7057-4559-98d9-fa463ccd9d48","resolution":{"observed_at":"2026-05-19T21:53:14.770773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.17803","doi":"10.48550/arxiv.2603.17803","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SWARM: Co- activation aware KVCache offloading across multiple SSDs","venue":"arXiv (Cornell University)","work_id":"85df4b27-b127-423a-b765-d120c1d024ac","year":2026},"citing_paper":{"arxiv_id":"2605.16786","last_updated":"2026-05-16T03:43:10Z","snapshot_observed_at":"2026-07-06T23:27:52.850836Z","submitted_at":"2026-05-16T03:43:10Z","title":"Lever: Speculative LLM Inference on Smartphones","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-19T21:44:11.735963Z"},"links":{"citing_paper":"/paper/2605.16786"},"observation_digest":"sha256:7c16ffda7d840621da4842b577755946948b377a749be71776640d97098e796c","observation_id":"fd04f795-bb45-447c-b4e5-cff42508daa7","resolution":{"observed_at":"2026-05-19T21:47:48.498196Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Neuralink: Fast on-device llm inference with neuron co-activation linking","venue":null,"work_id":"8c353cee-61f9-44b6-9576-24f117ee858e","year":2025},"citing_paper":{"arxiv_id":"2605.16786","last_updated":"2026-05-16T03:43:10Z","snapshot_observed_at":"2026-07-06T23:27:52.850836Z","submitted_at":"2026-05-16T03:43:10Z","title":"Lever: Speculative LLM Inference on Smartphones","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-19T21:44:11.735963Z"},"links":{"citing_paper":"/paper/2605.16786"},"observation_digest":"sha256:c16656d1d83f6cc93089de9f20aa8f98268a880e4e34ac9957156a31c098c9d7","observation_id":"2d7bdc98-a329-4bdd-ba93-813a0514f57d","resolution":{"observed_at":"2026-05-19T21:53:14.768293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.07427","doi":"10.48550/arxiv.2511.07427","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DynaKV: Enabling accurate and efficient long-sequence LLM decoding on smartphones","venue":"ArXiv.org","work_id":"2cdfa89b-9a64-4d1a-b631-33fb6cd6b3b9","year":2025},"citing_paper":{"arxiv_id":"2605.16786","last_updated":"2026-05-16T03:43:10Z","snapshot_observed_at":"2026-07-06T23:27:52.850836Z","submitted_at":"2026-05-16T03:43:10Z","title":"Lever: Speculative LLM Inference on Smartphones","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-19T21:44:11.735963Z"},"links":{"citing_paper":"/paper/2605.16786"},"observation_digest":"sha256:4711e14d1f5d42e9d1ba5fd354d0afc0f773f29944640d979f2615d7d22d655a","observation_id":"4c6efb37-e32a-4645-ac99-d614070de065","resolution":{"observed_at":"2026-05-19T21:47:48.501015Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Long Exposure: Accelerating parameter- efficient fine-tuning for LLMs under shadowy sparsity","venue":null,"work_id":"b8251444-932f-4063-9846-d802f6b9216c","year":2024},"citing_paper":{"arxiv_id":"2605.16786","last_updated":"2026-05-16T03:43:10Z","snapshot_observed_at":"2026-07-06T23:27:52.850836Z","submitted_at":"2026-05-16T03:43:10Z","title":"Lever: Speculative LLM Inference on Smartphones","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-19T21:44:11.735963Z"},"links":{"citing_paper":"/paper/2605.16786"},"observation_digest":"sha256:ff241c183df3c8c979251bd287a6c61f3ad6cf0a12da47a750a2e686501a15c8","observation_id":"1bb69f58-0f30-4c85-9323-3af3c30743fb","resolution":{"observed_at":"2026-05-19T21:53:14.738404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.10060","last_updated":"2026-04-11T06:54:56Z","snapshot_observed_at":"2026-07-06T22:58:47.599383Z","submitted_at":"2026-04-11T06:54:56Z","title":"Mosaic: Cross-Modal Clustering for Efficient Video Understanding","version":1},"cited_work":{"arxiv_id":"2604.10060","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.10060","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mosaic: Cross-Modal Clustering for Efficient Video Understanding","venue":"cs.PF","work_id":"8ac70cad-429e-4e86-962b-f9503373a3e7","year":2026},"citing_paper":{"arxiv_id":"2605.16786","last_updated":"2026-05-16T03:43:10Z","snapshot_observed_at":"2026-07-06T23:27:52.850836Z","submitted_at":"2026-05-16T03:43:10Z","title":"Lever: Speculative LLM Inference on Smartphones","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-19T21:44:11.735963Z"},"links":{"cited_paper":"/paper/2604.10060","citing_paper":"/paper/2605.16786"},"observation_digest":"sha256:753472fc52cb296868ca8a5ac1c0c33c1205bd36faa30208dbc45edc4b377cc1","observation_id":"50b94e6d-310f-4e86-ae6a-7479332d9588","resolution":{"observed_at":"2026-05-19T21:47:48.495034Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"SmoothQuant: Accurate and efficient post-training quantization for large language models","venue":null,"work_id":"2e5f36f8-78ec-4653-a428-c77f2a343fbc","year":2023},"citing_paper":{"arxiv_id":"2605.16786","last_updated":"2026-05-16T03:43:10Z","snapshot_observed_at":"2026-07-06T23:27:52.850836Z","submitted_at":"2026-05-16T03:43:10Z","title":"Lever: Speculative LLM Inference on Smartphones","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-19T21:44:11.735963Z"},"links":{"citing_paper":"/paper/2605.16786"},"observation_digest":"sha256:b87a02b00134f9f8d7f97a0044233bf997e30789f28a52d61b4ff511a1484bac","observation_id":"7aad47aa-567c-4c32-ad94-b0939b439caa","resolution":{"observed_at":"2026-05-19T21:53:14.785339Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dee- BERT: Dynamic early exiting for accelerating BERT inference","venue":null,"work_id":"3d81087a-75fd-4c15-bf93-14f14b9b859a","year":2020},"citing_paper":{"arxiv_id":"2605.16786","last_updated":"2026-05-16T03:43:10Z","snapshot_observed_at":"2026-07-06T23:27:52.850836Z","submitted_at":"2026-05-16T03:43:10Z","title":"Lever: Speculative LLM Inference on Smartphones","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-19T21:44:11.735963Z"},"links":{"citing_paper":"/paper/2605.16786"},"observation_digest":"sha256:889d7b8d63e4114917f4afc157cf831d9570f794efcd05f351d35969c31b4455","observation_id":"119da033-5b1c-4ad6-b959-cd18aa96eebf","resolution":{"observed_at":"2026-05-19T21:53:14.759602Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Edgellm: Fast on-device llm inference with speculative decoding.IEEE Transactions on Mobile Computing, 24(4):3256–3273","venue":null,"work_id":"dc1f806d-e6d5-4d78-b676-43356a344be1","year":2024},"citing_paper":{"arxiv_id":"2605.16786","last_updated":"2026-05-16T03:43:10Z","snapshot_observed_at":"2026-07-06T23:27:52.850836Z","submitted_at":"2026-05-16T03:43:10Z","title":"Lever: Speculative LLM Inference on Smartphones","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-19T21:44:11.735963Z"},"links":{"citing_paper":"/paper/2605.16786"},"observation_digest":"sha256:7a76ef7a7472397b14fb7e90a9cd532fccce44b7758dcca703a5278a64eeaab0","observation_id":"d07a455a-f962-4c5a-8548-1a192cfde327","resolution":{"observed_at":"2026-05-19T21:53:14.727483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06282","last_updated":"2024-12-12T12:24:18Z","snapshot_observed_at":"2026-08-06T16:06:48.213787Z","submitted_at":"2024-06-10T14:01:21Z","title":"PowerInfer-2: Fast Large Language Model Inference on a Smartphone","version":3},"cited_work":{"arxiv_id":"2406.06282","doi":"10.48550/arxiv.2406.06282","metadata_source":"pith","pith_arxiv_id":"2406.06282","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Powerinfer-2: Fast large language model inference on a smartphone","venue":"cs.LG","work_id":"c835ae36-bf61-4365-8156-febeba198d32","year":2024},"citing_paper":{"arxiv_id":"2605.16786","last_updated":"2026-05-16T03:43:10Z","snapshot_observed_at":"2026-07-06T23:27:52.850836Z","submitted_at":"2026-05-16T03:43:10Z","title":"Lever: Speculative LLM Inference on Smartphones","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-19T21:44:11.735963Z"},"links":{"cited_paper":"/paper/2406.06282","citing_paper":"/paper/2605.16786"},"observation_digest":"sha256:5463c02e9ceee06654aaf998126a07de0a871cc6c3044edf0c55b642d3af76ac","observation_id":"1d99e954-1e6b-495a-b3a5-5857d15d1b5d","resolution":{"observed_at":"2026-05-19T21:47:48.483707Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A first look at efficient and secure on-device LLM inference against KV leakage","venue":null,"work_id":"d79199cf-da0d-481f-96e4-64d88d23d6a0","year":2024},"citing_paper":{"arxiv_id":"2605.16786","last_updated":"2026-05-16T03:43:10Z","snapshot_observed_at":"2026-07-06T23:27:52.850836Z","submitted_at":"2026-05-16T03:43:10Z","title":"Lever: Speculative LLM Inference on Smartphones","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-19T21:44:11.735963Z"},"links":{"citing_paper":"/paper/2605.16786"},"observation_digest":"sha256:f6e575f4c4808357bdaf3a471a1990c79a5a3860c1b30becb37b7ae8cec23954","observation_id":"d232f587-7c61-4aaa-9f75-57d0fc04566f","resolution":{"observed_at":"2026-05-19T21:53:14.730334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Prism: Privacy-aware routing for adaptive cloud–edge llm inference via se- mantic sketch collaboration","venue":null,"work_id":"ff065f0b-0956-4cb5-8d91-d1a9eb422c4d","year":2026},"citing_paper":{"arxiv_id":"2605.16786","last_updated":"2026-05-16T03:43:10Z","snapshot_observed_at":"2026-07-06T23:27:52.850836Z","submitted_at":"2026-05-16T03:43:10Z","title":"Lever: Speculative LLM Inference on Smartphones","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-19T21:44:11.735963Z"},"links":{"citing_paper":"/paper/2605.16786"},"observation_digest":"sha256:a159ef1e2af73054d25ff2b42642c843e615f4520170f973117914a57a857f30","observation_id":"5a8811b9-0cac-434a-90a4-67032ffba475","resolution":{"observed_at":"2026-05-19T21:53:14.732253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Edgeshard: Efficient llm inference via collaborative edge com- puting.IEEE Internet of Things Journal, 12(10):13119–13131","venue":null,"work_id":"c9a0d7e4-feaa-49ba-83fc-887f9be3881c","year":2024},"citing_paper":{"arxiv_id":"2605.16786","last_updated":"2026-05-16T03:43:10Z","snapshot_observed_at":"2026-07-06T23:27:52.850836Z","submitted_at":"2026-05-16T03:43:10Z","title":"Lever: Speculative LLM Inference on Smartphones","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-19T21:44:11.735963Z"},"links":{"citing_paper":"/paper/2605.16786"},"observation_digest":"sha256:5e23b1aa2a269b41432fc6811ed087b7c47ce3fb8464fdd2960090876fbf18b6","observation_id":"619a6814-d07b-4818-bdf3-617c75127f91","resolution":{"observed_at":"2026-05-19T21:53:14.757555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Xing, Hao Zhang, Joseph E","venue":null,"work_id":"80313bfa-523b-424d-8930-58cbf06605c9","year":2023},"citing_paper":{"arxiv_id":"2605.16786","last_updated":"2026-05-16T03:43:10Z","snapshot_observed_at":"2026-07-06T23:27:52.850836Z","submitted_at":"2026-05-16T03:43:10Z","title":"Lever: Speculative LLM Inference on Smartphones","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-19T21:44:11.735963Z"},"links":{"citing_paper":"/paper/2605.16786"},"observation_digest":"sha256:fcf33d784b9242370e27ca66982537c3f34c2d932d04e45cbb51f33ef3e9d928","observation_id":"2e58a536-11af-4852-a4ef-ee19f4b32f63","resolution":{"observed_at":"2026-05-19T21:53:14.751969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.16786","last_updated":"2026-05-16T03:43:10Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T23:27:52.850836Z","submitted_at":"2026-05-16T03:43:10Z","title":"Lever: Speculative LLM Inference on Smartphones"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":12,"verified_fuzzy":28},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 0 inbound Pith citation observations for arXiv:2605.16786."}