{"as_of":"2026-08-08T09:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:709b0757f7a1708fb0a64eea9f2a395136f4027d640e0b1a9c9c97af4ea74899","coverage":[{"denominator":71,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":71,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:02:39.419910Z","state":"measured"},{"denominator":75,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":75,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T04:16:08.552840Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-30T08:44:27.295523Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03700","snapshot_observed_at":"2026-08-04T13:15:30.182708Z","title":"Adadecode: Accelerating llm decoding with adaptive layer parallelism.arXiv preprint arXiv:2506.03700,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.01336","last_updated":"2026-05-26T05:53:44Z","snapshot_observed_at":"2026-08-04T13:15:28.029864Z","submitted_at":"2025-10-01T18:04:14Z","title":"HiSpec: Hierarchical Speculative Decoding for LLMs","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T13:15:30.182708Z"},"links":{"cited_paper":"/paper/2506.03700","citing_paper":"/paper/2510.01336"},"observation_digest":"sha256:48e51f30bb23e86b0f821e81cfaa7864c2fd24c18ca06f3a4706b37c5466920f","observation_id":"f6daaf60-f3ba-4e44-b348-d33c26c2b93a","resolution":{"observed_at":"2026-08-04T13:15:30.182708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"cited_work":{"arxiv_id":"2506.03700","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03700","snapshot_observed_at":"2026-06-30T08:44:27.295523Z","title":"Zhuofan Wen, Shangtong Gui, and Yang Feng","venue":null,"work_id":"ff8086b5-d03d-4644-9a5e-fe1ac9fbabf7","year":2025},"citing_paper":{"arxiv_id":"2604.12247","last_updated":"2026-04-14T03:47:04Z","snapshot_observed_at":"2026-07-06T23:00:28.036409Z","submitted_at":"2026-04-14T03:47:04Z","title":"SpecBound: Adaptive Bounded Self-Speculation with Layer-wise Confidence Calibration","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T16:22:05.049712Z"},"links":{"cited_paper":"/paper/2506.03700","citing_paper":"/paper/2604.12247"},"observation_digest":"sha256:380455f75c05bb3445f5af4ea44a4036d75c66fd39d3cce28118218094c83fb5","observation_id":"475e5a31-0525-44da-9544-e3508eba031d","resolution":{"observed_at":"2026-05-11T09:00:58.697801Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"cited_work":{"arxiv_id":"2506.03700","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03700","snapshot_observed_at":"2026-06-30T08:44:27.295523Z","title":"Zhuofan Wen, Shangtong Gui, and Yang Feng","venue":null,"work_id":"ff8086b5-d03d-4644-9a5e-fe1ac9fbabf7","year":2025},"citing_paper":{"arxiv_id":"2606.29223","last_updated":"2026-06-28T06:22:09Z","snapshot_observed_at":"2026-07-07T00:03:12.330608Z","submitted_at":"2026-06-28T06:22:09Z","title":"Depth Exploration for LLM Decoding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-30T08:43:47.472682Z"},"links":{"cited_paper":"/paper/2506.03700","citing_paper":"/paper/2606.29223"},"observation_digest":"sha256:f1f66bd4878f6b3633d3e35cf4cdf5deea0fde1364f9a3b8bee88fe2bf9a0b46","observation_id":"642cdc18-96fd-4579-97ce-916b42d78cd2","resolution":{"observed_at":"2026-06-30T08:44:27.297075Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03700","snapshot_observed_at":"2026-08-05T04:16:08.552840Z","title":"arXiv preprint arXiv:2506.03700 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04010","last_updated":"2026-08-04T17:59:58Z","snapshot_observed_at":"2026-08-07T23:12:49.183386Z","submitted_at":"2026-08-04T17:59:58Z","title":"ParVL: Parallel Scaling and Expandable Compute Allocation for Multimodal LLMs","version":1},"reference_index":115,"source":"arxiv_source","source_observed_at":"2026-08-05T04:16:08.552840Z"},"links":{"cited_paper":"/paper/2506.03700","citing_paper":"/paper/2608.04010"},"observation_digest":"sha256:af2a0ecba21160c2641182b9e00123e9b0c86f5716a5754cc15d91ed67549e60","observation_id":"ca429a9b-ae99-4be2-b3ba-6fe0e5517d08","resolution":{"observed_at":"2026-08-05T04:16:08.552840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.03700/citation-record","integrity":"/paper/2506.03700/integrity","json":"/paper/2506.03700/citation-record.json","paper":"/paper/2506.03700"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:39.111163Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.111163Z"},"links":{"citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:1d521af6637ee3ee440d839e53926827eb8a04cd6b14a7fa82e41dc569b64e68","observation_id":"4bbd273e-ae5b-44cd-b242-8d013d4217c0","resolution":{"observed_at":"2026-08-07T11:02:39.111163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T11:02:39.117325Z","title":"L., Almeida, D., Altenschmidt, J., Altman, S., Anadkat, S., et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.117325Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:c56e83bd3482773022186f9e1afd8d4bb6abed9902b59d48e7df07868fec404c","observation_id":"e876ddf6-366d-4099-a62e-a32c355c1ba1","resolution":{"observed_at":"2026-08-07T11:02:39.117325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:40.537453Z","title":"Hydra: Sequentially-dependent draft heads for medusa decoding","venue":null,"work_id":"a6739bfb-a644-4b28-a974-1e08ccc0fbb9","year":2024},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.122576Z"},"links":{"citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:4a3a5554ebef96c3f18bac91e2b304fd684427cecc82596014b372b4fceb4340","observation_id":"fa0354e5-809f-4963-96b7-b4e489d0721f","resolution":{"observed_at":"2026-08-07T11:02:40.542572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:40.521725Z","title":"Anthropic: Introducing claude 3.5 sonnet, 2024","venue":null,"work_id":"8e6cc60a-cb82-47e3-a1e8-586cbac3eea0","year":2024},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.127205Z"},"links":{"citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:e5e68383e188268800a46c2cf073aa2a1e47af08d6ead3a20d64033853914314","observation_id":"cc87aa4a-3646-4859-b130-69d357c602d1","resolution":{"observed_at":"2026-08-07T11:02:40.526458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-02T19:23:53.535075Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-07T11:02:39.131952Z","title":"Program synthesis with large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.131952Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:bbdf46fecd01552d4b04eaea857de1b8b33ff0ac98fd21a288745bcb28e9349c","observation_id":"19c0759c-be96-4050-8989-a97eb1fd32cd","resolution":{"observed_at":"2026-08-07T11:02:39.131952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:39.136964Z","title":"Fast and robust early-exiting framework for autoregressive language models with synchronized parallel decoding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.136964Z"},"links":{"citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:4dd4a1652b5deb8cc0f0fce7b224ae48088659f5cd1d3f99ed918801ebd5aba7","observation_id":"19d12a47-2d5d-44d4-8aea-3aee6179fd5d","resolution":{"observed_at":"2026-08-07T11:02:39.136964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.07055","last_updated":"2024-08-13T17:46:12Z","snapshot_observed_at":"2026-07-06T19:00:17.992934Z","submitted_at":"2024-08-13T17:46:12Z","title":"LongWriter: Unleashing 10,000+ Word Generation from Long Context LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.07055","snapshot_observed_at":"2026-08-07T11:02:39.141519Z","title":"LongWriter : Unleashing 10,000+ word generation from long context llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.141519Z"},"links":{"cited_paper":"/paper/2408.07055","citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:cc953e1de07150088b2e27b0c170a679056060ef13a3a75d8f851db043022ab9","observation_id":"b8914505-6fde-4fe7-8f1d-0292bec2367d","resolution":{"observed_at":"2026-08-07T11:02:39.141519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21787","last_updated":"2024-12-30T19:03:24Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:57:25Z","title":"Large Language Monkeys: Scaling Inference Compute with Repeated Sampling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21787","snapshot_observed_at":"2026-08-07T11:02:39.146799Z","title":"V., R \\'e , C., and Mirhoseini, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.146799Z"},"links":{"cited_paper":"/paper/2407.21787","citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:25566460f720ac023f2a105b570ff0f2c185dabc37b84484c93bd483effba887","observation_id":"dad9f962-f222-425e-8389-f2f82e441797","resolution":{"observed_at":"2026-08-07T11:02:39.146799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:40.495104Z","title":"D., Chen, D., and Dao, T","venue":null,"work_id":"25fe5d29-227a-47f5-9c61-c37620612716","year":2024},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.151371Z"},"links":{"citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:8f410c1c31cce4a7d703768c74cd88e2023266523a61d3117da527c000c31d94","observation_id":"a6d50787-59f9-4d9b-9fde-cbfb998908a9","resolution":{"observed_at":"2026-08-07T11:02:40.499957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.01318","last_updated":"2023-02-02T18:44:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-02T18:44:11Z","title":"Accelerating Large Language Model Decoding with Speculative Sampling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.01318","snapshot_observed_at":"2026-08-07T11:02:39.155905Z","title":"Accelerating large language model decoding with speculative sampling","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.155905Z"},"links":{"cited_paper":"/paper/2302.01318","citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:1f150f482e6e32438d4b4b5b15a55a71bccf8803b18e2941b5653f153fbf5b4d","observation_id":"d6f76329-635d-4bdd-8141-deb9541e6a9e","resolution":{"observed_at":"2026-08-07T11:02:39.155905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06467","last_updated":"2024-12-06T16:50:13Z","snapshot_observed_at":"2026-07-06T19:30:04.518857Z","submitted_at":"2024-10-09T01:41:14Z","title":"WAPITI: A Watermark for Finetuned Open-Source LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06467","snapshot_observed_at":"2026-08-07T11:02:39.160378Z","title":"WAPITI : A watermark for finetuned open-source LLMs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.160378Z"},"links":{"cited_paper":"/paper/2410.06467","citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:6bc861f6c9aa8fbd82ee0bc1c3159bc99ae335e1c03a0793cf02fef9eb4996d2","observation_id":"517a3181-d6a9-43b6-b6a7-e03263455086","resolution":{"observed_at":"2026-08-07T11:02:39.160378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T04:13:14.044604Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-07T11:02:39.164777Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.164777Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:f4b47847e3f87cfc34563b77ec70d8f4de64729e880f8fee700d02a86f8b233e","observation_id":"2995c851-694e-414b-8043-b2cf4dc76ec0","resolution":{"observed_at":"2026-08-07T11:02:39.164777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T11:02:39.169280Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.169280Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:a04cee9ff20adad5f563800ff57fb38606e318e7eab651bfede807e0e91cf927","observation_id":"06865bfe-f5cb-4986-bc51-0c98ec6ac986","resolution":{"observed_at":"2026-08-07T11:02:39.169280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:39.173568Z","title":"Flashattention-2: Faster attention with better parallelism and work partitioning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.173568Z"},"links":{"citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:7f9edb57f7ca4cb877b133adf2f742843c9d219edff9cbb6f5028755b0ddeda2","observation_id":"b5ab56a2-a86e-48d8-aeee-ffb48ab8ecca","resolution":{"observed_at":"2026-08-07T11:02:39.173568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02954","last_updated":"2024-01-05T18:59:13Z","snapshot_observed_at":"2026-08-02T13:11:16.882565Z","submitted_at":"2024-01-05T18:59:13Z","title":"DeepSeek LLM: Scaling Open-Source Language Models with Longtermism","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02954","snapshot_observed_at":"2026-08-07T11:02:39.177936Z","title":"DeepSeek LLM : Scaling open-source language models with longtermism","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.177936Z"},"links":{"cited_paper":"/paper/2401.02954","citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:6cc98b3609270f53780be5a520c31d59eba5fbcc3757c7bcdc7a52a15dc7ee48","observation_id":"c5a98939-fdc4-4245-b86f-46aa7c54c832","resolution":{"observed_at":"2026-08-07T11:02:39.177936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T11:02:39.182650Z","title":"DeepSeek-R1 : Incentivizing reasoning capability in LLMs via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.182650Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:2970446775230a07423ca570f3c5e7df69756b7a6cd315b537d1338c70e84fe8","observation_id":"18e49189-a87c-4c21-9a4e-6006e3a73a7f","resolution":{"observed_at":"2026-08-07T11:02:39.182650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02628","last_updated":"2023-07-05T19:59:09Z","snapshot_observed_at":"2026-07-06T15:50:49.116859Z","submitted_at":"2023-07-05T19:59:09Z","title":"SkipDecode: Autoregressive Skip Decoding with Batching and Caching for Efficient LLM Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.02628","snapshot_observed_at":"2026-08-07T11:02:39.187286Z","title":"Skipdecode: Autoregressive skip decoding with batching and caching for efficient LLM inference","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.187286Z"},"links":{"cited_paper":"/paper/2307.02628","citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:c662fcfb761827c0da181af40c8a3847aab9a8c5099cf3f93ba02d555ba6d9d9","observation_id":"8387e030-7012-406e-b94c-0a712bcafefc","resolution":{"observed_at":"2026-08-07T11:02:39.187286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:40.469982Z","title":"QLoRA : Efficient finetuning of quantized LLMs","venue":null,"work_id":"d180e22a-d278-4c7f-a7b9-9d4618487ca7","year":2023},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.193356Z"},"links":{"citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:2430ea72fe468614f45288a28d69f7e8672376fa540ca5977e610d30e9a50efe","observation_id":"38732595-4509-47ae-922b-34fc6e2a3a39","resolution":{"observed_at":"2026-08-07T11:02:40.474491Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.09435","last_updated":"2024-06-18T19:58:27Z","snapshot_observed_at":"2026-08-06T04:15:47.311049Z","submitted_at":"2023-03-16T16:10:16Z","title":"Jump to Conclusions: Short-Cutting Transformers With Linear Transformations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.09435","snapshot_observed_at":"2026-08-07T11:02:39.197592Z","title":"Y., Karidi, T., Choshen, L., and Geva, M","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.197592Z"},"links":{"cited_paper":"/paper/2303.09435","citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:bea848803ad80aba26ce478f65d0763a77b718bc2dc31bd9d5f4499faf980466","observation_id":"7b6071e4-831a-43f8-8200-da6fc141262c","resolution":{"observed_at":"2026-08-07T11:02:39.197592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:40.455302Z","title":"Glide with a cape: A low-hassle method to accelerate speculative decoding","venue":null,"work_id":"4aa88216-a916-40ea-8d33-e31ab017cada","year":2024},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.202238Z"},"links":{"citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:039cbbc2389139ee95f1f342ee6912561aa73a0465d0cef5490568153be21b00","observation_id":"8ab443d8-4c37-4ed2-881b-a094f71fe195","resolution":{"observed_at":"2026-08-07T11:02:40.459979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T11:02:39.206389Z","title":"The Llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.206389Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:118233489b280817d44037e09286ade6893dc85b1c3dd3ff10cbe510ffbf6e4e","observation_id":"15e11d1e-e8f8-4514-815f-f1ae43ebe166","resolution":{"observed_at":"2026-08-07T11:02:39.206389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:40.440792Z","title":"Depth-adaptive transformer","venue":null,"work_id":"6278d262-bbfd-456c-9d39-d84209d52d23","year":2020},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.210467Z"},"links":{"citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:2a1d9aceb858b1cc745d062a28592b3c84099854ddcaf0d076879e1a14a8a8fb","observation_id":"e86cd2b5-5a9a-440d-be4c-034879542cfd","resolution":{"observed_at":"2026-08-07T11:02:40.445245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:40.425488Z","title":"L ayer S kip: Enabling early exit inference and self-speculative decoding","venue":null,"work_id":"cef8b44f-182e-46e3-ab9e-29a243842973","year":2024},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.214544Z"},"links":{"citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:e6d889b7a2b470937759ff4c25c15f2e16beee03ad7f0565f13ae2a5f10b86dd","observation_id":"a80e998c-4443-4ea8-adbe-f0323b900831","resolution":{"observed_at":"2026-08-07T11:02:40.430525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:40.410565Z","title":"Break the sequential dependency of LLM inference using lookahead decoding","venue":null,"work_id":"eef8e80d-e76e-485c-93e5-6e826123a8d2","year":2024},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.218593Z"},"links":{"citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:e2f4a7081016c65dd4bc36c0158f68e164704533c88005607cd7417f228f6282","observation_id":"201dc01e-7564-4e6e-a3fa-9b6a8a11b585","resolution":{"observed_at":"2026-08-07T11:02:40.415153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:40.394685Z","title":"Transformer feed-forward layers build predictions by promoting concepts in the vocabulary space","venue":null,"work_id":"10d5f668-8e48-43b7-9a93-bedf46d98121","year":2022},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.222519Z"},"links":{"citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:9d9d0d9b663b34fe57c9fbb6b5f0b851a1d5b707074716705eb2b3de5480f2e6","observation_id":"bb14de1f-0ab4-4afb-8f6a-818d935ffdca","resolution":{"observed_at":"2026-08-07T11:02:40.399611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04519","last_updated":"2025-01-08T14:12:57Z","snapshot_observed_at":"2026-08-04T20:57:22.329262Z","submitted_at":"2025-01-08T14:12:57Z","title":"rStar-Math: Small LLMs Can Master Math Reasoning with Self-Evolved Deep Thinking","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04519","snapshot_observed_at":"2026-08-07T11:02:39.226807Z","title":"L., Liu, Y., Shang, N., Sun, Y., Zhu, Y., Yang, F., and Yang, M","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.226807Z"},"links":{"cited_paper":"/paper/2501.04519","citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:bd48cb8d2ad9242aff2c456b13e00ab5ab5ab4f85efb122b37b8ab6dcdd2c6fd","observation_id":"94f56415-7df1-433c-b465-91a8350e4ce4","resolution":{"observed_at":"2026-08-07T11:02:39.226807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:40.378000Z","title":"REST : Retrieval-based speculative decoding","venue":null,"work_id":"7dee5c07-c28c-45cb-ba47-9021104dc52e","year":2024},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.231129Z"},"links":{"citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:ec173e3290c259af32218cd3c279090f286aef0c76cd12a645bad7f73865e9f6","observation_id":"5bed347e-7dc9-447c-a58b-b38a6354fe65","resolution":{"observed_at":"2026-08-07T11:02:40.383163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-07-06T12:54:11.616335Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-07T11:02:39.235113Z","title":"A., Welbl, J., Clark, A., Hennigan, T., Noland, E., Millican, K., van den Driessche, G., Damoc, B., Guy, A., Osindero, S., Simonyan, K., Elsen, E., Rae, J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.235113Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:cc9c7b274de763a813eee831eb22ac057831d0c90c5f27df92250dc059f7c315","observation_id":"a12cfdc8-b27b-4192-a2d0-6e48d50e6eb5","resolution":{"observed_at":"2026-08-07T11:02:39.235113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:40.362103Z","title":"The curious case of neural text degeneration","venue":null,"work_id":"e3d2d144-6044-441b-ae85-19f5648d80ee","year":2020},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.239313Z"},"links":{"citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:5dc0fc018ed3c294f1949eaa853083e1631ec06e014c59befb1a8ec8c5f2505b","observation_id":"daff1876-b4f7-4876-b4fd-120090b0c010","resolution":{"observed_at":"2026-08-07T11:02:40.366794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12072","last_updated":"2024-01-03T00:32:43Z","snapshot_observed_at":"2026-07-06T16:35:07.121479Z","submitted_at":"2023-10-18T16:07:01Z","title":"SPEED: Speculative Pipelined Execution for Efficient Decoding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12072","snapshot_observed_at":"2026-08-07T11:02:39.243484Z","title":"Speed: Speculative pipelined execution for efficient decoding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.243484Z"},"links":{"cited_paper":"/paper/2310.12072","citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:e3fb88ec43c5c8414992d85a8ecd6e82c092f5c71a76c2999859b3415d3b4dbb","observation_id":"5b54c427-bdf2-4722-a5b0-6f787aff1049","resolution":{"observed_at":"2026-08-07T11:02:39.243484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:40.347062Z","title":"E., Shen, Y., Wallis, P., Allen-Zhu, Z., Li, Y., Wang, S., and Chen, W","venue":null,"work_id":"a533bb01-4fa0-4070-84b2-0df9dbf3181d","year":2022},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.247841Z"},"links":{"citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:c070e7aa82739c6e18e80fe836ba7191449b147cbe476e42b6744b9ceb6c0dd1","observation_id":"8031e3f1-13b2-4eed-8dad-9b94ecfa7908","resolution":{"observed_at":"2026-08-07T11:02:40.351586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.00031","last_updated":"2025-02-25T00:21:14Z","snapshot_observed_at":"2026-08-07T17:51:38.471379Z","submitted_at":"2025-02-25T00:21:14Z","title":"Efficient Test-Time Scaling via Self-Calibration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.00031","snapshot_observed_at":"2026-08-07T11:02:39.251956Z","title":"Efficient test-time scaling via self-calibration","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.251956Z"},"links":{"cited_paper":"/paper/2503.00031","citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:0b218c6c61a582604623c8af8ec36cbb7837aed1a8daa9626d342ff5cd4a92ad","observation_id":"92faf0a8-b416-4acc-8d08-63636b1f2689","resolution":{"observed_at":"2026-08-07T11:02:39.251956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:40.332220Z","title":"Multi-scale dense networks for resource efficient image classification","venue":null,"work_id":"bc56766c-0eb1-486c-bfbe-9fe64cf44fa7","year":2018},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.256248Z"},"links":{"citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:620e84d8ef865b80e2dcaff8861d9f88e91dd26dad53b519311e296e8b2f7222","observation_id":"0b37d04a-8585-4b7f-9845-86a22812cabb","resolution":{"observed_at":"2026-08-07T11:02:40.336787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19715","last_updated":"2025-07-11T01:33:18Z","snapshot_observed_at":"2026-08-08T01:15:52.225102Z","submitted_at":"2024-05-30T05:49:38Z","title":"SpecDec++: Boosting Speculative Decoding via Adaptive Candidate Lengths","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19715","snapshot_observed_at":"2026-08-07T11:02:39.260580Z","title":"Specdec++: Boosting speculative decoding via adaptive candidate lengths","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.260580Z"},"links":{"cited_paper":"/paper/2405.19715","citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:8b0fb7e492d21be0a1998b5f57fa35acf6b84fe1593c8763c6654f8fbbe0c3ba","observation_id":"c6ba6a95-54c5-4eb3-b122-6a9b5d7193e7","resolution":{"observed_at":"2026-08-07T11:02:39.260580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:40.317291Z","title":"A survey on hallucination in large language models: Principles, taxonomy, challenges, and open questions","venue":null,"work_id":"637c2aec-fe5a-44fd-83aa-52ba4ca76d20","year":2023},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.264904Z"},"links":{"citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:76beef4468e1c087577ed4daa3e257c3675cd95c6dcc63b6d67647b9adc57810","observation_id":"757b7c6c-b126-4ce0-84d0-6d6d96164eeb","resolution":{"observed_at":"2026-08-07T11:02:40.321949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-08T06:16:25.839566Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-07T11:02:39.268868Z","title":"Q., Sablayrolles, A., Roux, A., Mensch, A., Savary, B., Bamford, C., Chaplot, D","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.268868Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:dde34381384f349b7676083c990183ebdf93cab389145930376fb2a7b65f9492","observation_id":"411e6a88-6391-4fd9-b649-592e0f0e39da","resolution":{"observed_at":"2026-08-07T11:02:39.268868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:40.302087Z","title":"Sigsoftmax: Reanalysis of the softmax bottleneck","venue":null,"work_id":"5bc237c7-c74b-4b4d-97bd-0d7928888130","year":2018},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.273111Z"},"links":{"citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:0d61cbd56c959e267309221205a048a5a411595cd0dfe8a1dc75156e20783db9","observation_id":"8ef25ad9-1f64-4dba-a51a-44173e48128e","resolution":{"observed_at":"2026-08-07T11:02:40.307036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-07T11:02:39.277280Z","title":"B., Chess, B., Child, R., Gray, S., Radford, A., Wu, J., and Amodei, D","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.277280Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:7dc1ae4fdfeba88f6f24ee3e790851e1a800000a10397d0cbf195cf072ff4cb3","observation_id":"1b63bef3-2853-4021-818a-d4ccc8d5b4e0","resolution":{"observed_at":"2026-08-07T11:02:39.277280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.13019","last_updated":"2024-05-24T07:40:27Z","snapshot_observed_at":"2026-07-06T18:17:29.822273Z","submitted_at":"2024-05-15T07:36:56Z","title":"A Comprehensive Survey of Accelerated Generation Techniques in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.13019","snapshot_observed_at":"2026-08-07T11:02:39.281273Z","title":"A comprehensive survey of accelerated generation techniques in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.281273Z"},"links":{"cited_paper":"/paper/2405.13019","citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:78b68e78dc74fc6dadd741471f9a16a7f8520666aa56b7bd0589fccb34c35dc6","observation_id":"471210c7-f1bc-4815-8654-554b09d948a9","resolution":{"observed_at":"2026-08-07T11:02:39.281273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:39.285634Z","title":"W., Gholami, A., and Keutzer, K","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.285634Z"},"links":{"citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:9cbec45656a0cb24439245516663905a702ae2d0ba52ca2327e026f2554a88db","observation_id":"2beb81a9-c3c8-4764-a4ce-583a06234c48","resolution":{"observed_at":"2026-08-07T11:02:39.285634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-07T11:02:39.289715Z","title":"Kimi K1.5 : Scaling reinforcement learning with LLMs","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.289715Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:8aefb7bb64d3179e82b88e63166e1cbc3b45165e519ff7ecf5fd8690ad276d73","observation_id":"bb7f8bf5-bb5c-4c31-981c-8a06f41d05cf","resolution":{"observed_at":"2026-08-07T11:02:39.289715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-07T11:02:39.294461Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.294461Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:de1ab04750903d4fd7de5b6e909a6abc415110b0889409f85d4b27f6a46bf669","observation_id":"3ef55932-148c-41f3-9398-670a7691f026","resolution":{"observed_at":"2026-08-07T11:02:39.294461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:39.298736Z","title":"Fast inference from transformers via speculative decoding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.298736Z"},"links":{"citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:2af1b7f9e7ea0248f703e4152deb3c45cc78cf232f0005054b1859e8b3b05b01","observation_id":"9866707e-911f-403d-8b81-2558603b726e","resolution":{"observed_at":"2026-08-07T11:02:39.298736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:40.263215Z","title":"EAGLE : Speculative sampling requires rethinking feature uncertainty","venue":null,"work_id":"ebe3316e-acdc-4f7b-a7d8-a60bf4892db4","year":2024},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.302878Z"},"links":{"citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:e49d462c673e51b69b79913e9531d01c73db445784d70d4385a00411bd648b30","observation_id":"94acec46-634f-44f3-b2e3-ff75c53c7aaa","resolution":{"observed_at":"2026-08-07T11:02:40.268093Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:40.247314Z","title":"EAGLE -2: Faster inference of language models with dynamic draft trees","venue":null,"work_id":"be95996c-82b9-4d14-8ced-e4db59005468","year":2024},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.306771Z"},"links":{"citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:147c3ff6ebd431dfa54bb6e414894ab5be55c26777f8eda19ee348a203f1d373","observation_id":"8c182b05-b6c8-49b4-9489-3bab0d4c6b74","resolution":{"observed_at":"2026-08-07T11:02:40.252446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18911","last_updated":"2024-04-29T17:53:54Z","snapshot_observed_at":"2026-07-06T18:07:14.918612Z","submitted_at":"2024-04-29T17:53:54Z","title":"Kangaroo: Lossless Self-Speculative Decoding via Double Early Exiting","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18911","snapshot_observed_at":"2026-08-07T11:02:39.310757Z","title":"Kangaroo: Lossless self-speculative decoding via double early exiting","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.310757Z"},"links":{"cited_paper":"/paper/2404.18911","citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:9f850e53da63002853c15ec8a88886cf574ff58e139b326ea7d609d15023f047","observation_id":"4a3730a1-1a9a-448b-b099-e8041ad0a0d7","resolution":{"observed_at":"2026-08-07T11:02:39.310757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:40.231365Z","title":"Speculative decoding via early-exiting for faster LLM inference with T hompson sampling control mechanism","venue":null,"work_id":"bd30b920-2fa6-472c-b6bf-7147238f42e5","year":2024},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.315020Z"},"links":{"citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:c7b1ef7677dd6b23b1ad4b0f8837dc65e1b4cd2198e1034c89cef398f8a91d05","observation_id":"c3e6d8d3-1059-4a40-b3e0-6c887e8ac97c","resolution":{"observed_at":"2026-08-07T11:02:40.236346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07177","last_updated":"2024-06-10T01:36:31Z","snapshot_observed_at":"2026-07-06T16:30:55.043821Z","submitted_at":"2023-10-11T04:03:42Z","title":"Online Speculative Decoding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07177","snapshot_observed_at":"2026-08-07T11:02:39.319649Z","title":"Online speculative decoding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.319649Z"},"links":{"cited_paper":"/paper/2310.07177","citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:e1471cfcc1e00bd8d144b44db372a8552ec789afa713ed08d047efd05d160b14","observation_id":"392f706e-b5d3-4f78-8388-c4441d6cd354","resolution":{"observed_at":"2026-08-07T11:02:39.319649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08767","last_updated":"2025-05-26T01:07:58Z","snapshot_observed_at":"2026-08-07T23:42:22.824027Z","submitted_at":"2025-02-12T20:13:56Z","title":"SelfElicit: Your Language Model Secretly Knows Where is the Relevant Evidence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.08767","snapshot_observed_at":"2026-08-07T11:02:39.324065Z","title":"A., Adkathimar, R., Wei, T., and Tong, H","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.324065Z"},"links":{"cited_paper":"/paper/2502.08767","citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:c4214709e24e39c880c94f428dc2be09205f0cc5f40d1f1f7d34457bd597f185","observation_id":"d65e517c-e34b-44ef-8000-15ee09bcc21e","resolution":{"observed_at":"2026-08-07T11:02:39.324065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15234","last_updated":"2025-07-23T10:11:55Z","snapshot_observed_at":"2026-08-05T06:23:34.302204Z","submitted_at":"2023-12-23T11:57:53Z","title":"Towards Efficient Generative Large Language Model Serving: A Survey from Algorithms to Systems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15234","snapshot_observed_at":"2026-08-07T11:02:39.328762Z","title":"Towards efficient generative large language model serving: A survey from algorithms to systems","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.328762Z"},"links":{"cited_paper":"/paper/2312.15234","citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:10c08de3bea6bcbc48d50dfb63f0fa4f27a14229c9b6da589c2f650a6dd37da3","observation_id":"13b92ac1-0853-49ca-b29a-7b46567ace67","resolution":{"observed_at":"2026-08-07T11:02:39.328762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.09781","last_updated":"2024-04-01T02:18:42Z","snapshot_observed_at":"2026-07-06T15:28:24.682211Z","submitted_at":"2023-05-16T20:12:59Z","title":"SpecInfer: Accelerating Generative Large Language Model Serving with Tree-based Speculative Inference and Verification","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.09781","snapshot_observed_at":"2026-08-07T11:02:39.332990Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.332990Z"},"links":{"cited_paper":"/paper/2305.09781","citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:34fa384bfc5f4f2fa7a74b32cb7e7c74e823f00069e0941ad16365a360e358fa","observation_id":"524c374e-19b6-41cb-94cf-db6ad6372692","resolution":{"observed_at":"2026-08-07T11:02:39.332990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:40.215451Z","title":"B., and Lapata, M","venue":null,"work_id":"efd57f02-c2f0-4a06-b09d-eb9163d3d4b1","year":2018},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.337310Z"},"links":{"citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:42a0d9177f4cb120594aface4f78960bce545618c95763d4bb6f5ed881eb838e","observation_id":"fbeac526-b188-40c9-92ca-a53d9fd3eff2","resolution":{"observed_at":"2026-08-07T11:02:40.220011Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:40.200408Z","title":"Introducing OpenAI o1: Learning to reason with large language models, 2024","venue":null,"work_id":"d121b9b9-d3ea-4fc4-9f6a-2e7b0c283114","year":2024},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.341535Z"},"links":{"citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:01895414ffbebc48009d6f075b1ad863c46312bb85a5bc5dc6e21a9f53372d95","observation_id":"6dbb81cc-5103-41ad-b311-0f9705e9b60f","resolution":{"observed_at":"2026-08-07T11:02:40.205186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19371","last_updated":"2024-10-02T01:01:57Z","snapshot_observed_at":"2026-08-08T04:08:17.823050Z","submitted_at":"2024-06-27T17:50:35Z","title":"Suri: Multi-constraint Instruction Following for Long-form Text Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19371","snapshot_observed_at":"2026-08-07T11:02:39.345559Z","title":"M., Sun, S., and Iyyer, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.345559Z"},"links":{"cited_paper":"/paper/2406.19371","citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:68c4a699a91dccf21ebbf4d8c171d271da7a88d2a18bfc224597323e63d8fe22","observation_id":"b5b52e0b-3b03-412f-8a18-be2363e6336d","resolution":{"observed_at":"2026-08-07T11:02:39.345559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.09722","last_updated":"2025-04-10T02:35:34Z","snapshot_observed_at":"2026-08-01T12:36:03.890601Z","submitted_at":"2024-07-12T23:29:54Z","title":"Optimized Multi-Token Joint Decoding with Auxiliary Model for LLM Inference","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.09722","snapshot_observed_at":"2026-08-07T11:02:39.349604Z","title":"Optimized multi-token joint decoding with auxiliary model for LLM inference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.349604Z"},"links":{"cited_paper":"/paper/2407.09722","citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:dc4e660bc7a02d9ce6585a4485102b6611ca52bf3631dd0a6e8ff85932e8ad6d","observation_id":"137b5722-76e6-45f9-93f9-7dd36980ffda","resolution":{"observed_at":"2026-08-07T11:02:39.349604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:39.354357Z","title":"Zero: Memory optimizations toward training trillion parameter models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.354357Z"},"links":{"citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:46700b84d612896cbc97163e4f107bf481193595992d9f7b988b329c10d809b4","observation_id":"c7d2b5b6-ba6f-4ae0-bd91-d6335a15b7d7","resolution":{"observed_at":"2026-08-07T11:02:39.354357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02258","last_updated":"2024-04-02T19:28:11Z","snapshot_observed_at":"2026-07-06T17:54:47.689340Z","submitted_at":"2024-04-02T19:28:11Z","title":"Mixture-of-Depths: Dynamically allocating compute in transformer-based language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02258","snapshot_observed_at":"2026-08-07T11:02:39.358502Z","title":"C., and Santoro, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.358502Z"},"links":{"cited_paper":"/paper/2404.02258","citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:b655052595b2ad19002fe98f9ffcacabe345f8dce27596c996675ae7e58f0d1f","observation_id":"00f1598f-a45e-45c9-8378-1ca46fde6337","resolution":{"observed_at":"2026-08-07T11:02:39.358502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:39.363381Z","title":"Confident adaptive language modeling","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.363381Z"},"links":{"citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:3720894c9dd2ba2659dbb248ffe60a01e34d71f7021c36813bad0323adef8899","observation_id":"c5b092e6-bafb-4015-b99a-ff921311b22b","resolution":{"observed_at":"2026-08-07T11:02:39.363381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-07T11:02:39.367516Z","title":"Scaling LLM test-time compute optimally can be more effective than scaling model parameters","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.367516Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:4290cd5a7ea8df3677df0a672000d02548dd45ffdfc870ea6d5088669120f1c0","observation_id":"1a47a6e7-9004-4fb9-af90-21d5e8a57ec0","resolution":{"observed_at":"2026-08-07T11:02:39.367516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:39.371960Z","title":"Blockwise parallel decoding for deep autoregressive models","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.371960Z"},"links":{"citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:1c21b8f2149f5f8a07ea6d4b16cfb76be5fc943c0f9b3b1250d8b032f0f52441","observation_id":"80b9a603-75a1-4c5a-9dc0-d52cb414d087","resolution":{"observed_at":"2026-08-07T11:02:39.371960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:39.376015Z","title":"Branchynet: Fast inference via early exiting from deep neural networks","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.376015Z"},"links":{"citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:7b4f24b77e73012e7393ef9dd5f2fe6bf2b35b4d9b7d632dc1984c4ff0ddbeee","observation_id":"f90a9b21-851c-4a9f-957b-736288df6d89","resolution":{"observed_at":"2026-08-07T11:02:39.376015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.18581","last_updated":"2023-11-07T05:44:17Z","snapshot_observed_at":"2026-07-06T16:39:48.771285Z","submitted_at":"2023-10-28T04:07:58Z","title":"Accelerating LLaMA Inference by Enabling Intermediate Layer Decoding via Instruction Tuning with LITE","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.18581","snapshot_observed_at":"2026-08-07T11:02:39.380095Z","title":"Accelerating Llama inference by enabling intermediate layer decoding via instruction tuning with LITE","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.380095Z"},"links":{"cited_paper":"/paper/2310.18581","citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:28b1cdec642788b0ce442c30e4eb204203ed9b3d4c7bd8c5eb5ab4a86191d213","observation_id":"91e438b8-eb7b-48b9-9186-9aea743e3c0b","resolution":{"observed_at":"2026-08-07T11:02:39.380095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.07851","last_updated":"2024-06-04T17:08:37Z","snapshot_observed_at":"2026-07-06T17:15:46.395218Z","submitted_at":"2024-01-15T17:26:50Z","title":"Unlocking Efficiency in Large Language Model Inference: A Comprehensive Survey of Speculative Decoding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.07851","snapshot_observed_at":"2026-08-07T11:02:39.384667Z","title":"Unlocking efficiency in large language model inference: A comprehensive survey of speculative decoding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.384667Z"},"links":{"cited_paper":"/paper/2401.07851","citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:1b2da0d983384704651370fa56abf9a8e8c9e15569d0d4d14a6d6b92fb4b7c74","observation_id":"bc2d3b77-700d-4849-9bce-2a0b5b5c1298","resolution":{"observed_at":"2026-08-07T11:02:39.384667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:40.142366Z","title":"SWIFT : On-the-fly self-speculative decoding for LLM inference acceleration","venue":null,"work_id":"6152a21a-8772-40ed-b248-2f6e7c28c300","year":2025},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.389151Z"},"links":{"citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:e0aad37851195b69197d7210d696e7acf12c5fd765a10230cf84453bbd3d9cca","observation_id":"6a266fe9-7a37-46dd-ac7d-0d2d051c1307","resolution":{"observed_at":"2026-08-07T11:02:40.146961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:40.126785Z","title":"Sheared LLaMA : Accelerating language model pre-training via structured pruning","venue":null,"work_id":"b06e97af-165f-4e28-8178-c7cd33bb5e9c","year":2024},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.393390Z"},"links":{"citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:a96a05ae767b96f19862565b091ae1a3287cbdd9c701bf912f2e1fe664eeb44c","observation_id":"3c447bb5-cafd-47be-b11f-5fc3ac132133","resolution":{"observed_at":"2026-08-07T11:02:40.131589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:40.109237Z","title":"Predictive pipelined decoding: A compute-latency trade-off for exact LLM decoding","venue":null,"work_id":"f61529a6-23dc-4221-8dd3-ddad18c96a70","year":2024},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.397839Z"},"links":{"citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:d682ae54c99acaf9c72da42be035ff5692a7b89972f800bcbd5061d5ba27e8da","observation_id":"1b1fd645-bab9-4770-a385-c6b917c22b62","resolution":{"observed_at":"2026-08-07T11:02:40.114487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:40.093151Z","title":null,"venue":null,"work_id":"9e3b822d-4497-4e78-8b7b-56b9ebd92323","year":2018},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.402276Z"},"links":{"citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:f3ec9be84839308ec3b2610a5f6c61f4e1b0a5a5e8075a58d0d76fedc8dfb344","observation_id":"21a3dae6-973a-4857-968f-03fbbd74d4bf","resolution":{"observed_at":"2026-08-07T11:02:40.097652Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:40.077826Z","title":"C o S afe: Evaluating large language model safety in multi-turn dialogue coreference","venue":null,"work_id":"eceb10dc-6c7e-4d5e-984b-02641318dae7","year":2024},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.406543Z"},"links":{"citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:985d2f8951826af98084dfccfc353f57b6547074c9c354271e16e8a0537d237c","observation_id":"99ec4d90-e5a2-4bc7-9b00-edef53252766","resolution":{"observed_at":"2026-08-07T11:02:40.082567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:40.062338Z","title":"L., Ma, Z., Xue, Y., Zhai, J., Chen, W., Liu, Z., Zhang, P., Dong, Y., and Tang, J","venue":null,"work_id":"3bc01218-49ec-4416-b40a-17c23734d095","year":2023},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.410964Z"},"links":{"citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:099f7ba67d057e8c69674ca8557d17b0faf9ae8d795621e26e65bb2cbe3ead85","observation_id":"1ab76d82-5c3e-4c69-b777-6e309c525fb3","resolution":{"observed_at":"2026-08-07T11:02:40.066657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:40.046591Z","title":"Draft & verify: Lossless large language model acceleration via self-speculative decoding","venue":null,"work_id":"f0532c18-ca09-4b34-a72f-53d223750018","year":2024},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.415285Z"},"links":{"citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:e99badaf3d76ef2025bcef2816a1862d21b246f2ef3f0477a9d19eb689172b15","observation_id":"b43b1424-d65b-4f94-b3e4-c5ea393af016","resolution":{"observed_at":"2026-08-07T11:02:40.051401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:02:40.027775Z","title":"SafetyBench : Evaluating the safety of large language models with multiple choice questions","venue":null,"work_id":"d952c3dd-5409-4206-a13a-fe71d5d9686e","year":2024},"citing_paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-07T11:02:39.419910Z"},"links":{"citing_paper":"/paper/2506.03700"},"observation_digest":"sha256:8032b2de0da8fc1fa646d3e9564122780633652733a8ea5b80ad3df17090e774","observation_id":"98a08fef-5fd2-4b5e-a4e8-127f583d7fcc","resolution":{"observed_at":"2026-08-07T11:02:40.035083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.03700","last_updated":"2025-06-04T08:32:30Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T01:16:24.422333Z","submitted_at":"2025-06-04T08:32:30Z","title":"AdaDecode: Accelerating LLM Decoding with Adaptive Layer Parallelism"},"reference_resolution":{"displayed":71,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":44,"verified_exact":0,"verified_fuzzy":27},"total_outbound_references":71},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 71 of 71 outbound references and 4 inbound Pith citation observations for arXiv:2506.03700."}