{"as_of":"2026-08-09T04:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e0d64b0b3875420899820a4d617bf0bf7f9e3201084e812db73fdacf57e009a0","coverage":[{"denominator":19,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":19,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T21:38:54.851579Z","state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T13:15:30.174288Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-20T22:54:09.662817Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.08192","last_updated":"2025-08-11T17:11:26Z","snapshot_observed_at":"2026-08-08T01:17:25.728418Z","submitted_at":"2025-08-11T17:11:26Z","title":"Efficient Speculative Decoding for Llama at Scale: Challenges and Solutions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.08192","snapshot_observed_at":"2026-08-04T13:15:30.174288Z","title":"Efficient speculative decoding for llama at scale: Challenges and solutions.arXiv preprint arXiv:2508.08192,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.01336","last_updated":"2026-05-26T05:53:44Z","snapshot_observed_at":"2026-08-04T13:15:28.029864Z","submitted_at":"2025-10-01T18:04:14Z","title":"HiSpec: Hierarchical Speculative Decoding for LLMs","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T13:15:30.174288Z"},"links":{"cited_paper":"/paper/2508.08192","citing_paper":"/paper/2510.01336"},"observation_digest":"sha256:a308b9aeeb011a223cb55dfae736c1bd9f447e021ed54d0be32191bc4cc5a45b","observation_id":"17d775b5-4e95-4970-b31b-6bcf50c3f27d","resolution":{"observed_at":"2026-08-04T13:15:30.174288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.08192","last_updated":"2025-08-11T17:11:26Z","snapshot_observed_at":"2026-08-08T01:17:25.728418Z","submitted_at":"2025-08-11T17:11:26Z","title":"Efficient Speculative Decoding for Llama at Scale: Challenges and Solutions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.08192","snapshot_observed_at":"2026-08-02T23:27:56.589526Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.13836","last_updated":"2026-07-17T14:00:00Z","snapshot_observed_at":"2026-08-07T10:00:44.480150Z","submitted_at":"2026-02-14T16:10:00Z","title":"Speculative Decoding with a Speculative Vocabulary","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-02T23:27:56.589526Z"},"links":{"cited_paper":"/paper/2508.08192","citing_paper":"/paper/2602.13836"},"observation_digest":"sha256:25b48946032941ce98fad5a5feab1d3c76c39d496508634ddedc98c75aef2a2f","observation_id":"4e20ca68-c9a4-48a1-b6e0-3bd8ab542d69","resolution":{"observed_at":"2026-08-02T23:27:56.589526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.08192","last_updated":"2025-08-11T17:11:26Z","snapshot_observed_at":"2026-08-08T01:17:25.728418Z","submitted_at":"2025-08-11T17:11:26Z","title":"Efficient Speculative Decoding for Llama at Scale: Challenges and Solutions","version":1},"cited_work":{"arxiv_id":"2508.08192","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.08192","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2508.08192 , year=","venue":null,"work_id":"8914f61e-1ada-4708-96b7-f448642fba9e","year":null},"citing_paper":{"arxiv_id":"2605.09329","last_updated":"2026-05-19T16:34:43Z","snapshot_observed_at":"2026-07-06T23:21:26.017420Z","submitted_at":"2026-05-10T05:02:39Z","title":"Test-Time Speculation","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-05-12T04:20:15.459967Z"},"links":{"cited_paper":"/paper/2508.08192","citing_paper":"/paper/2605.09329"},"observation_digest":"sha256:f702a76b6986590646782055357f1329a90f50712482eb2532f0f74b100cbe5b","observation_id":"e8e80813-20fa-4aa2-8701-38fcc58e3bda","resolution":{"observed_at":"2026-05-12T04:21:22.742941Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.08192","last_updated":"2025-08-11T17:11:26Z","snapshot_observed_at":"2026-08-08T01:17:25.728418Z","submitted_at":"2025-08-11T17:11:26Z","title":"Efficient Speculative Decoding for Llama at Scale: Challenges and Solutions","version":1},"cited_work":{"arxiv_id":"2508.08192","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.08192","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2508.08192 , year=","venue":null,"work_id":"8914f61e-1ada-4708-96b7-f448642fba9e","year":null},"citing_paper":{"arxiv_id":"2605.09329","last_updated":"2026-05-19T16:34:43Z","snapshot_observed_at":"2026-07-06T23:21:26.017420Z","submitted_at":"2026-05-10T05:02:39Z","title":"Test-Time Speculation","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-05-20T22:53:56.914556Z"},"links":{"cited_paper":"/paper/2508.08192","citing_paper":"/paper/2605.09329"},"observation_digest":"sha256:72486837fae676208d8c84b3e770dda4253916f08aaed07b9f6d93b7e7f17745","observation_id":"e90e11a9-e217-4497-9262-f8b754177ac4","resolution":{"observed_at":"2026-05-20T22:54:09.665858Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2508.08192/citation-record","integrity":"/paper/2508.08192/integrity","json":"/paper/2508.08192/citation-record.json","paper":"/paper/2508.08192"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T21:38:52.423030Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.08192","last_updated":"2025-08-11T17:11:26Z","snapshot_observed_at":"2026-08-08T01:17:25.728418Z","submitted_at":"2025-08-11T17:11:26Z","title":"Efficient Speculative Decoding for Llama at Scale: Challenges and Solutions","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T21:38:52.423030Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2508.08192"},"observation_digest":"sha256:efcb4d5e194c73a50f6e6b58bdb75a594eda27574b06463ccd204cda3c817a9b","observation_id":"0af16ab2-4b16-4e29-8b75-adef00a83fb5","resolution":{"observed_at":"2026-08-05T21:38:52.423030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:38:55.350905Z","title":"The curious case of neural text degeneration","venue":null,"work_id":"edd454a3-d98f-449f-9301-a07f758d9ae9","year":2020},"citing_paper":{"arxiv_id":"2508.08192","last_updated":"2025-08-11T17:11:26Z","snapshot_observed_at":"2026-08-08T01:17:25.728418Z","submitted_at":"2025-08-11T17:11:26Z","title":"Efficient Speculative Decoding for Llama at Scale: Challenges and Solutions","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T21:38:52.897703Z"},"links":{"citing_paper":"/paper/2508.08192"},"observation_digest":"sha256:1eb942710e3625ae52e395b15f5b585a16ad6a2f8fade63ad600e365ae0059fe","observation_id":"2fa6a4eb-df24-455e-b6e1-dac3ab84623a","resolution":{"observed_at":"2026-08-05T21:38:55.506409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05099","last_updated":"2024-05-13T08:49:44Z","snapshot_observed_at":"2026-08-04T23:21:31.317269Z","submitted_at":"2024-02-07T18:53:01Z","title":"Hydragen: High-Throughput LLM Inference with Shared Prefixes","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05099","snapshot_observed_at":"2026-08-05T21:38:53.050106Z","title":"Hydragen: High-throughput llm inference with shared prefixes.arXiv preprint arXiv:2402.05099,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.08192","last_updated":"2025-08-11T17:11:26Z","snapshot_observed_at":"2026-08-08T01:17:25.728418Z","submitted_at":"2025-08-11T17:11:26Z","title":"Efficient Speculative Decoding for Llama at Scale: Challenges and Solutions","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T21:38:53.050106Z"},"links":{"cited_paper":"/paper/2402.05099","citing_paper":"/paper/2508.08192"},"observation_digest":"sha256:3c75a9002e7519a087dd85054ad3389d2bbfcb0f37736e5658ff6294c2b2ba3b","observation_id":"d4bd292e-1473-4a07-954c-7d0590f9378e","resolution":{"observed_at":"2026-08-05T21:38:53.050106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-05T21:38:53.157905Z","title":"Adam: A method for stochastic optimization.arXiv preprint arXiv:1412.6980,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.08192","last_updated":"2025-08-11T17:11:26Z","snapshot_observed_at":"2026-08-08T01:17:25.728418Z","submitted_at":"2025-08-11T17:11:26Z","title":"Efficient Speculative Decoding for Llama at Scale: Challenges and Solutions","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T21:38:53.157905Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2508.08192"},"observation_digest":"sha256:175d07e201513b176eec658ba589eae557866a09609fbb54255a266126e416c0","observation_id":"c659adac-c136-43a8-a190-429d4a696843","resolution":{"observed_at":"2026-08-05T21:38:53.157905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.15077","last_updated":"2025-03-04T13:58:39Z","snapshot_observed_at":"2026-08-03T09:40:31.365295Z","submitted_at":"2024-01-26T18:59:01Z","title":"EAGLE: Speculative Sampling Requires Rethinking Feature Uncertainty","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.15077","snapshot_observed_at":"2026-08-05T21:38:53.285462Z","title":"Eagle: Speculative sampling requires rethinking feature uncertainty.arXiv preprint arXiv:2401.15077,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.08192","last_updated":"2025-08-11T17:11:26Z","snapshot_observed_at":"2026-08-08T01:17:25.728418Z","submitted_at":"2025-08-11T17:11:26Z","title":"Efficient Speculative Decoding for Llama at Scale: Challenges and Solutions","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T21:38:53.285462Z"},"links":{"cited_paper":"/paper/2401.15077","citing_paper":"/paper/2508.08192"},"observation_digest":"sha256:5d63e332f250ad56f89256294b8369ff3c28394d9486b011c5124bdcc76f0ed0","observation_id":"22dc4cd0-3f2c-4a13-9d49-ec375612ab34","resolution":{"observed_at":"2026-08-05T21:38:53.285462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01840","last_updated":"2025-04-23T07:08:17Z","snapshot_observed_at":"2026-07-06T20:45:55.263034Z","submitted_at":"2025-03-03T18:59:04Z","title":"EAGLE-3: Scaling up Inference Acceleration of Large Language Models via Training-Time Test","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01840","snapshot_observed_at":"2026-08-05T21:38:53.476154Z","title":"Eagle-3: Scaling up inference acceleration of large language models via training-time test.arXiv preprint arXiv:2503.01840,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.08192","last_updated":"2025-08-11T17:11:26Z","snapshot_observed_at":"2026-08-08T01:17:25.728418Z","submitted_at":"2025-08-11T17:11:26Z","title":"Efficient Speculative Decoding for Llama at Scale: Challenges and Solutions","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T21:38:53.476154Z"},"links":{"cited_paper":"/paper/2503.01840","citing_paper":"/paper/2508.08192"},"observation_digest":"sha256:66bee443738358def9fd144aba2b92a10d943898b33874ebc92df2880add579b","observation_id":"def561ff-a131-44a3-93d8-5e6c10b04c7e","resolution":{"observed_at":"2026-08-05T21:38:53.476154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14066","last_updated":"2025-07-27T03:20:41Z","snapshot_observed_at":"2026-07-06T18:34:03.037351Z","submitted_at":"2024-06-20T07:43:33Z","title":"TurboSpec: Closed-loop Speculation Control System for Optimizing LLM Serving Goodput","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14066","snapshot_observed_at":"2026-08-05T21:38:53.660836Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.08192","last_updated":"2025-08-11T17:11:26Z","snapshot_observed_at":"2026-08-08T01:17:25.728418Z","submitted_at":"2025-08-11T17:11:26Z","title":"Efficient Speculative Decoding for Llama at Scale: Challenges and Solutions","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T21:38:53.660836Z"},"links":{"cited_paper":"/paper/2406.14066","citing_paper":"/paper/2508.08192"},"observation_digest":"sha256:802cc1de700c6f5226237216fcebf35a7fcc4b9c169d06a8e7e28916db13eeaf","observation_id":"235d3e2c-a8ac-4b40-b616-9ae04db67d3b","resolution":{"observed_at":"2026-08-05T21:38:53.660836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.09781","last_updated":"2024-04-01T02:18:42Z","snapshot_observed_at":"2026-07-06T15:28:24.682211Z","submitted_at":"2023-05-16T20:12:59Z","title":"SpecInfer: Accelerating Generative Large Language Model Serving with Tree-based Speculative Inference and Verification","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.09781","snapshot_observed_at":"2026-08-05T21:38:54.075982Z","title":"14 Ruoyu Qin, Zheming Li, Weiran He, Mingxing Zhang, Yongwei Wu, Weimin Zheng, and Xinran Xu","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.08192","last_updated":"2025-08-11T17:11:26Z","snapshot_observed_at":"2026-08-08T01:17:25.728418Z","submitted_at":"2025-08-11T17:11:26Z","title":"Efficient Speculative Decoding for Llama at Scale: Challenges and Solutions","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T21:38:54.075982Z"},"links":{"cited_paper":"/paper/2305.09781","citing_paper":"/paper/2508.08192"},"observation_digest":"sha256:08502ee48039de0908b95dfcbf7be21b7988e6704b38de2c8aad5cc4429979b3","observation_id":"7d4fb8f7-47d7-454d-97a3-2158615ea817","resolution":{"observed_at":"2026-08-05T21:38:54.075982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.05682","last_updated":"2022-10-10T16:36:47Z","snapshot_observed_at":"2026-08-06T17:49:01.053607Z","submitted_at":"2021-12-10T17:25:07Z","title":"Self-attention Does Not Need $O(n^2)$ Memory","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.05682","snapshot_observed_at":"2026-08-05T21:38:54.293572Z","title":"Self-attention does not needo(n2)memory.arXiv preprint arXiv:2112.05682,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.08192","last_updated":"2025-08-11T17:11:26Z","snapshot_observed_at":"2026-08-08T01:17:25.728418Z","submitted_at":"2025-08-11T17:11:26Z","title":"Efficient Speculative Decoding for Llama at Scale: Challenges and Solutions","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T21:38:54.293572Z"},"links":{"cited_paper":"/paper/2112.05682","citing_paper":"/paper/2508.08192"},"observation_digest":"sha256:2f7d73618542f6d16fb1b871ae40ab685f21bd6473d96c5c73f544a8867ccfa5","observation_id":"99e518d1-e991-443a-a8e0-5e07929bd86f","resolution":{"observed_at":"2026-08-05T21:38:54.293572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11049","last_updated":"2025-04-02T01:58:38Z","snapshot_observed_at":"2026-08-08T01:17:07.764692Z","submitted_at":"2024-08-20T17:57:31Z","title":"MagicDec: Breaking the Latency-Throughput Tradeoff for Long Context Generation with Speculative Decoding","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11049","snapshot_observed_at":"2026-08-05T21:38:54.422691Z","title":"Ranajoy Sadhukhan, Jian Chen, Zhuoming Chen, Vashisth Tiwari, Ruihang Lai, Jinyuan Shi, Ian En-Hsu Yen, Avner May, Tianqi Chen, and Beidi Chen","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.08192","last_updated":"2025-08-11T17:11:26Z","snapshot_observed_at":"2026-08-08T01:17:25.728418Z","submitted_at":"2025-08-11T17:11:26Z","title":"Efficient Speculative Decoding for Llama at Scale: Challenges and Solutions","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T21:38:54.422691Z"},"links":{"cited_paper":"/paper/2408.11049","citing_paper":"/paper/2508.08192"},"observation_digest":"sha256:9daf8ef17a6d1c33146345b6f1f05bb4db7b526e587e2dc88ccee112c0372c50","observation_id":"4e294fe4-01d2-4df9-951e-e13471fef135","resolution":{"observed_at":"2026-08-05T21:38:54.422691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1701.06538","last_updated":"2017-01-23T18:10:00Z","snapshot_observed_at":"2026-07-06T05:27:13.416519Z","submitted_at":"2017-01-23T18:10:00Z","title":"Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1701.06538","snapshot_observed_at":"2026-08-05T21:38:54.550812Z","title":"Noam Shazeer, Azalia Mirhoseini, Krzysztof Maziarz, Andy Davis, Quoc Le, Geoffrey Hinton, and Jeff Dean","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.08192","last_updated":"2025-08-11T17:11:26Z","snapshot_observed_at":"2026-08-08T01:17:25.728418Z","submitted_at":"2025-08-11T17:11:26Z","title":"Efficient Speculative Decoding for Llama at Scale: Challenges and Solutions","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T21:38:54.550812Z"},"links":{"cited_paper":"/paper/1701.06538","citing_paper":"/paper/2508.08192"},"observation_digest":"sha256:946063c14d2af44225b144bee1230547cc1448e1ef83c6a12e533bb4c6aaaed5","observation_id":"a069bcfd-b7fd-43b0-8302-5ec377fbd2f5","resolution":{"observed_at":"2026-08-05T21:38:54.550812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09702","last_updated":"2023-08-19T21:27:51Z","snapshot_observed_at":"2026-07-06T15:55:41.294452Z","submitted_at":"2023-07-19T01:14:49Z","title":"Efficient Guided Generation for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09702","snapshot_observed_at":"2026-08-05T21:38:54.851579Z","title":"Efficient guided generation for llms.arXiv preprint arXiv:2307.09702,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.08192","last_updated":"2025-08-11T17:11:26Z","snapshot_observed_at":"2026-08-08T01:17:25.728418Z","submitted_at":"2025-08-11T17:11:26Z","title":"Efficient Speculative Decoding for Llama at Scale: Challenges and Solutions","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T21:38:54.851579Z"},"links":{"cited_paper":"/paper/2307.09702","citing_paper":"/paper/2508.08192"},"observation_digest":"sha256:15d7fb90540da714617975758689483429fc6350e773a98a40cf3be08eb3aa35","observation_id":"bb5258b7-e136-43be-956e-618bcf07e180","resolution":{"observed_at":"2026-08-05T21:38:54.851579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.18813","last_updated":"2023-10-28T20:36:36Z","snapshot_observed_at":"2026-07-06T16:40:00.062668Z","submitted_at":"2023-10-28T20:36:36Z","title":"The Synergy of Speculative Decoding and Batching in Serving Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.18813","snapshot_observed_at":"2026-08-05T21:38:54.729462Z","title":"The synergy of speculative decoding and batching in serving large language models, 2023.https://arxiv.org/abs/2310.18813","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.08192","last_updated":"2025-08-11T17:11:26Z","snapshot_observed_at":"2026-08-08T01:17:25.728418Z","submitted_at":"2025-08-11T17:11:26Z","title":"Efficient Speculative Decoding for Llama at Scale: Challenges and Solutions","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-05T21:38:54.729462Z"},"links":{"cited_paper":"/paper/2310.18813","citing_paper":"/paper/2508.08192"},"observation_digest":"sha256:cbbfc1d8f57995f1dccaeb4e4b782afb4ae21fa88688a330c452e846c1c4bcda","observation_id":"d13dfcad-6739-4a19-afb7-61714e8215ec","resolution":{"observed_at":"2026-08-05T21:38:54.729462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14160","last_updated":"2024-03-05T06:55:26Z","snapshot_observed_at":"2026-07-06T17:33:41.634820Z","submitted_at":"2024-02-21T22:57:49Z","title":"Recursive Speculative Decoding: Accelerating LLM Inference via Sampling Without Replacement","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14160","snapshot_observed_at":"2026-08-05T21:38:52.973941Z","title":"Wonseok Jeon, Mukul Gagrani, Raghavv Goel, Junyoung Park, Mingu Lee, and Christopher Lott","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.08192","last_updated":"2025-08-11T17:11:26Z","snapshot_observed_at":"2026-08-08T01:17:25.728418Z","submitted_at":"2025-08-11T17:11:26Z","title":"Efficient Speculative Decoding for Llama at Scale: Challenges and Solutions","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-05T21:38:52.973941Z"},"links":{"cited_paper":"/paper/2402.14160","citing_paper":"/paper/2508.08192"},"observation_digest":"sha256:9ec615fb1df14d244091de8f049a3df4c5bb5a206ff77ef908e172ade13ffede","observation_id":"907cf67f-c951-468a-9f60-d087a4d7a53d","resolution":{"observed_at":"2026-08-05T21:38:52.973941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10774","last_updated":"2024-06-14T23:32:32Z","snapshot_observed_at":"2026-07-06T17:17:56.276857Z","submitted_at":"2024-01-19T15:48:40Z","title":"Medusa: Simple LLM Inference Acceleration Framework with Multiple Decoding Heads","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10774","snapshot_observed_at":"2026-08-05T21:38:52.474661Z","title":"Medusa: Simple llm inference acceleration framework with multiple decoding heads.arXiv preprint arXiv:2401.10774,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.08192","last_updated":"2025-08-11T17:11:26Z","snapshot_observed_at":"2026-08-08T01:17:25.728418Z","submitted_at":"2025-08-11T17:11:26Z","title":"Efficient Speculative Decoding for Llama at Scale: Challenges and Solutions","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-05T21:38:52.474661Z"},"links":{"cited_paper":"/paper/2401.10774","citing_paper":"/paper/2508.08192"},"observation_digest":"sha256:4ddc876e23b5bf2a4948230e49ed1025dac0ddaa60d34091ef7738d69229a321","observation_id":"828ff934-d954-451a-aeba-d4f35015f049","resolution":{"observed_at":"2026-08-05T21:38:52.474661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:38:55.597208Z","title":"Flash-decoding for long-context inference.https: //crfm.stanford.edu/2023/10/12/flashdecoding.html, October 12","venue":null,"work_id":"dcc54b0c-2054-4e64-8f8e-e897f14d2c96","year":2023},"citing_paper":{"arxiv_id":"2508.08192","last_updated":"2025-08-11T17:11:26Z","snapshot_observed_at":"2026-08-08T01:17:25.728418Z","submitted_at":"2025-08-11T17:11:26Z","title":"Efficient Speculative Decoding for Llama at Scale: Challenges and Solutions","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-05T21:38:52.670091Z"},"links":{"citing_paper":"/paper/2508.08192"},"observation_digest":"sha256:2a4bce490ba48966cafbeebc8f3293001b7e902a0c07e0f69af3e112f1c5b8f0","observation_id":"a4d9578e-0d0c-490a-b387-ee34a99bc436","resolution":{"observed_at":"2026-08-05T21:38:55.702221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-05T21:38:52.767983Z","title":"Aaron Grattafiori et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.08192","last_updated":"2025-08-11T17:11:26Z","snapshot_observed_at":"2026-08-08T01:17:25.728418Z","submitted_at":"2025-08-11T17:11:26Z","title":"Efficient Speculative Decoding for Llama at Scale: Challenges and Solutions","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-05T21:38:52.767983Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2508.08192"},"observation_digest":"sha256:40530879c78e88810d766a587de4f9f0e7bf4143762af55ce45f5c8ba0871d69","observation_id":"a254f1c7-000d-4e24-aff4-5321cd42a9bb","resolution":{"observed_at":"2026-08-05T21:38:52.767983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.01318","last_updated":"2023-02-02T18:44:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-02T18:44:11Z","title":"Accelerating Large Language Model Decoding with Speculative Sampling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.01318","snapshot_observed_at":"2026-08-05T21:38:52.571364Z","title":"Accelerating large language model decoding with speculative sampling.arXiv preprint arXiv:2302.01318,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.08192","last_updated":"2025-08-11T17:11:26Z","snapshot_observed_at":"2026-08-08T01:17:25.728418Z","submitted_at":"2025-08-11T17:11:26Z","title":"Efficient Speculative Decoding for Llama at Scale: Challenges and Solutions","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-05T21:38:52.571364Z"},"links":{"cited_paper":"/paper/2302.01318","citing_paper":"/paper/2508.08192"},"observation_digest":"sha256:c962f3ada5d196b4703afe534a78fc4274d7636f737cef400f265c4fe4a33e30","observation_id":"33ef08b4-b26e-4bd0-875b-27f2784c268e","resolution":{"observed_at":"2026-08-05T21:38:52.571364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:38:55.107928Z","title":"Xupeng Miao et al","venue":null,"work_id":"39289c27-7377-468f-a316-2c809d62e9b7","year":2025},"citing_paper":{"arxiv_id":"2508.08192","last_updated":"2025-08-11T17:11:26Z","snapshot_observed_at":"2026-08-08T01:17:25.728418Z","submitted_at":"2025-08-11T17:11:26Z","title":"Efficient Speculative Decoding for Llama at Scale: Challenges and Solutions","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-05T21:38:53.815994Z"},"links":{"citing_paper":"/paper/2508.08192"},"observation_digest":"sha256:0b07fdd49cdba19c2c2ebd258c466bbc526eb0071a065a32fe467421c8f34515","observation_id":"ee79eeae-b9dc-4d04-863c-a77925ad01d5","resolution":{"observed_at":"2026-08-05T21:38:55.238570Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.08192","last_updated":"2025-08-11T17:11:26Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T01:17:25.728418Z","submitted_at":"2025-08-11T17:11:26Z","title":"Efficient Speculative Decoding for Llama at Scale: Challenges and Solutions"},"reference_resolution":{"displayed":19,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":0,"verified_fuzzy":3},"total_outbound_references":19},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 19 of 19 outbound references and 4 inbound Pith citation observations for arXiv:2508.08192."}