{"as_of":"2026-08-09T10:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:42716cce198b7f0b93a864793adcf8a83bb0cec9db49ff46130de8b13f600b84","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T23:34:56.846403Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.01651/citation-record","integrity":"/paper/2608.01651/integrity","json":"/paper/2608.01651/citation-record.json","paper":"/paper/2608.01651"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:34:58.121355Z","title":"Taming Throughput-Latency tradeoff in LLM inference with Sarathi-Serve,","venue":null,"work_id":"4a46337b-d220-43ab-b06c-c3a7f7444f7f","year":2024},"citing_paper":{"arxiv_id":"2608.01651","last_updated":"2026-08-03T03:43:14Z","snapshot_observed_at":"2026-08-08T02:11:52.585692Z","submitted_at":"2026-08-03T03:43:14Z","title":"Bole: Efficient Tree Speculation for Hybrid-Attention Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T23:34:56.695540Z"},"links":{"citing_paper":"/paper/2608.01651"},"observation_digest":"sha256:333ef4c6c8114b7ffc0d400d19d9e812d1dd4cad01036d0952f2fedd6c9c89e1","observation_id":"6329b19f-2260-42fd-b9bf-2ab9f8c1b84a","resolution":{"observed_at":"2026-08-04T23:34:58.124106Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2606.16038","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:34:57.850689Z","title":"Open-swe-traces: Advancing dual-mode multilingual distillation for software engineering agents,","venue":null,"work_id":"f2fcdfcf-3117-42ed-8989-ea3f44165af1","year":2026},"citing_paper":{"arxiv_id":"2608.01651","last_updated":"2026-08-03T03:43:14Z","snapshot_observed_at":"2026-08-08T02:11:52.585692Z","submitted_at":"2026-08-03T03:43:14Z","title":"Bole: Efficient Tree Speculation for Hybrid-Attention Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T23:34:56.698868Z"},"links":{"citing_paper":"/paper/2608.01651"},"observation_digest":"sha256:571dbb32ec937ab436d1cc10d6f33e93b34115edc0667e182a3a39ae1473fd99","observation_id":"9c3e815c-d5ac-46f1-91fd-671471c8f9f9","resolution":{"observed_at":"2026-08-04T23:34:57.854572Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-02T19:23:53.535075Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-04T23:34:56.701873Z","title":"Program synthesis with large language models,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.01651","last_updated":"2026-08-03T03:43:14Z","snapshot_observed_at":"2026-08-08T02:11:52.585692Z","submitted_at":"2026-08-03T03:43:14Z","title":"Bole: Efficient Tree Speculation for Hybrid-Attention Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T23:34:56.701873Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2608.01651"},"observation_digest":"sha256:a793bc91ae00187c86f93bd1137a96fd1cddfafb25e863008b866596f334cd2e","observation_id":"b358d3a9-81ac-414e-9fe2-f908aaa5f5a0","resolution":{"observed_at":"2026-08-04T23:34:56.701873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:34:58.113144Z","title":"Medusa: Simple LLM inference acceleration framework with multiple decoding heads,","venue":null,"work_id":"5c6fc769-1d5f-4798-a78d-c1032f07c894","year":2024},"citing_paper":{"arxiv_id":"2608.01651","last_updated":"2026-08-03T03:43:14Z","snapshot_observed_at":"2026-08-08T02:11:52.585692Z","submitted_at":"2026-08-03T03:43:14Z","title":"Bole: Efficient Tree Speculation for Hybrid-Attention Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T23:34:56.704970Z"},"links":{"citing_paper":"/paper/2608.01651"},"observation_digest":"sha256:12b35eaf061b94ff9fec8a7bebadeee19d11647d9c95436ce13ad778ae5f1bd3","observation_id":"a2d1821c-8c83-48db-91bd-4d22083b50dd","resolution":{"observed_at":"2026-08-04T23:34:58.116183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:34:58.105070Z","title":"Accelerating large language model decoding with speculative sampling,","venue":null,"work_id":"e323d341-d34b-45c5-8309-1d7fc55cfc06","year":null},"citing_paper":{"arxiv_id":"2608.01651","last_updated":"2026-08-03T03:43:14Z","snapshot_observed_at":"2026-08-08T02:11:52.585692Z","submitted_at":"2026-08-03T03:43:14Z","title":"Bole: Efficient Tree Speculation for Hybrid-Attention Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T23:34:56.708145Z"},"links":{"citing_paper":"/paper/2608.01651"},"observation_digest":"sha256:68a1e919de6b587a17388e6d5bdea3b9d75ce3e798eefbdbd318dcf27b9cffb5","observation_id":"5d56c3e1-8fa1-4da9-a50a-4006741a1276","resolution":{"observed_at":"2026-08-04T23:34:58.108000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12374","last_updated":"2025-07-05T03:31:01Z","snapshot_observed_at":"2026-08-08T08:32:41.951263Z","submitted_at":"2024-02-19T18:58:32Z","title":"Sequoia: Scalable, Robust, and Hardware-aware Speculative Decoding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12374","snapshot_observed_at":"2026-08-04T23:34:56.714038Z","title":"Sequoia: Scalable, robust, and hardware-aware speculative decoding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01651","last_updated":"2026-08-03T03:43:14Z","snapshot_observed_at":"2026-08-08T02:11:52.585692Z","submitted_at":"2026-08-03T03:43:14Z","title":"Bole: Efficient Tree Speculation for Hybrid-Attention Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T23:34:56.714038Z"},"links":{"cited_paper":"/paper/2402.12374","citing_paper":"/paper/2608.01651"},"observation_digest":"sha256:0d7ea2c5d972beb6232425baeb03730a5e863da5e3d506b793f813d5927a76a5","observation_id":"41c3e34a-2038-4378-b496-0fa3be60e862","resolution":{"observed_at":"2026-08-04T23:34:56.714038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-04T23:34:56.717585Z","title":"Training verifiers to solve math word problems,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.01651","last_updated":"2026-08-03T03:43:14Z","snapshot_observed_at":"2026-08-08T02:11:52.585692Z","submitted_at":"2026-08-03T03:43:14Z","title":"Bole: Efficient Tree Speculation for Hybrid-Attention Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T23:34:56.717585Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2608.01651"},"observation_digest":"sha256:98fe5e361fdfdf3dd970f4cf0fe2a8451c30d4e1e743528a0474186c44d8c39f","observation_id":"3a81927f-d5c7-4993-a494-1ce773e71ff2","resolution":{"observed_at":"2026-08-04T23:34:56.717585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:34:58.096890Z","title":"Better & faster large language models via multi-token prediction,","venue":null,"work_id":"266331cd-0ef4-432f-8724-fc51b912e971","year":2024},"citing_paper":{"arxiv_id":"2608.01651","last_updated":"2026-08-03T03:43:14Z","snapshot_observed_at":"2026-08-08T02:11:52.585692Z","submitted_at":"2026-08-03T03:43:14Z","title":"Bole: Efficient Tree Speculation for Hybrid-Attention Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T23:34:56.720709Z"},"links":{"citing_paper":"/paper/2608.01651"},"observation_digest":"sha256:03012f3de8b8a8aa74fecaf5f4693ef7f564b2b2c1d00b9072aa77cdbd6910df","observation_id":"296a7cc9-540f-4ea6-8f4a-de259765a09a","resolution":{"observed_at":"2026-08-04T23:34:58.099691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:34:58.089577Z","title":"Yggdrasil: Bridging dynamic speculation and static runtime for latency-optimal tree- based LLM decoding,","venue":null,"work_id":"fdf57f8b-2a64-4c38-9626-6b28b2fda1c5","year":2025},"citing_paper":{"arxiv_id":"2608.01651","last_updated":"2026-08-03T03:43:14Z","snapshot_observed_at":"2026-08-08T02:11:52.585692Z","submitted_at":"2026-08-03T03:43:14Z","title":"Bole: Efficient Tree Speculation for Hybrid-Attention Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T23:34:56.723608Z"},"links":{"citing_paper":"/paper/2608.01651"},"observation_digest":"sha256:18b3bf86f9e96ef57325a4c1dd7c87de437dc7c6c5e526774f8b0b99bc7494ec","observation_id":"f03a369e-2f3c-4956-b816-dc933ee702c4","resolution":{"observed_at":"2026-08-04T23:34:58.092451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:34:56.726380Z","title":"Papi: Exploiting dynamic parallelism in large language model decoding with a processing-in-memory-enabled computing system,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01651","last_updated":"2026-08-03T03:43:14Z","snapshot_observed_at":"2026-08-08T02:11:52.585692Z","submitted_at":"2026-08-03T03:43:14Z","title":"Bole: Efficient Tree Speculation for Hybrid-Attention Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T23:34:56.726380Z"},"links":{"citing_paper":"/paper/2608.01651"},"observation_digest":"sha256:1aa9eb06a26a853ef8decae4a71019c52957412e5f00cfc355c59a22a7309822","observation_id":"94009cd4-5c80-4777-aab6-25484e9187ca","resolution":{"observed_at":"2026-08-04T23:34:56.726380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:34:58.081689Z","title":"Bridging draft policy misalignment: Group tree optimization for speculative decoding,","venue":null,"work_id":"cb9724f2-6fb9-44f2-b65e-db7c35adbfc6","year":2026},"citing_paper":{"arxiv_id":"2608.01651","last_updated":"2026-08-03T03:43:14Z","snapshot_observed_at":"2026-08-08T02:11:52.585692Z","submitted_at":"2026-08-03T03:43:14Z","title":"Bole: Efficient Tree Speculation for Hybrid-Attention Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T23:34:56.729247Z"},"links":{"citing_paper":"/paper/2608.01651"},"observation_digest":"sha256:47f0e2ad8f452748ecd17dddce441514e7ed7ccaa590637a7e7b0f865d1f423d","observation_id":"d65ce328-f1ed-48ce-9452-d1ba3ef61784","resolution":{"observed_at":"2026-08-04T23:34:58.084724Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:34:56.734525Z","title":"Pod-attention: Unlocking full prefill-decode overlap for faster llm inference,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01651","last_updated":"2026-08-03T03:43:14Z","snapshot_observed_at":"2026-08-08T02:11:52.585692Z","submitted_at":"2026-08-03T03:43:14Z","title":"Bole: Efficient Tree Speculation for Hybrid-Attention Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T23:34:56.734525Z"},"links":{"citing_paper":"/paper/2608.01651"},"observation_digest":"sha256:ed9c1f74df4d321d6912e1f57bfa3a73bea95a9e17eea321819aea54d8b94424","observation_id":"fa33ab29-b983-483f-aaff-9bd1176265f0","resolution":{"observed_at":"2026-08-04T23:34:56.734525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:34:56.737160Z","title":"Pimba: A processing-in-memory acceleration for post-transformer large language model serving,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01651","last_updated":"2026-08-03T03:43:14Z","snapshot_observed_at":"2026-08-08T02:11:52.585692Z","submitted_at":"2026-08-03T03:43:14Z","title":"Bole: Efficient Tree Speculation for Hybrid-Attention Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T23:34:56.737160Z"},"links":{"citing_paper":"/paper/2608.01651"},"observation_digest":"sha256:0ac2d820311808d60c10c965d2f5a89073209164d1c30c5fa042760a93dc180d","observation_id":"819522c8-b345-4da7-b4b4-19d448e8f0f9","resolution":{"observed_at":"2026-08-04T23:34:56.737160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:34:56.739878Z","title":"Efficient memory management for large language model serving with pagedattention,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.01651","last_updated":"2026-08-03T03:43:14Z","snapshot_observed_at":"2026-08-08T02:11:52.585692Z","submitted_at":"2026-08-03T03:43:14Z","title":"Bole: Efficient Tree Speculation for Hybrid-Attention Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T23:34:56.739878Z"},"links":{"citing_paper":"/paper/2608.01651"},"observation_digest":"sha256:38bdf544f2240b680d87e26f0cf039d0c8f72b3e7cfcce00aa211ac955eb9fd2","observation_id":"4b98fde6-42c6-4d26-b3d5-2e0de4616326","resolution":{"observed_at":"2026-08-04T23:34:56.739878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:34:58.073195Z","title":"Fast inference from transformers via speculative decoding,","venue":null,"work_id":"39bdfc12-8d38-4215-87d5-5d431bff7ce3","year":2023},"citing_paper":{"arxiv_id":"2608.01651","last_updated":"2026-08-03T03:43:14Z","snapshot_observed_at":"2026-08-08T02:11:52.585692Z","submitted_at":"2026-08-03T03:43:14Z","title":"Bole: Efficient Tree Speculation for Hybrid-Attention Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T23:34:56.742647Z"},"links":{"citing_paper":"/paper/2608.01651"},"observation_digest":"sha256:3276b4a9a4c53429e0c1a7155262ce6959540aeaf0e5874f386dd4c923e1af0e","observation_id":"a3a41fce-23c2-4e55-a210-5bfde570bdf1","resolution":{"observed_at":"2026-08-04T23:34:58.076505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:34:56.748666Z","title":"Orches: Orchestrated test-time-compute-based llm reasoning on collaborative gpu-pim heterogeneous system,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01651","last_updated":"2026-08-03T03:43:14Z","snapshot_observed_at":"2026-08-08T02:11:52.585692Z","submitted_at":"2026-08-03T03:43:14Z","title":"Bole: Efficient Tree Speculation for Hybrid-Attention Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T23:34:56.748666Z"},"links":{"citing_paper":"/paper/2608.01651"},"observation_digest":"sha256:7db9949fbb09a95906dfc5c23ac418bcbd453d772bdcbe208d58d783b7f464f9","observation_id":"510c84a3-2a10-4a5c-8067-64be9b2152fd","resolution":{"observed_at":"2026-08-04T23:34:56.748666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:34:58.065849Z","title":"EAGLE-2: Faster inference of language models with dynamic draft trees,","venue":null,"work_id":"29da3a88-6915-4c1b-8f51-031d1762b52c","year":2024},"citing_paper":{"arxiv_id":"2608.01651","last_updated":"2026-08-03T03:43:14Z","snapshot_observed_at":"2026-08-08T02:11:52.585692Z","submitted_at":"2026-08-03T03:43:14Z","title":"Bole: Efficient Tree Speculation for Hybrid-Attention Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T23:34:56.751295Z"},"links":{"citing_paper":"/paper/2608.01651"},"observation_digest":"sha256:953602bc8003f5b16f1b091c35ac482f71f0ebf032437876e5183749c6ac5be8","observation_id":"8490ba93-2d01-485a-a550-cf3627768e51","resolution":{"observed_at":"2026-08-04T23:34:58.068928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:34:58.057755Z","title":"Eagle-3: Scaling up inference acceleration of large language models via training-time test,","venue":null,"work_id":"4e8d6a2f-6881-4d5e-85ac-44088d9dd7b2","year":2025},"citing_paper":{"arxiv_id":"2608.01651","last_updated":"2026-08-03T03:43:14Z","snapshot_observed_at":"2026-08-08T02:11:52.585692Z","submitted_at":"2026-08-03T03:43:14Z","title":"Bole: Efficient Tree Speculation for Hybrid-Attention Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T23:34:56.753852Z"},"links":{"citing_paper":"/paper/2608.01651"},"observation_digest":"sha256:f4e86482d1116c2e5bb5a12ceadb5053ac7b000c17436e6f2335e10c28004d0b","observation_id":"343c301c-3e3d-45d1-80b2-3e1d6974f9be","resolution":{"observed_at":"2026-08-04T23:34:58.061487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:34:56.756424Z","title":"Adaserve: Accelerating multi-slo llm serving with slo-customized speculative decoding,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.01651","last_updated":"2026-08-03T03:43:14Z","snapshot_observed_at":"2026-08-08T02:11:52.585692Z","submitted_at":"2026-08-03T03:43:14Z","title":"Bole: Efficient Tree Speculation for Hybrid-Attention Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T23:34:56.756424Z"},"links":{"citing_paper":"/paper/2608.01651"},"observation_digest":"sha256:d22a7b7bcb1865d6e07e61942fe6ae1993ec85ff3090189dd65c393175ca6be4","observation_id":"7b0a1622-72f0-44b1-8409-f9b8015de48a","resolution":{"observed_at":"2026-08-04T23:34:56.756424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:34:58.049752Z","title":"Speculative decoding: Performance or illusion?","venue":null,"work_id":"25f624ff-7b6c-4b3f-ab27-40e64dce9fd5","year":2026},"citing_paper":{"arxiv_id":"2608.01651","last_updated":"2026-08-03T03:43:14Z","snapshot_observed_at":"2026-08-08T02:11:52.585692Z","submitted_at":"2026-08-03T03:43:14Z","title":"Bole: Efficient Tree Speculation for Hybrid-Attention Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T23:34:56.759847Z"},"links":{"citing_paper":"/paper/2608.01651"},"observation_digest":"sha256:d74015949e3a7e32cbccbea9f8b87f54332905c863a1bdb4a8b31205f689f5d1","observation_id":"541cab22-df40-40a4-9be6-1db16051545a","resolution":{"observed_at":"2026-08-04T23:34:58.052560Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:34:58.041835Z","title":"CacheSlide: Unlocking cross Position-Aware KV cache reuse for accelerating LLM serving,","venue":null,"work_id":"b11a2bb8-bfc1-4196-b2d4-9fa5ade71352","year":2026},"citing_paper":{"arxiv_id":"2608.01651","last_updated":"2026-08-03T03:43:14Z","snapshot_observed_at":"2026-08-08T02:11:52.585692Z","submitted_at":"2026-08-03T03:43:14Z","title":"Bole: Efficient Tree Speculation for Hybrid-Attention Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T23:34:56.762499Z"},"links":{"citing_paper":"/paper/2608.01651"},"observation_digest":"sha256:fba35634e1e56292bd69b8cf7362db5906c1cbadeb4d755061581b90c9bb433c","observation_id":"ef9c02c0-d2bf-4737-bb93-dbf8600041bc","resolution":{"observed_at":"2026-08-04T23:34:58.045015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:34:58.033791Z","title":"Agentix: An efficient serving engine for LLM agents as general programs,","venue":null,"work_id":"86651385-72a3-4561-afae-8063c209f9ab","year":2026},"citing_paper":{"arxiv_id":"2608.01651","last_updated":"2026-08-03T03:43:14Z","snapshot_observed_at":"2026-08-08T02:11:52.585692Z","submitted_at":"2026-08-03T03:43:14Z","title":"Bole: Efficient Tree Speculation for Hybrid-Attention Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T23:34:56.765160Z"},"links":{"citing_paper":"/paper/2608.01651"},"observation_digest":"sha256:63e0b16f64ec83bea0f5bff3d2efb493bf924070aed045c20978ff5528fce60d","observation_id":"3460b5a7-58fa-4aa3-ad95-8654d9c6bff3","resolution":{"observed_at":"2026-08-04T23:34:58.036706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:34:58.025531Z","title":"No buffer, no bottleneck: Efficient Zero-Copy KV cache offloading for Long-Context LLMs,","venue":null,"work_id":"e2d9f06b-ecb8-4c4f-8163-23858b22ba87","year":2026},"citing_paper":{"arxiv_id":"2608.01651","last_updated":"2026-08-03T03:43:14Z","snapshot_observed_at":"2026-08-08T02:11:52.585692Z","submitted_at":"2026-08-03T03:43:14Z","title":"Bole: Efficient Tree Speculation for Hybrid-Attention Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T23:34:56.767778Z"},"links":{"citing_paper":"/paper/2608.01651"},"observation_digest":"sha256:f1e91b90195cc8d85d042d21ea364cff2266e2a922224a611754180e6a79cd64","observation_id":"7650ec64-9a17-41cc-887e-007fdee0c498","resolution":{"observed_at":"2026-08-04T23:34:58.029402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:34:56.770410Z","title":"Specinfer: Accelerating large language model serving with tree-based speculative inference and verification,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01651","last_updated":"2026-08-03T03:43:14Z","snapshot_observed_at":"2026-08-08T02:11:52.585692Z","submitted_at":"2026-08-03T03:43:14Z","title":"Bole: Efficient Tree Speculation for Hybrid-Attention Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T23:34:56.770410Z"},"links":{"citing_paper":"/paper/2608.01651"},"observation_digest":"sha256:3a804a23ccfd99a92551728b528fe367ce5a5222d0db93a69ae4aa541fcc0db6","observation_id":"c00efa0f-bb4c-44b4-a9ea-f5bb1b31479f","resolution":{"observed_at":"2026-08-04T23:34:56.770410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:34:56.773049Z","title":"Efficient large-scale language model training on gpu clusters using megatron-lm,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.01651","last_updated":"2026-08-03T03:43:14Z","snapshot_observed_at":"2026-08-08T02:11:52.585692Z","submitted_at":"2026-08-03T03:43:14Z","title":"Bole: Efficient Tree Speculation for Hybrid-Attention Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T23:34:56.773049Z"},"links":{"citing_paper":"/paper/2608.01651"},"observation_digest":"sha256:6c4da1c7441fd4c347956f0797e146c6cf80bd2f78969610c1fc4e6d763a1267","observation_id":"3102521f-27a9-443d-aa13-b1c30c48ac49","resolution":{"observed_at":"2026-08-04T23:34:56.773049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:34:58.017464Z","title":"CUDA Programming Guide: CUDA Graphs,","venue":null,"work_id":"a2fad4f8-b8d7-43cf-a510-d20771ac3d99","year":2026},"citing_paper":{"arxiv_id":"2608.01651","last_updated":"2026-08-03T03:43:14Z","snapshot_observed_at":"2026-08-08T02:11:52.585692Z","submitted_at":"2026-08-03T03:43:14Z","title":"Bole: Efficient Tree Speculation for Hybrid-Attention Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T23:34:56.775582Z"},"links":{"citing_paper":"/paper/2608.01651"},"observation_digest":"sha256:f44735bc0279891ee74fa297a4d1528f2b3652e19a632a3ac3aad3621eab9c35","observation_id":"1cbac254-604b-47ce-bfb8-e22dd2af5948","resolution":{"observed_at":"2026-08-04T23:34:58.020532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:34:58.009661Z","title":"NVIDIA Nsight Compute Documentation,","venue":null,"work_id":"3fdb8a0b-c1c4-489e-8580-7f089e17512d","year":2026},"citing_paper":{"arxiv_id":"2608.01651","last_updated":"2026-08-03T03:43:14Z","snapshot_observed_at":"2026-08-08T02:11:52.585692Z","submitted_at":"2026-08-03T03:43:14Z","title":"Bole: Efficient Tree Speculation for Hybrid-Attention Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T23:34:56.778082Z"},"links":{"citing_paper":"/paper/2608.01651"},"observation_digest":"sha256:f4e918f9d27e372083e66db787de85e7b5684fc47a3918dbbfbf72bcf31a56ca","observation_id":"4c92c93e-63c6-4bb4-8c3f-29821dd13de7","resolution":{"observed_at":"2026-08-04T23:34:58.012710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:34:58.002397Z","title":"NVIDIA Nsight Systems User Guide,","venue":null,"work_id":"30e5cf4b-8ed5-4b2a-bd4a-b7dc9daa65b0","year":2026},"citing_paper":{"arxiv_id":"2608.01651","last_updated":"2026-08-03T03:43:14Z","snapshot_observed_at":"2026-08-08T02:11:52.585692Z","submitted_at":"2026-08-03T03:43:14Z","title":"Bole: Efficient Tree Speculation for Hybrid-Attention Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T23:34:56.780615Z"},"links":{"citing_paper":"/paper/2608.01651"},"observation_digest":"sha256:27ef37b1eef5bff3fe7c19642e1b471d684187d6b964eac11914b92ef3758a7e","observation_id":"ad36ac27-bea9-41e2-a4f1-d6857fd8fe50","resolution":{"observed_at":"2026-08-04T23:34:58.005213Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:34:57.995163Z","title":"Marconi: Prefix caching for the era of hybrid llms,","venue":null,"work_id":"a59f5859-040b-420a-834c-77c342b0390f","year":2025},"citing_paper":{"arxiv_id":"2608.01651","last_updated":"2026-08-03T03:43:14Z","snapshot_observed_at":"2026-08-08T02:11:52.585692Z","submitted_at":"2026-08-03T03:43:14Z","title":"Bole: Efficient Tree Speculation for Hybrid-Attention Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T23:34:56.783043Z"},"links":{"citing_paper":"/paper/2608.01651"},"observation_digest":"sha256:27877d1d933485209802e5222514f57e2fee5b250d9cefc42007b3659eb2c8bf","observation_id":"74e51260-d55d-4a1d-95e1-14039000aba4","resolution":{"observed_at":"2026-08-04T23:34:57.998021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:34:57.987609Z","title":"Mooncake: Trading more storage for less computation — a KVCache-centric architecture for serving LLM chatbot,","venue":null,"work_id":"ea62703b-ae89-46c5-ac1c-06a46d7997f5","year":2025},"citing_paper":{"arxiv_id":"2608.01651","last_updated":"2026-08-03T03:43:14Z","snapshot_observed_at":"2026-08-08T02:11:52.585692Z","submitted_at":"2026-08-03T03:43:14Z","title":"Bole: Efficient Tree Speculation for Hybrid-Attention Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T23:34:56.788834Z"},"links":{"citing_paper":"/paper/2608.01651"},"observation_digest":"sha256:1cc6e9ecfd3519841bfb6c5b5d13096bd73828027a2bde445b874e8986f4a02e","observation_id":"52486329-8c91-4d4b-84bd-4b94310c1a63","resolution":{"observed_at":"2026-08-04T23:34:57.990529Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:34:57.979274Z","title":"Qwen3.5: Towards native multimodal agents,","venue":null,"work_id":"477e7066-694c-470f-baa5-b1807e449f0c","year":2026},"citing_paper":{"arxiv_id":"2608.01651","last_updated":"2026-08-03T03:43:14Z","snapshot_observed_at":"2026-08-08T02:11:52.585692Z","submitted_at":"2026-08-03T03:43:14Z","title":"Bole: Efficient Tree Speculation for Hybrid-Attention Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T23:34:56.791474Z"},"links":{"citing_paper":"/paper/2608.01651"},"observation_digest":"sha256:1b2381a266b9ae069bcab809b49517ca19dd072db43f18cb5cbfa3fbd29a4c00","observation_id":"145fe7ed-7026-4bc8-a77f-92bca7747bd8","resolution":{"observed_at":"2026-08-04T23:34:57.982799Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:34:57.971030Z","title":"Get to the point: Summarization with pointer-generator networks,","venue":null,"work_id":"e8ed8348-a2c6-4a2f-a2b3-e15b6be9615c","year":2017},"citing_paper":{"arxiv_id":"2608.01651","last_updated":"2026-08-03T03:43:14Z","snapshot_observed_at":"2026-08-08T02:11:52.585692Z","submitted_at":"2026-08-03T03:43:14Z","title":"Bole: Efficient Tree Speculation for Hybrid-Attention Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T23:34:56.793960Z"},"links":{"citing_paper":"/paper/2608.01651"},"observation_digest":"sha256:f75d5cd28f6d8284b19121b36422349e5791a860122ce0a763858b13df9f794a","observation_id":"ed74e44a-f1bc-4d3d-a066-6b49d9fe8740","resolution":{"observed_at":"2026-08-04T23:34:57.974060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:34:57.962422Z","title":"GitHub - sgl-project/sglang at release/v0.5.12 — github.com,","venue":null,"work_id":"111e2f10-2da8-4c00-99ca-74b216a5f843","year":2026},"citing_paper":{"arxiv_id":"2608.01651","last_updated":"2026-08-03T03:43:14Z","snapshot_observed_at":"2026-08-08T02:11:52.585692Z","submitted_at":"2026-08-03T03:43:14Z","title":"Bole: Efficient Tree Speculation for Hybrid-Attention Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T23:34:56.796907Z"},"links":{"citing_paper":"/paper/2608.01651"},"observation_digest":"sha256:0b61dbac9ef42969425caad93e2bc39df2173c18c8f3e7ae1ca0033bb086b3d7","observation_id":"adb0e956-5cf9-4cc3-b540-22e1d91385f2","resolution":{"observed_at":"2026-08-04T23:34:57.965305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:34:57.953414Z","title":"anon8231489123/ShareGPT Vicuna unfiltered · Datasets at Hugging Face — huggingface.co,","venue":null,"work_id":"4476a8ba-cacc-4a0f-907c-722c60fdbff3","year":2026},"citing_paper":{"arxiv_id":"2608.01651","last_updated":"2026-08-03T03:43:14Z","snapshot_observed_at":"2026-08-08T02:11:52.585692Z","submitted_at":"2026-08-03T03:43:14Z","title":"Bole: Efficient Tree Speculation for Hybrid-Attention Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T23:34:56.799558Z"},"links":{"citing_paper":"/paper/2608.01651"},"observation_digest":"sha256:976bee1217858630c70e734f7e5a965f23f09c61c5fa6c592c2cb5eeb89b28e4","observation_id":"9eca6b96-d966-434e-b9cc-5227e861a25c","resolution":{"observed_at":"2026-08-04T23:34:57.956695Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:34:57.946188Z","title":"Llumnix: Dynamic scheduling for large language model serving,","venue":null,"work_id":"a311265a-e6cd-4754-8e6b-7b88dbc8b7da","year":2024},"citing_paper":{"arxiv_id":"2608.01651","last_updated":"2026-08-03T03:43:14Z","snapshot_observed_at":"2026-08-08T02:11:52.585692Z","submitted_at":"2026-08-03T03:43:14Z","title":"Bole: Efficient Tree Speculation for Hybrid-Attention Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T23:34:56.801941Z"},"links":{"citing_paper":"/paper/2608.01651"},"observation_digest":"sha256:050365820deacef805293b883ddd3e2bd42ad05840ee2623ee83754fb2e628ab","observation_id":"27902834-7cb9-4369-9541-b26c00a13516","resolution":{"observed_at":"2026-08-04T23:34:57.948954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-08-07T19:30:34.681869Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-08-04T23:34:56.804544Z","title":"Kimi linear: An expressive, efficient attention architecture,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01651","last_updated":"2026-08-03T03:43:14Z","snapshot_observed_at":"2026-08-08T02:11:52.585692Z","submitted_at":"2026-08-03T03:43:14Z","title":"Bole: Efficient Tree Speculation for Hybrid-Attention Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T23:34:56.804544Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2608.01651"},"observation_digest":"sha256:3979633e70a24ce263ff5957fe604cfd60bde6ac48fa63785f633b78419c03db","observation_id":"2a5a3837-1995-4e42-b918-6191772cb2a2","resolution":{"observed_at":"2026-08-04T23:34:56.804544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:34:56.807486Z","title":"Triton: an intermediate language and compiler for tiled neural network computations,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.01651","last_updated":"2026-08-03T03:43:14Z","snapshot_observed_at":"2026-08-08T02:11:52.585692Z","submitted_at":"2026-08-03T03:43:14Z","title":"Bole: Efficient Tree Speculation for Hybrid-Attention Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-04T23:34:56.807486Z"},"links":{"citing_paper":"/paper/2608.01651"},"observation_digest":"sha256:ce7a1b1c5edd87c53ceb3812958c51005bcc3ee81d4110c3e2733460ba829d01","observation_id":"74088bc6-074f-4dba-a5bf-651ef49861b7","resolution":{"observed_at":"2026-08-04T23:34:56.807486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:34:57.938626Z","title":"Adap- tive draft sequence length: Enhancing speculative decoding throughput on pim-enabled systems,","venue":null,"work_id":"7babb54d-829a-47b8-b26d-3ccf541fe632","year":2026},"citing_paper":{"arxiv_id":"2608.01651","last_updated":"2026-08-03T03:43:14Z","snapshot_observed_at":"2026-08-08T02:11:52.585692Z","submitted_at":"2026-08-03T03:43:14Z","title":"Bole: Efficient Tree Speculation for Hybrid-Attention Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-04T23:34:56.810674Z"},"links":{"citing_paper":"/paper/2608.01651"},"observation_digest":"sha256:36a45b027f72e75e55bca6b85ee34dc07e3d67451af0401f4edb9078d1c43311","observation_id":"9f23af17-10ee-4ed3-ae8d-8f8dffa7159b","resolution":{"observed_at":"2026-08-04T23:34:57.941600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:34:57.930055Z","title":"Openhands: An open platform for ai software developers as generalist agents,","venue":null,"work_id":"8e4d52b9-13f3-4f0b-947e-e2c85e9ce423","year":2025},"citing_paper":{"arxiv_id":"2608.01651","last_updated":"2026-08-03T03:43:14Z","snapshot_observed_at":"2026-08-08T02:11:52.585692Z","submitted_at":"2026-08-03T03:43:14Z","title":"Bole: Efficient Tree Speculation for Hybrid-Attention Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-04T23:34:56.813367Z"},"links":{"citing_paper":"/paper/2608.01651"},"observation_digest":"sha256:20e5002f06452c060963aa2fd987e9931ab4d2059584ce7361c1d596e6c68b7d","observation_id":"9f2b2780-522c-4994-a2a1-e88fda4ec9ff","resolution":{"observed_at":"2026-08-04T23:34:57.933584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:34:56.817103Z","title":"Roofline: an insightful visual performance model for multicore architectures,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2608.01651","last_updated":"2026-08-03T03:43:14Z","snapshot_observed_at":"2026-08-08T02:11:52.585692Z","submitted_at":"2026-08-03T03:43:14Z","title":"Bole: Efficient Tree Speculation for Hybrid-Attention Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-04T23:34:56.817103Z"},"links":{"citing_paper":"/paper/2608.01651"},"observation_digest":"sha256:79b2957a3c2ea60565cd92c0598bbf67b2d1d17268978338a457398bfcaabe80","observation_id":"34f30b30-2b7c-4c4f-97c4-f776e3459680","resolution":{"observed_at":"2026-08-04T23:34:56.817103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:34:57.920995Z","title":"Stree: Speculative tree decoding for hybrid state space models,","venue":null,"work_id":"18f1fd25-9be4-46fc-83d3-d30d6fb8b189","year":2025},"citing_paper":{"arxiv_id":"2608.01651","last_updated":"2026-08-03T03:43:14Z","snapshot_observed_at":"2026-08-08T02:11:52.585692Z","submitted_at":"2026-08-03T03:43:14Z","title":"Bole: Efficient Tree Speculation for Hybrid-Attention Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-04T23:34:56.819686Z"},"links":{"citing_paper":"/paper/2608.01651"},"observation_digest":"sha256:365bffdcf023b17c04962020fd3b4e4ec2e9965c08b7f9ca00723eb801e9528e","observation_id":"22984f73-11fc-4377-bf95-5170c7303300","resolution":{"observed_at":"2026-08-04T23:34:57.924591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:34:57.911925Z","title":"Strata: Hierarchical context caching for long context language model serving,","venue":null,"work_id":"96fc19d3-afca-407b-aaea-e41ae16d37bb","year":2026},"citing_paper":{"arxiv_id":"2608.01651","last_updated":"2026-08-03T03:43:14Z","snapshot_observed_at":"2026-08-08T02:11:52.585692Z","submitted_at":"2026-08-03T03:43:14Z","title":"Bole: Efficient Tree Speculation for Hybrid-Attention Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-04T23:34:56.822338Z"},"links":{"citing_paper":"/paper/2608.01651"},"observation_digest":"sha256:a56a4ab244772cd772c2c1f4e991f4161c47a6156f8e12b55d0b8d4bb8eb90bd","observation_id":"defa3908-f307-47a4-8665-d722fd90f93b","resolution":{"observed_at":"2026-08-04T23:34:57.915181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:34:57.903157Z","title":"Gated delta networks: Improving mamba2 with delta rule,","venue":null,"work_id":"2f54c3e7-1347-495b-89ad-299791a769f3","year":2025},"citing_paper":{"arxiv_id":"2608.01651","last_updated":"2026-08-03T03:43:14Z","snapshot_observed_at":"2026-08-08T02:11:52.585692Z","submitted_at":"2026-08-03T03:43:14Z","title":"Bole: Efficient Tree Speculation for Hybrid-Attention Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-04T23:34:56.825091Z"},"links":{"citing_paper":"/paper/2608.01651"},"observation_digest":"sha256:d58fc61c9376067ddeffccce527a3498cfc30bcc2760e935a79bf64de0738850","observation_id":"da079084-1e09-4c0a-b498-92afe391c455","resolution":{"observed_at":"2026-08-04T23:34:57.906315Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:34:57.893416Z","title":"Deft: Decoding with flash tree-attention for efficient tree-structured llm inference,","venue":null,"work_id":"1887b61a-371d-42d5-8391-8ba04db3af39","year":2025},"citing_paper":{"arxiv_id":"2608.01651","last_updated":"2026-08-03T03:43:14Z","snapshot_observed_at":"2026-08-08T02:11:52.585692Z","submitted_at":"2026-08-03T03:43:14Z","title":"Bole: Efficient Tree Speculation for Hybrid-Attention Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-04T23:34:56.827799Z"},"links":{"citing_paper":"/paper/2608.01651"},"observation_digest":"sha256:f5c431a08dddfbac27c02646e35c948e0db6c7a603628f752a9af3bafe5b06c5","observation_id":"9febaefa-f8f9-4399-89a0-a73dc2045386","resolution":{"observed_at":"2026-08-04T23:34:57.896471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:34:57.883662Z","title":"Flashinfer: Efficient and customizable attention engine for llm inference serving,","venue":null,"work_id":"0346240f-e5fe-454e-a2aa-ac8e5bdd1847","year":2025},"citing_paper":{"arxiv_id":"2608.01651","last_updated":"2026-08-03T03:43:14Z","snapshot_observed_at":"2026-08-08T02:11:52.585692Z","submitted_at":"2026-08-03T03:43:14Z","title":"Bole: Efficient Tree Speculation for Hybrid-Attention Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-04T23:34:56.830769Z"},"links":{"citing_paper":"/paper/2608.01651"},"observation_digest":"sha256:414a7746d21909b47017280b6aa1ee21100654abd16ff0538b5602be5586ce4e","observation_id":"37f2872d-6750-46d3-9319-69a66e55f7c5","resolution":{"observed_at":"2026-08-04T23:34:57.887251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:34:56.836278Z","title":"Llmcompass: Enabling efficient hardware design for large language model inference,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01651","last_updated":"2026-08-03T03:43:14Z","snapshot_observed_at":"2026-08-08T02:11:52.585692Z","submitted_at":"2026-08-03T03:43:14Z","title":"Bole: Efficient Tree Speculation for Hybrid-Attention Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-04T23:34:56.836278Z"},"links":{"citing_paper":"/paper/2608.01651"},"observation_digest":"sha256:322d84453af28041882d779ce15142df3ef497dc7009772dc4cad48adadf0934","observation_id":"880a4d15-aa6e-4a15-9f48-a3ee80593255","resolution":{"observed_at":"2026-08-04T23:34:56.836278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"9212.37902","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:34:56.946429Z","title":"Swiftspec: Disaggregated speculative decoding and fused kernels for low-latency llm inference,","venue":null,"work_id":"c69b922d-b926-4f64-8636-88a2faff9ebd","year":2026},"citing_paper":{"arxiv_id":"2608.01651","last_updated":"2026-08-03T03:43:14Z","snapshot_observed_at":"2026-08-08T02:11:52.585692Z","submitted_at":"2026-08-03T03:43:14Z","title":"Bole: Efficient Tree Speculation for Hybrid-Attention Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-04T23:34:56.838809Z"},"links":{"citing_paper":"/paper/2608.01651"},"observation_digest":"sha256:0b71fa07dbebb90d54b4ccc609a16058e46400f97658e7cf987cb4ec371db966","observation_id":"2dd1f0d1-d306-4d0a-a222-e9585658d688","resolution":{"observed_at":"2026-08-04T23:34:56.952275Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:34:56.841217Z","title":"Atom: Low-bit quantization for efficient and accurate llm serving,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01651","last_updated":"2026-08-03T03:43:14Z","snapshot_observed_at":"2026-08-08T02:11:52.585692Z","submitted_at":"2026-08-03T03:43:14Z","title":"Bole: Efficient Tree Speculation for Hybrid-Attention Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-04T23:34:56.841217Z"},"links":{"citing_paper":"/paper/2608.01651"},"observation_digest":"sha256:958bb7515344d5a2ff9196f682b8d0c365c3a555bbc25f67365b84c48837edd2","observation_id":"fa610865-6a1f-44f2-800d-443f12480b41","resolution":{"observed_at":"2026-08-04T23:34:56.841217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:34:57.869209Z","title":"Sglang: Efficient execution of structured language model programs,","venue":null,"work_id":"76002b31-8088-46bc-b9ce-91c1459cdc79","year":2024},"citing_paper":{"arxiv_id":"2608.01651","last_updated":"2026-08-03T03:43:14Z","snapshot_observed_at":"2026-08-08T02:11:52.585692Z","submitted_at":"2026-08-03T03:43:14Z","title":"Bole: Efficient Tree Speculation for Hybrid-Attention Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-04T23:34:56.843854Z"},"links":{"citing_paper":"/paper/2608.01651"},"observation_digest":"sha256:410260bb1e2e06892a010fde242109317d3f5eb0bd883010e2d1e9a8cbdcd376","observation_id":"4851dad1-8f2d-455d-be6b-1ab59ce296f0","resolution":{"observed_at":"2026-08-04T23:34:57.873171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:34:57.859639Z","title":"NanoFlow: Towards optimal large language model serving throughput,","venue":null,"work_id":"314c4c34-6c02-4035-9d9e-9d229b5aa96a","year":2025},"citing_paper":{"arxiv_id":"2608.01651","last_updated":"2026-08-03T03:43:14Z","snapshot_observed_at":"2026-08-08T02:11:52.585692Z","submitted_at":"2026-08-03T03:43:14Z","title":"Bole: Efficient Tree Speculation for Hybrid-Attention Language Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-04T23:34:56.846403Z"},"links":{"citing_paper":"/paper/2608.01651"},"observation_digest":"sha256:13d368eb41b14da2a89efc7a72f34b91f43f6000cd11d03242a9e7252e2c1bb1","observation_id":"b65ea5f1-7791-4bf5-bc26-0800be44c666","resolution":{"observed_at":"2026-08-04T23:34:57.862730Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.01318","last_updated":"2023-02-02T18:44:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-02T18:44:11Z","title":"Accelerating Large Language Model Decoding with Speculative Sampling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.01318","snapshot_observed_at":"2026-08-04T23:34:56.711032Z","title":"Available: https://arxiv.org/abs/2302.01318","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01651","last_updated":"2026-08-03T03:43:14Z","snapshot_observed_at":"2026-08-08T02:11:52.585692Z","submitted_at":"2026-08-03T03:43:14Z","title":"Bole: Efficient Tree Speculation for Hybrid-Attention Language Models","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-04T23:34:56.711032Z"},"links":{"cited_paper":"/paper/2302.01318","citing_paper":"/paper/2608.01651"},"observation_digest":"sha256:aa8baebed697ba2b64c95345c09925a430520f5f8a3ca7e94467d8a533b288ec","observation_id":"74e19205-6bed-40de-8329-6fe6d609e5ff","resolution":{"observed_at":"2026-08-04T23:34:56.711032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.01651","last_updated":"2026-08-03T03:43:14Z","latest_version":1,"primary_category":"cs.DC","snapshot_observed_at":"2026-08-08T02:11:52.585692Z","submitted_at":"2026-08-03T03:43:14Z","title":"Bole: Efficient Tree Speculation for Hybrid-Attention Language Models"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":17,"verified_exact":1,"verified_fuzzy":32},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 0 inbound Pith citation observations for arXiv:2608.01651."}