{"as_of":"2026-08-09T07:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:560194190d2be67597e8f0cb9abd5a70b167d41be0f987016da913478dcbbda5","coverage":[{"denominator":42,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T21:08:29.373276Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.05926/citation-record","integrity":"/paper/2608.05926/integrity","json":"/paper/2608.05926/citation-record.json","paper":"/paper/2608.05926"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:08:31.754892Z","title":"Network edge inference for large language models: Principles, tech- niques, and opportunities,","venue":null,"work_id":"743e466d-cb8e-4f7e-8028-2deb930f8bbb","year":2026},"citing_paper":{"arxiv_id":"2608.05926","last_updated":"2026-08-06T11:57:36Z","snapshot_observed_at":"2026-08-09T07:11:56.092791Z","submitted_at":"2026-08-06T11:57:36Z","title":"BALANCE: Hybrid Autoregressive-Speculative LLM Inference in Wireless Edge Networks","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T21:08:28.744841Z"},"links":{"citing_paper":"/paper/2608.05926"},"observation_digest":"sha256:5ad8e88b93399f8966bc4a0c9ee5448c20c9ca36356b2860b55ade3d28433f9b","observation_id":"c202ef84-78f1-4943-a2e3-11d1a0c9782e","resolution":{"observed_at":"2026-08-07T21:08:31.758685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:08:28.795653Z","title":"Mobile edge intelligence for large language models: A contemporary survey,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05926","last_updated":"2026-08-06T11:57:36Z","snapshot_observed_at":"2026-08-09T07:11:56.092791Z","submitted_at":"2026-08-06T11:57:36Z","title":"BALANCE: Hybrid Autoregressive-Speculative LLM Inference in Wireless Edge Networks","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T21:08:28.795653Z"},"links":{"citing_paper":"/paper/2608.05926"},"observation_digest":"sha256:6439b66a96947063597215c0d3adffa9af94b05078d270e50c1663ccc23c8f0a","observation_id":"d6c3391c-1730-4aa5-908c-a240e1b120bd","resolution":{"observed_at":"2026-08-07T21:08:28.795653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:08:31.732709Z","title":"QLLMS: Quantization-adaptive LLM scheduling for partially informed edge serving systems,","venue":null,"work_id":"c4077a40-e745-477e-94a1-9197cf7649f2","year":2025},"citing_paper":{"arxiv_id":"2608.05926","last_updated":"2026-08-06T11:57:36Z","snapshot_observed_at":"2026-08-09T07:11:56.092791Z","submitted_at":"2026-08-06T11:57:36Z","title":"BALANCE: Hybrid Autoregressive-Speculative LLM Inference in Wireless Edge Networks","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T21:08:28.885981Z"},"links":{"citing_paper":"/paper/2608.05926"},"observation_digest":"sha256:139001786b0c176b1a81bb9e42c9dee44a49449831a13ed779355977fd2e645d","observation_id":"13a10b5d-40b2-47ef-90fe-de6d2a5250d7","resolution":{"observed_at":"2026-08-07T21:08:31.738892Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:08:31.721012Z","title":"Edge-first language model inference: Models, metrics, and tradeoffs,","venue":null,"work_id":"3118d4ac-07c5-4ee5-8650-3abfb37d02fb","year":2025},"citing_paper":{"arxiv_id":"2608.05926","last_updated":"2026-08-06T11:57:36Z","snapshot_observed_at":"2026-08-09T07:11:56.092791Z","submitted_at":"2026-08-06T11:57:36Z","title":"BALANCE: Hybrid Autoregressive-Speculative LLM Inference in Wireless Edge Networks","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T21:08:28.949004Z"},"links":{"citing_paper":"/paper/2608.05926"},"observation_digest":"sha256:e2bcf1c9adc9f703d9c5d859d31abaeb9e6f7f9c2f69d882c1193ad042fab391","observation_id":"5a8c2aa9-c611-4ebf-a8d1-998cbf64e85f","resolution":{"observed_at":"2026-08-07T21:08:31.725473Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:08:31.709212Z","title":"Large language model partitioning for low-latency inference at the edge,","venue":null,"work_id":"c17d25af-84cf-48a6-b7d3-46628a2b53d5","year":2025},"citing_paper":{"arxiv_id":"2608.05926","last_updated":"2026-08-06T11:57:36Z","snapshot_observed_at":"2026-08-09T07:11:56.092791Z","submitted_at":"2026-08-06T11:57:36Z","title":"BALANCE: Hybrid Autoregressive-Speculative LLM Inference in Wireless Edge Networks","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T21:08:29.007436Z"},"links":{"citing_paper":"/paper/2608.05926"},"observation_digest":"sha256:ab25374545338de23a1cfcfdce51f55a8900501a4a127c28decd9f7d055ba8bc","observation_id":"cd1f003d-cd3c-44cf-8a2e-affafaac8752","resolution":{"observed_at":"2026-08-07T21:08:31.713787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:08:31.698738Z","title":"Taming throughput-latency tradeoff in LLM inference with sarathi-serve,","venue":null,"work_id":"c8505656-1189-4bb8-a863-869e2da8a6c6","year":2024},"citing_paper":{"arxiv_id":"2608.05926","last_updated":"2026-08-06T11:57:36Z","snapshot_observed_at":"2026-08-09T07:11:56.092791Z","submitted_at":"2026-08-06T11:57:36Z","title":"BALANCE: Hybrid Autoregressive-Speculative LLM Inference in Wireless Edge Networks","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T21:08:29.063572Z"},"links":{"citing_paper":"/paper/2608.05926"},"observation_digest":"sha256:e56e79f076bde0a042c0e4dc503b58d571426a176a544e66eb12011da7f7c761","observation_id":"4999c787-a28b-4856-8ecc-af4023438ea7","resolution":{"observed_at":"2026-08-07T21:08:31.702428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:08:31.688388Z","title":"Attention is all you need,","venue":null,"work_id":"6a994fa3-d350-4723-ade1-c87a7da8445a","year":2017},"citing_paper":{"arxiv_id":"2608.05926","last_updated":"2026-08-06T11:57:36Z","snapshot_observed_at":"2026-08-09T07:11:56.092791Z","submitted_at":"2026-08-06T11:57:36Z","title":"BALANCE: Hybrid Autoregressive-Speculative LLM Inference in Wireless Edge Networks","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T21:08:29.098892Z"},"links":{"citing_paper":"/paper/2608.05926"},"observation_digest":"sha256:1725753bd7a442fb21a1890acbfcfd0fc494ba6724d01ff9d3094634e4c53b4d","observation_id":"971b823c-a4ed-4ebd-9550-78d6288f56a3","resolution":{"observed_at":"2026-08-07T21:08:31.692096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:08:31.678414Z","title":"FFN-SkipLLM: A hidden gem for autoregressive decoding with adap- tive feed forward skipping,","venue":null,"work_id":"39ac1982-a7b5-43fe-ac1c-b227d13d2071","year":2024},"citing_paper":{"arxiv_id":"2608.05926","last_updated":"2026-08-06T11:57:36Z","snapshot_observed_at":"2026-08-09T07:11:56.092791Z","submitted_at":"2026-08-06T11:57:36Z","title":"BALANCE: Hybrid Autoregressive-Speculative LLM Inference in Wireless Edge Networks","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T21:08:29.104186Z"},"links":{"citing_paper":"/paper/2608.05926"},"observation_digest":"sha256:ac2ce56975ef1ab8d734570882f7772d3d725846fdf638a9a23e3f529408a8b4","observation_id":"ad6a93fb-e0fc-479f-b5d2-4756cc183b94","resolution":{"observed_at":"2026-08-07T21:08:31.681807Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:08:31.534974Z","title":"Unlocking efficiency in large language model inference: A comprehensive survey of speculative decoding,","venue":null,"work_id":"8b2eae4c-ae46-486c-ae56-0711bdbbc795","year":2024},"citing_paper":{"arxiv_id":"2608.05926","last_updated":"2026-08-06T11:57:36Z","snapshot_observed_at":"2026-08-09T07:11:56.092791Z","submitted_at":"2026-08-06T11:57:36Z","title":"BALANCE: Hybrid Autoregressive-Speculative LLM Inference in Wireless Edge Networks","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T21:08:29.108485Z"},"links":{"citing_paper":"/paper/2608.05926"},"observation_digest":"sha256:fc8c410eee26bfeb8b7d396728bc6af4ddef22d6814f5ff0ef6555bef163b931","observation_id":"8d1d594a-a920-4824-8d9d-10610310cbf4","resolution":{"observed_at":"2026-08-07T21:08:31.605619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:08:31.376996Z","title":"A theoretical perspective for speculative decoding algorithm,","venue":null,"work_id":"f1c7bf97-4906-4421-a94b-f99cf8795ea3","year":2024},"citing_paper":{"arxiv_id":"2608.05926","last_updated":"2026-08-06T11:57:36Z","snapshot_observed_at":"2026-08-09T07:11:56.092791Z","submitted_at":"2026-08-06T11:57:36Z","title":"BALANCE: Hybrid Autoregressive-Speculative LLM Inference in Wireless Edge Networks","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T21:08:29.112636Z"},"links":{"citing_paper":"/paper/2608.05926"},"observation_digest":"sha256:f28249250a2d24e3ab5083ed952c964aeb7fe3b1058789272a365829653a3e11","observation_id":"ecf288db-331f-471f-b50d-a58bd58f8eb1","resolution":{"observed_at":"2026-08-07T21:08:31.426342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:08:31.171375Z","title":"Decoding speculative decoding,","venue":null,"work_id":"18cbef4a-c4f0-45d4-9f27-b30e115866b0","year":2025},"citing_paper":{"arxiv_id":"2608.05926","last_updated":"2026-08-06T11:57:36Z","snapshot_observed_at":"2026-08-09T07:11:56.092791Z","submitted_at":"2026-08-06T11:57:36Z","title":"BALANCE: Hybrid Autoregressive-Speculative LLM Inference in Wireless Edge Networks","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T21:08:29.116225Z"},"links":{"citing_paper":"/paper/2608.05926"},"observation_digest":"sha256:9bc0a94b972fb9908cfdca41c7d823d265b4d088c6bf4f7aeb5023e6a5b48f46","observation_id":"1d86221b-1984-44a9-a752-9fe10e00eda3","resolution":{"observed_at":"2026-08-07T21:08:31.254424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:08:31.083832Z","title":"SpecExec: Massively parallel speculative decoding for interactive LLM inference on consumer devices,","venue":null,"work_id":"3a18793f-c7fc-4087-a5a9-fcf71b1535f8","year":2024},"citing_paper":{"arxiv_id":"2608.05926","last_updated":"2026-08-06T11:57:36Z","snapshot_observed_at":"2026-08-09T07:11:56.092791Z","submitted_at":"2026-08-06T11:57:36Z","title":"BALANCE: Hybrid Autoregressive-Speculative LLM Inference in Wireless Edge Networks","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T21:08:29.120207Z"},"links":{"citing_paper":"/paper/2608.05926"},"observation_digest":"sha256:016bd3aef7b82304f7ca1ea44121b847877a7a5ffba43c02c82cf7b148c50caf","observation_id":"0a891704-32d6-41f2-be5c-f64955cfa642","resolution":{"observed_at":"2026-08-07T21:08:31.088489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:08:31.072752Z","title":"QuantSpec: Self-speculative decoding with hierarchical quantized KV cache,","venue":null,"work_id":"641d1536-9daa-49c5-a49d-4a8988329b0d","year":2025},"citing_paper":{"arxiv_id":"2608.05926","last_updated":"2026-08-06T11:57:36Z","snapshot_observed_at":"2026-08-09T07:11:56.092791Z","submitted_at":"2026-08-06T11:57:36Z","title":"BALANCE: Hybrid Autoregressive-Speculative LLM Inference in Wireless Edge Networks","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T21:08:29.124398Z"},"links":{"citing_paper":"/paper/2608.05926"},"observation_digest":"sha256:c46db794939d921d856a46923f74b3f8e0c3bbecae008ade7fd91df2b6a59892","observation_id":"2f22cde4-9768-4b03-bbce-2dfe8496cde1","resolution":{"observed_at":"2026-08-07T21:08:31.076711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:08:31.061134Z","title":"Draft & verify: Lossless large language model acceleration via self- speculative decoding,","venue":null,"work_id":"16c5d88d-7100-4a7d-b664-37c21889740d","year":2024},"citing_paper":{"arxiv_id":"2608.05926","last_updated":"2026-08-06T11:57:36Z","snapshot_observed_at":"2026-08-09T07:11:56.092791Z","submitted_at":"2026-08-06T11:57:36Z","title":"BALANCE: Hybrid Autoregressive-Speculative LLM Inference in Wireless Edge Networks","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T21:08:29.128476Z"},"links":{"citing_paper":"/paper/2608.05926"},"observation_digest":"sha256:5dff5cbbe5a88566303724fe83d868364b755062bf95f42114de251ce02822af","observation_id":"2f627ff2-c25d-4bf5-9c61-f84244227c57","resolution":{"observed_at":"2026-08-07T21:08:31.065507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:08:31.049391Z","title":"SWIFT: On-the-fly self- speculative decoding for LLM inference acceleration,","venue":null,"work_id":"d00c1c91-f03b-4c12-94b0-928429f1982e","year":2025},"citing_paper":{"arxiv_id":"2608.05926","last_updated":"2026-08-06T11:57:36Z","snapshot_observed_at":"2026-08-09T07:11:56.092791Z","submitted_at":"2026-08-06T11:57:36Z","title":"BALANCE: Hybrid Autoregressive-Speculative LLM Inference in Wireless Edge Networks","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T21:08:29.131973Z"},"links":{"citing_paper":"/paper/2608.05926"},"observation_digest":"sha256:98b9e90eaffef5ebd7f381b145462441fb4d0eca7e0925cf66b052f29d71748b","observation_id":"b0a088f0-c9ba-4b7e-9bd8-d0908ef97809","resolution":{"observed_at":"2026-08-07T21:08:31.052967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:08:31.038457Z","title":"Edge inference for large language models with pipeline parallelism and batching,","venue":null,"work_id":"cf3058f0-8728-4ed4-9176-1b9c2cc96701","year":2026},"citing_paper":{"arxiv_id":"2608.05926","last_updated":"2026-08-06T11:57:36Z","snapshot_observed_at":"2026-08-09T07:11:56.092791Z","submitted_at":"2026-08-06T11:57:36Z","title":"BALANCE: Hybrid Autoregressive-Speculative LLM Inference in Wireless Edge Networks","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T21:08:29.135978Z"},"links":{"citing_paper":"/paper/2608.05926"},"observation_digest":"sha256:ddaf98760e3d9a3e1dbbaa0dccd0e81e1c77b1c143a5cd04787b151eb4e5fe11","observation_id":"fef51e62-a032-4e9e-ba78-f8b0fd24be31","resolution":{"observed_at":"2026-08-07T21:08:31.042137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:08:31.026560Z","title":"Beyond the cloud: Edge inference for generative large language models in wireless networks,","venue":null,"work_id":"22c555eb-d19a-4bcc-a7f0-f8a238c3778e","year":2025},"citing_paper":{"arxiv_id":"2608.05926","last_updated":"2026-08-06T11:57:36Z","snapshot_observed_at":"2026-08-09T07:11:56.092791Z","submitted_at":"2026-08-06T11:57:36Z","title":"BALANCE: Hybrid Autoregressive-Speculative LLM Inference in Wireless Edge Networks","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T21:08:29.141637Z"},"links":{"citing_paper":"/paper/2608.05926"},"observation_digest":"sha256:0da4923121a8c91f43337ee2dd1f3424ba1e41d6e66733da024d668284ff93a8","observation_id":"c0f52df3-d546-4693-b3f5-a4abe2801dbd","resolution":{"observed_at":"2026-08-07T21:08:31.030415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:08:31.013357Z","title":"Resource allocation in large language model integrated 6G vehicular networks,","venue":null,"work_id":"d8197d24-a296-42b1-b2ef-b69ede7d62a5","year":2024},"citing_paper":{"arxiv_id":"2608.05926","last_updated":"2026-08-06T11:57:36Z","snapshot_observed_at":"2026-08-09T07:11:56.092791Z","submitted_at":"2026-08-06T11:57:36Z","title":"BALANCE: Hybrid Autoregressive-Speculative LLM Inference in Wireless Edge Networks","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T21:08:29.149099Z"},"links":{"citing_paper":"/paper/2608.05926"},"observation_digest":"sha256:606503aaeadd15cfdbba296b6d7815ce490c7d39e16cbcb872e27f882be8792b","observation_id":"a776d1f0-696e-46b3-b67d-02d3cd7f8e6d","resolution":{"observed_at":"2026-08-07T21:08:31.017703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:08:30.973895Z","title":"Communication- efficient distributed on-device LLM inference over wireless networks,","venue":null,"work_id":"c4714d26-5723-4007-af9a-8a656cf582aa","year":2025},"citing_paper":{"arxiv_id":"2608.05926","last_updated":"2026-08-06T11:57:36Z","snapshot_observed_at":"2026-08-09T07:11:56.092791Z","submitted_at":"2026-08-06T11:57:36Z","title":"BALANCE: Hybrid Autoregressive-Speculative LLM Inference in Wireless Edge Networks","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T21:08:29.153372Z"},"links":{"citing_paper":"/paper/2608.05926"},"observation_digest":"sha256:3a858bace9a8a20c301e1f0dc0ec5760f8883bcdf195a03f86372fed85ab8373","observation_id":"bfaf85cd-bd5a-4d07-9531-9cba43f57d18","resolution":{"observed_at":"2026-08-07T21:08:31.002970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:08:29.157535Z","title":"Efficient LLM inference over heterogeneous edge networks with speculative decoding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05926","last_updated":"2026-08-06T11:57:36Z","snapshot_observed_at":"2026-08-09T07:11:56.092791Z","submitted_at":"2026-08-06T11:57:36Z","title":"BALANCE: Hybrid Autoregressive-Speculative LLM Inference in Wireless Edge Networks","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T21:08:29.157535Z"},"links":{"citing_paper":"/paper/2608.05926"},"observation_digest":"sha256:52a927bd92eccdd91e0c7fd36198b8a6dea0c6baa2ec421c78eef9f6272903eb","observation_id":"fdb8c11f-99d6-4ed6-a2c1-61e9763ded5f","resolution":{"observed_at":"2026-08-07T21:08:29.157535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.20919","last_updated":"2026-04-22T04:02:13Z","snapshot_observed_at":"2026-08-02T05:44:41.311612Z","submitted_at":"2026-04-22T04:02:13Z","title":"DiP-SD: Distributed Pipelined Speculative Decoding for Efficient LLM Inference at the Edge","version":1},"cited_work":{"arxiv_id":"2604.20919","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.20919","snapshot_observed_at":"2026-08-07T21:08:29.552605Z","title":"DiP-SD: Distributed Pipelined Speculative Decoding for Efficient LLM Inference at the Edge","venue":"cs.IT","work_id":"cf8c1048-77a4-4797-96ce-a49cac3825b5","year":2026},"citing_paper":{"arxiv_id":"2608.05926","last_updated":"2026-08-06T11:57:36Z","snapshot_observed_at":"2026-08-09T07:11:56.092791Z","submitted_at":"2026-08-06T11:57:36Z","title":"BALANCE: Hybrid Autoregressive-Speculative LLM Inference in Wireless Edge Networks","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T21:08:29.166612Z"},"links":{"cited_paper":"/paper/2604.20919","citing_paper":"/paper/2608.05926"},"observation_digest":"sha256:2569dca2bacf8ca89b08a9682f8a6e1c1ea1406c7a1d637d5aef478ab9b2e1f4","observation_id":"5e869023-8674-42ad-82c1-70f9401efec0","resolution":{"observed_at":"2026-08-07T21:08:29.622307Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:08:30.455278Z","title":"SLED: A speculative LLM decoding framework for efficient edge serving,","venue":null,"work_id":"9e45a451-840c-42fe-a19e-2fe09878272b","year":2025},"citing_paper":{"arxiv_id":"2608.05926","last_updated":"2026-08-06T11:57:36Z","snapshot_observed_at":"2026-08-09T07:11:56.092791Z","submitted_at":"2026-08-06T11:57:36Z","title":"BALANCE: Hybrid Autoregressive-Speculative LLM Inference in Wireless Edge Networks","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T21:08:29.210427Z"},"links":{"citing_paper":"/paper/2608.05926"},"observation_digest":"sha256:1c48514fb6451e8e196a72086a32913a278553ef6486dc1091e11633c5455618","observation_id":"29a1d9fe-8c02-4aad-b515-66088ad6d2b3","resolution":{"observed_at":"2026-08-07T21:08:30.738637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:08:30.280730Z","title":"OPT-tree: Speculative decoding with adaptive draft tree structure,","venue":null,"work_id":"8c8a5d60-08e8-4d9f-8b3e-6c9a14a6ae9f","year":2025},"citing_paper":{"arxiv_id":"2608.05926","last_updated":"2026-08-06T11:57:36Z","snapshot_observed_at":"2026-08-09T07:11:56.092791Z","submitted_at":"2026-08-06T11:57:36Z","title":"BALANCE: Hybrid Autoregressive-Speculative LLM Inference in Wireless Edge Networks","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T21:08:29.214342Z"},"links":{"citing_paper":"/paper/2608.05926"},"observation_digest":"sha256:608bb81de29d08395aa99a7ef9a50a75d9ac65011fa6dd069a5904644b9f4144","observation_id":"23faed8f-64be-4649-8f59-613d9a2cba5e","resolution":{"observed_at":"2026-08-07T21:08:30.362101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:08:30.269194Z","title":"PEARL: Parallel speculative decoding with adaptive draft length,","venue":null,"work_id":"c4e6da2c-8733-42e5-835e-be4553bdb55d","year":2025},"citing_paper":{"arxiv_id":"2608.05926","last_updated":"2026-08-06T11:57:36Z","snapshot_observed_at":"2026-08-09T07:11:56.092791Z","submitted_at":"2026-08-06T11:57:36Z","title":"BALANCE: Hybrid Autoregressive-Speculative LLM Inference in Wireless Edge Networks","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T21:08:29.218303Z"},"links":{"citing_paper":"/paper/2608.05926"},"observation_digest":"sha256:b580f561a04cd2e18ef5b5e7696d6d6bb69eb3d2b315284d86f06a72587e2927","observation_id":"f309469c-702e-46f2-b5ba-071f3bc3ce91","resolution":{"observed_at":"2026-08-07T21:08:30.273514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:08:30.255616Z","title":"Think fast, infer smart: A hybrid distributed LLMs inference at the wireless edge,","venue":null,"work_id":"b1fc98fc-3383-4bd0-ab29-920739f5f16b","year":2025},"citing_paper":{"arxiv_id":"2608.05926","last_updated":"2026-08-06T11:57:36Z","snapshot_observed_at":"2026-08-09T07:11:56.092791Z","submitted_at":"2026-08-06T11:57:36Z","title":"BALANCE: Hybrid Autoregressive-Speculative LLM Inference in Wireless Edge Networks","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T21:08:29.221924Z"},"links":{"citing_paper":"/paper/2608.05926"},"observation_digest":"sha256:e9537dbcd08a63cc3ff66e440ed5b6487331fcd2b9bfb723f060e625e8a551ed","observation_id":"ad212f60-cfbb-42e4-acc2-f4e81e6c680d","resolution":{"observed_at":"2026-08-07T21:08:30.259737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:08:30.243704Z","title":"Hybrid LLM: Cost-efficient and quality-aware query routing,","venue":null,"work_id":"a8c021e0-2bad-4b5c-8372-4fd5b0cdcaa8","year":2024},"citing_paper":{"arxiv_id":"2608.05926","last_updated":"2026-08-06T11:57:36Z","snapshot_observed_at":"2026-08-09T07:11:56.092791Z","submitted_at":"2026-08-06T11:57:36Z","title":"BALANCE: Hybrid Autoregressive-Speculative LLM Inference in Wireless Edge Networks","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T21:08:29.225068Z"},"links":{"citing_paper":"/paper/2608.05926"},"observation_digest":"sha256:a01fa37946bb40b262daa3cf05845bd493726b2810430aca169c1d13cd671651","observation_id":"a38dc186-7ffc-4731-8ec5-923370845313","resolution":{"observed_at":"2026-08-07T21:08:30.248779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:08:30.229742Z","title":"Communication-efficient hybrid language model via uncertainty-aware opportunistic and compressed transmission,","venue":null,"work_id":"3559eb8e-ce84-48a4-828a-6c2c5928b5fe","year":2026},"citing_paper":{"arxiv_id":"2608.05926","last_updated":"2026-08-06T11:57:36Z","snapshot_observed_at":"2026-08-09T07:11:56.092791Z","submitted_at":"2026-08-06T11:57:36Z","title":"BALANCE: Hybrid Autoregressive-Speculative LLM Inference in Wireless Edge Networks","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T21:08:29.229836Z"},"links":{"citing_paper":"/paper/2608.05926"},"observation_digest":"sha256:c35c81b954bf97e9b93dba73bad0d1e725b04740feab5d6b4a160a7b746d73a6","observation_id":"b5efa405-d9ae-48bf-8553-39b6d315ee1c","resolution":{"observed_at":"2026-08-07T21:08:30.235018Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06282","last_updated":"2025-02-10T09:24:06Z","snapshot_observed_at":"2026-08-08T15:54:54.027148Z","submitted_at":"2025-02-10T09:24:06Z","title":"Jakiro: Boosting Speculative Decoding with Decoupled Multi-Head via MoE","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06282","snapshot_observed_at":"2026-08-07T21:08:29.233848Z","title":"Jakiro: Boosting speculative decoding with decoupled multi-head via MoE,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05926","last_updated":"2026-08-06T11:57:36Z","snapshot_observed_at":"2026-08-09T07:11:56.092791Z","submitted_at":"2026-08-06T11:57:36Z","title":"BALANCE: Hybrid Autoregressive-Speculative LLM Inference in Wireless Edge Networks","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T21:08:29.233848Z"},"links":{"cited_paper":"/paper/2502.06282","citing_paper":"/paper/2608.05926"},"observation_digest":"sha256:2330a97dc596e301013b6e145b9c16c596f6c6b3f9b86d74d2ef1836d64ce699","observation_id":"65d5aa5c-6c44-4655-8b74-163e69737c36","resolution":{"observed_at":"2026-08-07T21:08:29.233848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:08:29.289489Z","title":"When, what, and how: Rethinking retrieval-enhanced speculative decoding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05926","last_updated":"2026-08-06T11:57:36Z","snapshot_observed_at":"2026-08-09T07:11:56.092791Z","submitted_at":"2026-08-06T11:57:36Z","title":"BALANCE: Hybrid Autoregressive-Speculative LLM Inference in Wireless Edge Networks","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T21:08:29.289489Z"},"links":{"citing_paper":"/paper/2608.05926"},"observation_digest":"sha256:2c03aec8454ca1877e92b385ed6c5b68b0851632ad13c8bd8757cdf461efdf8b","observation_id":"7e9d7529-2100-453c-add3-687ddc8c4b5d","resolution":{"observed_at":"2026-08-07T21:08:29.289489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:08:30.210339Z","title":"ExeGPT: Constraint-aware resource scheduling for LLM inference,","venue":null,"work_id":"79d3ba9d-2547-473c-94ae-8a2a8f47f083","year":2024},"citing_paper":{"arxiv_id":"2608.05926","last_updated":"2026-08-06T11:57:36Z","snapshot_observed_at":"2026-08-09T07:11:56.092791Z","submitted_at":"2026-08-06T11:57:36Z","title":"BALANCE: Hybrid Autoregressive-Speculative LLM Inference in Wireless Edge Networks","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T21:08:29.314663Z"},"links":{"citing_paper":"/paper/2608.05926"},"observation_digest":"sha256:bd15d06641cfee62d26cba0feeebb79ed86e4c5903fabe518ef8fbbd58b1e2f6","observation_id":"d0efae99-d930-4d07-88cd-c817724b4999","resolution":{"observed_at":"2026-08-07T21:08:30.215195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:08:30.190493Z","title":"Efficient interactive LLM serving with proxy model-based sequence length prediction,","venue":null,"work_id":"32d0a28f-9923-45b6-9b90-a07dc1d0f351","year":2024},"citing_paper":{"arxiv_id":"2608.05926","last_updated":"2026-08-06T11:57:36Z","snapshot_observed_at":"2026-08-09T07:11:56.092791Z","submitted_at":"2026-08-06T11:57:36Z","title":"BALANCE: Hybrid Autoregressive-Speculative LLM Inference in Wireless Edge Networks","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T21:08:29.318182Z"},"links":{"citing_paper":"/paper/2608.05926"},"observation_digest":"sha256:fd15dbca2a43ee5a04975412e440e1767b8827fbc0f6754b2dfa037ed140c186","observation_id":"83ab9c14-685b-4568-89ef-0129fb92b1a9","resolution":{"observed_at":"2026-08-07T21:08:30.196856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:08:30.178169Z","title":"Past-future scheduler for LLM serving under SLA guarantees,","venue":null,"work_id":"38a49a6c-5901-4217-b9f2-ba10accc9f2d","year":2025},"citing_paper":{"arxiv_id":"2608.05926","last_updated":"2026-08-06T11:57:36Z","snapshot_observed_at":"2026-08-09T07:11:56.092791Z","submitted_at":"2026-08-06T11:57:36Z","title":"BALANCE: Hybrid Autoregressive-Speculative LLM Inference in Wireless Edge Networks","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T21:08:29.321631Z"},"links":{"citing_paper":"/paper/2608.05926"},"observation_digest":"sha256:85bb1ceaa9ac2a1462ab3d7241f7b6261bec4c0af18c0a0c50138fad9a2ca1f4","observation_id":"cafb86ba-eae3-47cb-b39a-031d5d340bbe","resolution":{"observed_at":"2026-08-07T21:08:30.182107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:08:30.165373Z","title":"Orca: A distributed serving system for{Transformer-Based}generative models,","venue":null,"work_id":"66dbfa00-bc63-4d6a-bbaa-57e333cf9875","year":2022},"citing_paper":{"arxiv_id":"2608.05926","last_updated":"2026-08-06T11:57:36Z","snapshot_observed_at":"2026-08-09T07:11:56.092791Z","submitted_at":"2026-08-06T11:57:36Z","title":"BALANCE: Hybrid Autoregressive-Speculative LLM Inference in Wireless Edge Networks","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T21:08:29.325121Z"},"links":{"citing_paper":"/paper/2608.05926"},"observation_digest":"sha256:9d759cd6f78298651ee17437857960e42c5d736a580d1dd5f9d7885d49b0109e","observation_id":"b7dfc47a-5365-4998-b3a3-df0d4c33f36f","resolution":{"observed_at":"2026-08-07T21:08:30.169739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:08:30.106974Z","title":"ColBERT: Efficient and effective passage search via contextualized late interaction over BERT,","venue":null,"work_id":"d8c1ff10-f538-45b8-aa3a-daca4ae6a9a3","year":2020},"citing_paper":{"arxiv_id":"2608.05926","last_updated":"2026-08-06T11:57:36Z","snapshot_observed_at":"2026-08-09T07:11:56.092791Z","submitted_at":"2026-08-06T11:57:36Z","title":"BALANCE: Hybrid Autoregressive-Speculative LLM Inference in Wireless Edge Networks","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T21:08:29.328584Z"},"links":{"citing_paper":"/paper/2608.05926"},"observation_digest":"sha256:42caa4e0a29c1cd9c71025d1844f4bd2339de68b51eaf2a36b4fe5f4c38ea27a","observation_id":"4a4aa75f-4553-4e0e-9315-0d1f0d0db32d","resolution":{"observed_at":"2026-08-07T21:08:30.157573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:08:29.915130Z","title":"Reference API","venue":null,"work_id":"bde6a770-e4f2-4e47-ba59-4cda0343c0a9","year":null},"citing_paper":{"arxiv_id":"2608.05926","last_updated":"2026-08-06T11:57:36Z","snapshot_observed_at":"2026-08-09T07:11:56.092791Z","submitted_at":"2026-08-06T11:57:36Z","title":"BALANCE: Hybrid Autoregressive-Speculative LLM Inference in Wireless Edge Networks","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T21:08:29.332049Z"},"links":{"citing_paper":"/paper/2608.05926"},"observation_digest":"sha256:c69421fa7ee04d6b280c3378f3c529f246e09aa4c3fe43bc00ff19a6f2b51a0c","observation_id":"762ff0ba-3ecb-4071-a3ec-1fa10c38d1f1","resolution":{"observed_at":"2026-08-07T21:08:30.015890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:08:29.840097Z","title":"FlexGen: High-throughput generative inference of large language models with a single GPU,","venue":null,"work_id":"ccd669cc-f5ae-47ba-a2ff-ce4f79bbf520","year":2023},"citing_paper":{"arxiv_id":"2608.05926","last_updated":"2026-08-06T11:57:36Z","snapshot_observed_at":"2026-08-09T07:11:56.092791Z","submitted_at":"2026-08-06T11:57:36Z","title":"BALANCE: Hybrid Autoregressive-Speculative LLM Inference in Wireless Edge Networks","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T21:08:29.338097Z"},"links":{"citing_paper":"/paper/2608.05926"},"observation_digest":"sha256:ee78d5c461700fa5cabf019f186e83ee9e60b2773d02604767c85f9b7e451037","observation_id":"7f6b3f8f-684b-4884-b6c3-9697451d062d","resolution":{"observed_at":"2026-08-07T21:08:29.844275Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:08:29.827986Z","title":"NVIDIA multi-instance GPU user guide release r580,","venue":null,"work_id":"9a2981d6-b9a3-40c7-86f8-5bd1d6d2e165","year":null},"citing_paper":{"arxiv_id":"2608.05926","last_updated":"2026-08-06T11:57:36Z","snapshot_observed_at":"2026-08-09T07:11:56.092791Z","submitted_at":"2026-08-06T11:57:36Z","title":"BALANCE: Hybrid Autoregressive-Speculative LLM Inference in Wireless Edge Networks","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T21:08:29.341739Z"},"links":{"citing_paper":"/paper/2608.05926"},"observation_digest":"sha256:b58f441c59514260b10b28369a513ad6f10411f96c6c25fc938b068b631ed074","observation_id":"e42b014f-0455-4f9f-9b86-c226b759e749","resolution":{"observed_at":"2026-08-07T21:08:29.832168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:08:29.349710Z","title":"iGniter: Interference-aware GPU resource provisioning for predictable DNN inference in the cloud,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05926","last_updated":"2026-08-06T11:57:36Z","snapshot_observed_at":"2026-08-09T07:11:56.092791Z","submitted_at":"2026-08-06T11:57:36Z","title":"BALANCE: Hybrid Autoregressive-Speculative LLM Inference in Wireless Edge Networks","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T21:08:29.349710Z"},"links":{"citing_paper":"/paper/2608.05926"},"observation_digest":"sha256:ed343243949d02d60fecc32fda7d3b0efd9695e86c8021cea618c280e088918f","observation_id":"05887f2f-7741-45dc-a7ca-2b527abea792","resolution":{"observed_at":"2026-08-07T21:08:29.349710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:08:29.353171Z","title":"Multiuser co- inference with batch processing capable edge server,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05926","last_updated":"2026-08-06T11:57:36Z","snapshot_observed_at":"2026-08-09T07:11:56.092791Z","submitted_at":"2026-08-06T11:57:36Z","title":"BALANCE: Hybrid Autoregressive-Speculative LLM Inference in Wireless Edge Networks","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T21:08:29.353171Z"},"links":{"citing_paper":"/paper/2608.05926"},"observation_digest":"sha256:d7dc1a0054f735d370e8d516e69f1545a362a2321ff4fbfeeffc9c4cd755b371","observation_id":"0d8f6ebe-c30e-4524-93a8-11c4046618ea","resolution":{"observed_at":"2026-08-07T21:08:29.353171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:08:29.788950Z","title":"A fast and scal- able multidimensional multiple-choice knapsack heuristic,","venue":null,"work_id":"6924b760-8aa2-4660-a55c-7bb1c1af8c55","year":2013},"citing_paper":{"arxiv_id":"2608.05926","last_updated":"2026-08-06T11:57:36Z","snapshot_observed_at":"2026-08-09T07:11:56.092791Z","submitted_at":"2026-08-06T11:57:36Z","title":"BALANCE: Hybrid Autoregressive-Speculative LLM Inference in Wireless Edge Networks","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T21:08:29.356251Z"},"links":{"citing_paper":"/paper/2608.05926"},"observation_digest":"sha256:57a3d8dc36d31d1abdf347a66f6bc802ee813e3e9a375f3a5cf4636a6b87552a","observation_id":"e248ce9e-28ff-4585-8a40-67381b635403","resolution":{"observed_at":"2026-08-07T21:08:29.793311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:08:29.776978Z","title":"Heuristic algorithms for the multiple-choice multidimensional knapsack problem,","venue":null,"work_id":"5d46fa3b-5019-45b8-bb49-74376e8f7644","year":2004},"citing_paper":{"arxiv_id":"2608.05926","last_updated":"2026-08-06T11:57:36Z","snapshot_observed_at":"2026-08-09T07:11:56.092791Z","submitted_at":"2026-08-06T11:57:36Z","title":"BALANCE: Hybrid Autoregressive-Speculative LLM Inference in Wireless Edge Networks","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T21:08:29.373276Z"},"links":{"citing_paper":"/paper/2608.05926"},"observation_digest":"sha256:c9f4f0464b177f912993d034bcd7a7de447c8210224fd0441afe37f717242abd","observation_id":"a201f439-1ead-4958-9d96-5ad738dc8e6d","resolution":{"observed_at":"2026-08-07T21:08:29.781164Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:08:29.814940Z","title":"Available: https://docs.nvidia.com/datacenter/tesla/pdf/ MIG User Guide.pdf","venue":null,"work_id":"0e43a3b0-88b1-4a33-9abb-c1759638c1ca","year":null},"citing_paper":{"arxiv_id":"2608.05926","last_updated":"2026-08-06T11:57:36Z","snapshot_observed_at":"2026-08-09T07:11:56.092791Z","submitted_at":"2026-08-06T11:57:36Z","title":"BALANCE: Hybrid Autoregressive-Speculative LLM Inference in Wireless Edge Networks","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T21:08:29.345773Z"},"links":{"citing_paper":"/paper/2608.05926"},"observation_digest":"sha256:fd299102f6cc553a7248b63a19760cd14587d3c8ae9f2c956c8bd370a2859932","observation_id":"ab4d71cd-9c34-466c-9a0f-11d0f1c4aced","resolution":{"observed_at":"2026-08-07T21:08:29.819444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.05926","last_updated":"2026-08-06T11:57:36Z","latest_version":1,"primary_category":"cs.NI","snapshot_observed_at":"2026-08-09T07:11:56.092791Z","submitted_at":"2026-08-06T11:57:36Z","title":"BALANCE: Hybrid Autoregressive-Speculative LLM Inference in Wireless Edge Networks"},"reference_resolution":{"displayed":42,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":6,"verified_exact":1,"verified_fuzzy":35},"total_outbound_references":42},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 42 of 42 outbound references and 0 inbound Pith citation observations for arXiv:2608.05926."}