{"as_of":"2026-08-09T14:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ac98e633f00569e294e0702d95fb95ed29d1ad6bae94c23f5ce1ea097f2618d7","coverage":[{"denominator":69,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":69,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T15:48:05.592441Z","state":"measured"},{"denominator":69,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":69,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.05303/citation-record","integrity":"/paper/2608.05303/integrity","json":"/paper/2608.05303/citation-record.json","paper":"/paper/2608.05303"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.12013","last_updated":"2024-10-15T19:22:27Z","snapshot_observed_at":"2026-07-06T19:34:10.252984Z","submitted_at":"2024-10-15T19:22:27Z","title":"MoE-Pruner: Pruning Mixture-of-Experts Large Language Model using the Hints from Its Router","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12013","snapshot_observed_at":"2026-08-08T15:48:05.370776Z","title":"MoE-Pruner: Pruning Mixture-of-Experts Large Language Model using the Hints from Its Router,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-09T14:10:22.469382Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.370776Z"},"links":{"cited_paper":"/paper/2410.12013","citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:dbe9f71a73f1c51ee9d9cfc7f0ae3b49b72ce4c7fda33049a784abaa8485bb69","observation_id":"ed695317-8d7c-41bc-837b-f2d21b5eca00","resolution":{"observed_at":"2026-08-08T15:48:05.370776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:48:07.698451Z","title":"EdgeMoE: Empowering Sparse Large Language Models on Mobile Devices,","venue":null,"work_id":"bc43a0a8-483d-4548-af4d-7940370f76fe","year":2025},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-09T14:10:22.469382Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.374909Z"},"links":{"citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:c185a62ae55b4fdf1aa5f3a5cbeb17490e337c8e752cca8ec805765b091b6876","observation_id":"f3f5d51a-8acc-4b44-ae49-dbfe0854c943","resolution":{"observed_at":"2026-08-08T15:48:07.701101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:48:07.690409Z","title":"SMoLPU: 122.1µJ/Token Sparse MoE- Based Speculative Decoding Language Processing Unit with Adaptive- Offload NPU-CIM Core,","venue":null,"work_id":"eb99a1d0-349e-4942-952e-6f0b36abbe3f","year":2026},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-09T14:10:22.469382Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.378530Z"},"links":{"citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:f84ae3d7d885fb6f36f4c344b047885be1b5914635aa14c8a018ceeb10061a77","observation_id":"ae263b66-9294-4466-8a4f-00936893b512","resolution":{"observed_at":"2026-08-08T15:48:07.693024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-08T15:48:05.381623Z","title":"GPT-4 Technical Report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-09T14:10:22.469382Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.381623Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:98d8d985d8134aa93a7e02715550bb72b54611387b19671698ffbaf4c13cf1b2","observation_id":"5b2ecdfb-c0dc-4ed0-a45a-9bcbf43469f4","resolution":{"observed_at":"2026-08-08T15:48:05.381623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-08T15:48:05.385130Z","title":"The Llama 3 Herd of Models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-09T14:10:22.469382Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.385130Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:c90ca494fa04b16382ceffd08f0466c5c38f2bfaea8a703873f00043a857dc1a","observation_id":"db22c0f0-b175-463e-9034-0cf8ee242061","resolution":{"observed_at":"2026-08-08T15:48:05.385130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-08T15:48:05.388512Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-09T14:10:22.469382Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.388512Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:6d27da38da1f31a2215a1b8f7f12b6d1aaea09179142e2404f388de4b37d46f6","observation_id":"051c5fe7-3177-483f-a8ef-098e51f1b1e2","resolution":{"observed_at":"2026-08-08T15:48:05.388512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:48:05.392025Z","title":"Squeezed atten- tion: Accelerating long context length llm inference,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-09T14:10:22.469382Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.392025Z"},"links":{"citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:90b1da8d82b96f298c192170987fa2b6dafad2eaf79a31786cb1fe2b8480c4a2","observation_id":"4e9b8a5e-85bd-4193-bf90-dce9372c11d4","resolution":{"observed_at":"2026-08-08T15:48:05.392025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:48:07.682727Z","title":"ALISA: Accelerating Large Language Model Inference via Sparsity-Aware KV Caching,","venue":null,"work_id":"b17b9e2c-257b-4c7b-b108-5c2b750b1323","year":2024},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-09T14:10:22.469382Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.394901Z"},"links":{"citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:f9dce4cc809cdc3bdb1c932047797b6bb8a7973ff3b88747b04228bea83eacfe","observation_id":"809ce551-d722-49fb-b103-277daee70d60","resolution":{"observed_at":"2026-08-08T15:48:07.685342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:48:07.673644Z","title":"23.7 BROCA: A 52.4-to-559.2mW Mobile Social Agent System-on-Chip with Adaptive Bit-Truncate Unit and Acoustic-Cluster Bit Grouping,","venue":null,"work_id":"2f2f123c-17f8-4d6e-a309-39f10cb140bb","year":2025},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-09T14:10:22.469382Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.398249Z"},"links":{"citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:27a702dbff7bf24ea1bb6bd3fb7c750fab03af2ed4945c1e24d1a4248848a461","observation_id":"ac65b07a-5a20-485d-aca6-501ffe8b44d5","resolution":{"observed_at":"2026-08-08T15:48:07.676879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:48:07.664121Z","title":"Fast on-device LLM inference with npus,","venue":null,"work_id":"75e3fe20-c2d8-4b6c-b490-7246ae85a6c8","year":2025},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-09T14:10:22.469382Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.401099Z"},"links":{"citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:88a838836440150221f9d09ec236dad06858ab36de8f6837f15f59e62f187388","observation_id":"ba28f471-836c-4fd3-a67c-ef42ce85d1c0","resolution":{"observed_at":"2026-08-08T15:48:07.667360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:48:07.654827Z","title":"C-Transformer: An Energy-Efficient Homogeneous DNN- Transformer/SNN-Transformer Processor for Large Language Models,","venue":null,"work_id":"542ab405-6ae4-451c-9ebc-0aa891bf381a","year":2025},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-09T14:10:22.469382Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.404815Z"},"links":{"citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:1250af81df3de75d5a06d82237fa89e389005e188c0cda4c66355501df9cea59","observation_id":"511be75b-39ab-4849-b3e2-28be5a08d4d8","resolution":{"observed_at":"2026-08-08T15:48:07.658221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:48:07.645240Z","title":"MECLA: Memory-Compute-Efficient LLM Accelerator with Scaling Sub-matrix Partition,","venue":null,"work_id":"522f1871-c024-4d23-9960-d313fa8e2b69","year":2024},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-09T14:10:22.469382Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.407945Z"},"links":{"citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:3170cf10eca8233cbd661d65655ad63fa00ff0e37745c0bc7424ee654d8778eb","observation_id":"c4fb3c66-d9e3-42e2-8ef6-7be519996abf","resolution":{"observed_at":"2026-08-08T15:48:07.648874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:48:07.636362Z","title":"Granite 3.0 Language Models,","venue":null,"work_id":"7ce45ba4-881b-40ac-bdd8-23bf1a1924c1","year":null},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-09T14:10:22.469382Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.411220Z"},"links":{"citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:30367c271648334f5eba9eeb6ad6e57c8821cd25a14b862d60dfa601b50d70e6","observation_id":"1838530b-5a93-4da0-8371-ce4af794968f","resolution":{"observed_at":"2026-08-08T15:48:07.639501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-08T15:48:05.417780Z","title":"Qwen3 technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-09T14:10:22.469382Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.417780Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:8603680d5539d5da5c5e5ac4351fcb0c8ce02487780a6609f0a7f90f51826d03","observation_id":"4abd0f5e-0d08-47be-a10b-d0e55a78211a","resolution":{"observed_at":"2026-08-08T15:48:05.417780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06066","last_updated":"2024-01-11T17:31:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-11T17:31:42Z","title":"DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture-of-Experts Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06066","snapshot_observed_at":"2026-08-08T15:48:05.420966Z","title":"DeepSeekMoE: Towards ultimate expert spe- cialization in mixture-of-experts language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-09T14:10:22.469382Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.420966Z"},"links":{"cited_paper":"/paper/2401.06066","citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:69b43eceabe379a437e63da3202f28a20f6f2b22bb76019f8496d1dbd08264bf","observation_id":"a5d2494a-4a8b-45d7-94f5-a145dd962520","resolution":{"observed_at":"2026-08-08T15:48:05.420966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:48:07.618403Z","title":"GlaM: Efficient scaling of language models with mixture-of-experts,","venue":null,"work_id":"16d49216-0b14-4661-b013-c70db6138f2f","year":2022},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-09T14:10:22.469382Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.424336Z"},"links":{"citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:362cdd229d99400f90b8f821255a0c76d475463c58f77ce9a21d46faf3696067","observation_id":"b6b9e935-9268-43a5-bac9-02781e31ef48","resolution":{"observed_at":"2026-08-08T15:48:07.621676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-08T06:16:25.839566Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-08T15:48:05.427000Z","title":"Mixtral of Experts,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-09T14:10:22.469382Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.427000Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:035de1d931ccacbd27fbb947647ec55ae654dc8be216ace63a8e451bfa5d2bc2","observation_id":"664ae81a-5b4f-4a52-919c-51ae0d8ffa87","resolution":{"observed_at":"2026-08-08T15:48:05.427000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:48:07.609230Z","title":"LLaMA-MoE: Building mixture-of-experts from llama with continual pre-training,","venue":null,"work_id":"59b62fea-5c4e-47c8-9728-78c1842f048f","year":2024},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-09T14:10:22.469382Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.430825Z"},"links":{"citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:ee2c2219ae469b0b81263f0e45050ac034dac5816a8fbe405afa2f9ead8ab8c7","observation_id":"7a846a52-6e18-4057-9cca-fb3633c892d5","resolution":{"observed_at":"2026-08-08T15:48:07.612630Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10774","last_updated":"2024-06-14T23:32:32Z","snapshot_observed_at":"2026-07-06T17:17:56.276857Z","submitted_at":"2024-01-19T15:48:40Z","title":"Medusa: Simple LLM Inference Acceleration Framework with Multiple Decoding Heads","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10774","snapshot_observed_at":"2026-08-08T15:48:05.433834Z","title":"Medusa: Simple llm inference acceleration framework with multiple decoding heads,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-09T14:10:22.469382Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.433834Z"},"links":{"cited_paper":"/paper/2401.10774","citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:2c92dbc37feb29ea0c2c58c3de5c135846dbb0ebfb0ed866242b987f8d8c35d7","observation_id":"88b87ab0-4e6a-4802-9d8f-310c81853211","resolution":{"observed_at":"2026-08-08T15:48:05.433834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.16487","last_updated":"2023-10-30T01:36:06Z","snapshot_observed_at":"2026-08-08T01:16:37.122006Z","submitted_at":"2022-03-30T17:27:09Z","title":"Speculative Decoding: Exploiting Speculative Execution for Accelerating Seq2seq Generation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.16487","snapshot_observed_at":"2026-08-08T15:48:05.437417Z","title":"Speculative decoding: Exploiting speculative execution for accelerating seq2seq generation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-09T14:10:22.469382Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.437417Z"},"links":{"cited_paper":"/paper/2203.16487","citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:a2e7f0341d15477583f5ee9212d148479bd16ff6f0c4f3d6df42f1acedc74e85","observation_id":"1823bac8-8314-4eac-823e-f9ef4c1401c8","resolution":{"observed_at":"2026-08-08T15:48:05.437417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:48:05.440658Z","title":"Fast inference from transform- ers via speculative decoding,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-09T14:10:22.469382Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.440658Z"},"links":{"citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:3545aacc7c11a79cb9e13a87e17c733f93b34062f14c7ed9f4663bf1258ae74a","observation_id":"8c9a80ed-3034-4919-b947-ed19cdf9a461","resolution":{"observed_at":"2026-08-08T15:48:05.440658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.01318","last_updated":"2023-02-02T18:44:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-02T18:44:11Z","title":"Accelerating Large Language Model Decoding with Speculative Sampling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.01318","snapshot_observed_at":"2026-08-08T15:48:05.444304Z","title":"Accelerating large language model decoding with speculative sam- pling,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-09T14:10:22.469382Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.444304Z"},"links":{"cited_paper":"/paper/2302.01318","citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:3f95a4008f7e2bbeb83ba2d039cb639c382a95842e4527e1ff52bb91053938ad","observation_id":"961ebce8-44ad-4258-a45a-2eba2a942fc6","resolution":{"observed_at":"2026-08-08T15:48:05.444304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16710","last_updated":"2024-10-18T04:02:31Z","snapshot_observed_at":"2026-08-08T01:15:44.293937Z","submitted_at":"2024-04-25T16:20:23Z","title":"LayerSkip: Enabling Early Exit Inference and Self-Speculative Decoding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16710","snapshot_observed_at":"2026-08-08T15:48:05.447443Z","title":"LayerSkip: Enabling early exit inference and self-speculative decoding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-09T14:10:22.469382Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.447443Z"},"links":{"cited_paper":"/paper/2404.16710","citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:0d31075d582ed390a248db69ad61c5f3b9e1f5256ab50da935dc60571514bef4","observation_id":"e6f76a28-735c-4b5f-9efa-b3e29193f342","resolution":{"observed_at":"2026-08-08T15:48:05.447443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:48:07.594684Z","title":"Speculative decoding with big little decoder,","venue":null,"work_id":"fd5487d9-d158-4cef-9af1-b8a0416c4182","year":2023},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-09T14:10:22.469382Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.450810Z"},"links":{"citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:05d4ed85eae004c3ba3a5ac9e0e0840d39c32fe45ac8af94ea7f9cb6e4407cd4","observation_id":"7f16ba3b-926f-441d-91b0-9aa9211f3dee","resolution":{"observed_at":"2026-08-08T15:48:07.597995Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01840","last_updated":"2025-04-23T07:08:17Z","snapshot_observed_at":"2026-07-06T20:45:55.263034Z","submitted_at":"2025-03-03T18:59:04Z","title":"EAGLE-3: Scaling up Inference Acceleration of Large Language Models via Training-Time Test","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01840","snapshot_observed_at":"2026-08-08T15:48:05.453468Z","title":"EAGLE-3: Scaling up inference acceleration of large language models via training-time test,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-09T14:10:22.469382Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.453468Z"},"links":{"cited_paper":"/paper/2503.01840","citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:fbb4f2556b35df2d50b28c0ac2954d47ea998176a79475ab9fda7cc3d186d8bd","observation_id":"eed58b92-de0e-40ab-9dd9-621f04b8eca5","resolution":{"observed_at":"2026-08-08T15:48:05.453468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13565","last_updated":"2025-03-17T08:38:45Z","snapshot_observed_at":"2026-08-07T16:58:42.923604Z","submitted_at":"2025-03-17T08:38:45Z","title":"ML-SpecQD: Multi-Level Speculative Decoding with Quantized Drafts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.13565","snapshot_observed_at":"2026-08-08T15:48:05.456995Z","title":"ML-SpecQD: Multi-level speculative decoding with quantized drafts,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-09T14:10:22.469382Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.456995Z"},"links":{"cited_paper":"/paper/2503.13565","citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:773104c6db9ac2a1005a9783e98a34000df31e7dfdd7a4f0eb033d2cd5a71042","observation_id":"85835bdf-8a21-4e13-bce0-e53038b268d5","resolution":{"observed_at":"2026-08-08T15:48:05.456995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:48:07.584845Z","title":"EdgeLLM: Fast On-Device LLM Inference With Speculative Decoding,","venue":null,"work_id":"56583f82-9891-4c25-ad39-c17545dbf63a","year":2025},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-09T14:10:22.469382Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.460225Z"},"links":{"citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:0c6288852c2f4d85bdcc6f08c48a3c0d5c9572bce3969c6b71be522589f793d0","observation_id":"fb2305c1-23da-42da-8dc2-8b7077efd693","resolution":{"observed_at":"2026-08-08T15:48:07.588032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01986","last_updated":"2025-05-16T22:12:29Z","snapshot_observed_at":"2026-08-07T15:44:30.609416Z","submitted_at":"2025-05-16T22:12:29Z","title":"SpecMemo: Speculative Decoding is in Your Pocket","version":1},"cited_work":{"arxiv_id":"2506.01986","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.01986","snapshot_observed_at":"2026-08-08T15:48:07.058755Z","title":"SpecMemo: Speculative Decoding is in Your Pocket","venue":"cs.LG","work_id":"2686edf6-4410-449f-bf9c-7cee930d2935","year":2025},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-09T14:10:22.469382Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.463273Z"},"links":{"cited_paper":"/paper/2506.01986","citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:8e224d2a79e907b4956c94c4f2732c17fea54b77ab4df417ec11bdf6ddad578c","observation_id":"cc9a7068-a057-40fd-b7fe-df79c43812e4","resolution":{"observed_at":"2026-08-08T15:48:07.063112Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-08T15:48:05.466359Z","title":"DeepSeek-R1: Incentivizing reasoning capability in llms via reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-09T14:10:22.469382Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.466359Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:1761055a84d42fad72c32ff8b82c51bbbc10fc3cda0f3c0c041fa581791f72fb","observation_id":"82ee0902-2a62-4b5e-90af-0586845a430d","resolution":{"observed_at":"2026-08-08T15:48:05.466359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.15077","last_updated":"2025-03-04T13:58:39Z","snapshot_observed_at":"2026-08-03T09:40:31.365295Z","submitted_at":"2024-01-26T18:59:01Z","title":"EAGLE: Speculative Sampling Requires Rethinking Feature Uncertainty","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.15077","snapshot_observed_at":"2026-08-08T15:48:05.469674Z","title":"Eagle: Speculative sampling re- quires rethinking feature uncertainty,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-09T14:10:22.469382Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.469674Z"},"links":{"cited_paper":"/paper/2401.15077","citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:7eacf15db47786d49a15e8284d9034488406b479e75a74c0ac34f8fc79285fb2","observation_id":"aa1bf1a1-79ba-4f9a-860e-05bd8e02feb6","resolution":{"observed_at":"2026-08-08T15:48:05.469674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:48:05.472875Z","title":"MoESD: Unveil Speculative Decoding’s Potential for Accelerating Sparse MoE,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-09T14:10:22.469382Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.472875Z"},"links":{"citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:0f985594531ded16a900b2c0253556b6c915054efdc3aced9faab5ee9bcbf196","observation_id":"abf13411-7af7-4b04-82e5-104d3b16802a","resolution":{"observed_at":"2026-08-08T15:48:05.472875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-08T15:48:05.475775Z","title":"Deepseek-v2: A strong, economical, and efficient mixture-of-experts language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-09T14:10:22.469382Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.475775Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:f1ec0652d7bd01de6d7313787ed03d057c8f07ae0d709e88570957c4c669924e","observation_id":"dfe7d41f-1e8f-4dcc-9ad0-2d43a8c8b853","resolution":{"observed_at":"2026-08-08T15:48:05.475775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02060","last_updated":"2025-03-03T01:25:46Z","snapshot_observed_at":"2026-07-29T16:11:06.082798Z","submitted_at":"2024-09-03T17:08:20Z","title":"OLMoE: Open Mixture-of-Experts Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02060","snapshot_observed_at":"2026-08-08T15:48:05.478932Z","title":"OLMoE: Open mixture- of-experts language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-09T14:10:22.469382Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.478932Z"},"links":{"cited_paper":"/paper/2409.02060","citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:02030b168c2689ed734075fbef6801c6a8468275d9aaf42027b2c42b4a0e790f","observation_id":"fed56ccb-64d4-4da0-84f1-215bb62753bd","resolution":{"observed_at":"2026-08-08T15:48:05.478932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00099","last_updated":"2025-06-24T09:27:46Z","snapshot_observed_at":"2026-08-04T13:10:13.203299Z","submitted_at":"2024-11-27T18:59:48Z","title":"Mixture of Cache-Conditional Experts for Efficient Mobile Device Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00099","snapshot_observed_at":"2026-08-08T15:48:05.482175Z","title":"Mixture of cache- conditional experts for efficient mobile device inference,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-09T14:10:22.469382Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.482175Z"},"links":{"cited_paper":"/paper/2412.00099","citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:860cdcbe47ae0eb7d0fd8e9a6bb2b217412055a2ca564f443b02220b934f3777","observation_id":"a17e14cd-43c7-43ad-a5bd-340afe275ac9","resolution":{"observed_at":"2026-08-08T15:48:05.482175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:48:07.575056Z","title":"Read-ME: Refactorizing LLMs as Router-Decoupled Mixture of Experts with System Co-Design,","venue":null,"work_id":"4124018b-a99b-4e1f-9dd1-6eaffbd30783","year":2024},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-09T14:10:22.469382Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.485453Z"},"links":{"citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:528f5c283fe9b922f4c9e05521488e3e2d8344045a6862075d6d3cec37b5c8f9","observation_id":"ea6b6aec-b0aa-4b41-9583-7c5cc053537a","resolution":{"observed_at":"2026-08-08T15:48:07.578776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:48:07.565538Z","title":"Duplex: A Device for Large Language Models with Mixture of Experts, Grouped Query Attention, and Continuous Batching,","venue":null,"work_id":"45bdbf78-013e-4e37-b286-6260e8f7b557","year":2024},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-09T14:10:22.469382Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.488860Z"},"links":{"citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:e62c55a6790191b4eabfcec4c61cf6f594de0a3168fa486354bd62982cf6f694","observation_id":"0251c8c5-b9f9-48cc-ab79-2af095ca6c76","resolution":{"observed_at":"2026-08-08T15:48:07.568814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:48:07.556378Z","title":"20.8 Space-Mate: A 303.5mW Real-Time Sparse Mixture-of-Experts- Based NeRF-SLAM Processor for Mobile Spatial Computing,","venue":null,"work_id":"c274913e-a6c7-4729-ba73-6596e2d1c987","year":2024},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-09T14:10:22.469382Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.491756Z"},"links":{"citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:8b656dad428665f993eb2803aa2f794d99e8b9fdeedcecfb92f42de204b688a1","observation_id":"e67b1ddc-3bec-4b49-9202-303e48de200a","resolution":{"observed_at":"2026-08-08T15:48:07.559672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:48:06.815024Z","title":"SpecInfer: Accelerating Large Language Model Serving with Tree-based Speculative Inference and Verification,","venue":null,"work_id":"6f59f1d5-c63c-4fc5-8d26-a8d231de498a","year":2024},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-09T14:10:22.469382Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.495329Z"},"links":{"citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:91f6a51af2819c845c2868c47976598f90d90f29925b29f19fd77246c40630f7","observation_id":"8c15e677-9f27-46b1-bb99-04049c5179a9","resolution":{"observed_at":"2026-08-08T15:48:06.818755Z","resolver_source":"arxiv_id_nonexistent","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19715","last_updated":"2025-07-11T01:33:18Z","snapshot_observed_at":"2026-08-08T01:15:52.225102Z","submitted_at":"2024-05-30T05:49:38Z","title":"SpecDec++: Boosting Speculative Decoding via Adaptive Candidate Lengths","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19715","snapshot_observed_at":"2026-08-08T15:48:05.498093Z","title":"Specdec++: Boosting spec- ulative decoding via adaptive candidate lengths,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-09T14:10:22.469382Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.498093Z"},"links":{"cited_paper":"/paper/2405.19715","citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:cfdd65d0ebbbcece65f743d011b610a5f8448c75bb639983efbe6abeeda954a5","observation_id":"1de07ba8-0bac-4dc7-a0db-c8acf3181940","resolution":{"observed_at":"2026-08-08T15:48:05.498093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:48:07.547199Z","title":"Fast best-of-n decoding via speculative rejection,","venue":null,"work_id":"e2e6db70-5fd1-4b11-97d8-0b8f0ae5982c","year":2024},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-09T14:10:22.469382Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.501944Z"},"links":{"citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:233a32b250d3b5344b36b6c5ebe643793192309975e6abe5a56f4c1bd8de88a6","observation_id":"d7160d2e-1d4a-4abe-a1ef-4aeb4170b491","resolution":{"observed_at":"2026-08-08T15:48:07.550479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12374","last_updated":"2025-07-05T03:31:01Z","snapshot_observed_at":"2026-08-08T08:32:41.951263Z","submitted_at":"2024-02-19T18:58:32Z","title":"Sequoia: Scalable, Robust, and Hardware-aware Speculative Decoding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12374","snapshot_observed_at":"2026-08-08T15:48:05.504790Z","title":"Sequoia: Scalable, robust, and hardware-aware speculative decoding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-09T14:10:22.469382Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.504790Z"},"links":{"cited_paper":"/paper/2402.12374","citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:adc8f7e97a8a422c0d6136be5643e4cf9b194585aebc6e74386d94ab204fb716","observation_id":"2055f79f-efb3-4781-b2ee-6dea2c53cc7a","resolution":{"observed_at":"2026-08-08T15:48:05.504790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:48:07.538175Z","title":"Not all experts are equal: Efficient expert pruning and skipping for mixture-of-experts large language models,","venue":null,"work_id":"055c554f-a282-40bc-9c3e-4797c80867b3","year":2024},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-09T14:10:22.469382Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.508383Z"},"links":{"citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:b4df67991b484e48390930a250acbecfa61470277fe844398e9bbcc38ef29e22","observation_id":"5934ef46-3f3a-4b75-92bd-25a4b590bc57","resolution":{"observed_at":"2026-08-08T15:48:07.541433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:48:07.528642Z","title":"Moe-i2: Compressing mixture of experts models through inter-expert pruning and intra-expert low-rank decom- position,","venue":null,"work_id":"e6761c3f-b65d-4fee-88f9-d5105e1d2534","year":2024},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-09T14:10:22.469382Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.511406Z"},"links":{"citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:728eac41f5ba8d768f558bae9217e8ad2586ea581818d926771de597f8ead979","observation_id":"8385853b-6233-4470-88db-f6eccc8cde97","resolution":{"observed_at":"2026-08-08T15:48:07.532354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00945","last_updated":"2024-07-01T03:57:35Z","snapshot_observed_at":"2026-08-05T13:26:03.230242Z","submitted_at":"2024-07-01T03:57:35Z","title":"Efficient Expert Pruning for Sparse Mixture-of-Experts Language Models: Enhancing Performance and Reducing Inference Costs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00945","snapshot_observed_at":"2026-08-08T15:48:05.515013Z","title":"Efficient expert pruning for sparse mixture-of-experts language models: Enhancing performance and reducing inference costs,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-09T14:10:22.469382Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.515013Z"},"links":{"cited_paper":"/paper/2407.00945","citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:9309e6b038abc1acd340ede02ae1f8707c528c7098ea1179b04362f885cd74df","observation_id":"5ed985b9-0324-446d-8bd4-5eb1f49936ce","resolution":{"observed_at":"2026-08-08T15:48:05.515013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:48:06.624344Z","title":"Self-speculative decoding for on-device moe acceleration,","venue":null,"work_id":"3ea4d61f-9e20-4ad6-aaba-00ad0fa7ae9d","year":2026},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-09T14:10:22.469382Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.518084Z"},"links":{"citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:a0b0a7c54799909e468f3b55062fde9f82514ba7969ccbca8656a767ee0be83b","observation_id":"c2592ca9-03d6-4912-86e9-b7e0c254c2f5","resolution":{"observed_at":"2026-08-08T15:48:06.627756Z","resolver_source":"arxiv_id_nonexistent","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:48:05.521241Z","title":"MoE-Spec: Ex- pert Budgeting for Efficient Speculative Decoding,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-09T14:10:22.469382Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.521241Z"},"links":{"citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:afea81cd86fd8f9173c6bcbcbb1f2a08718b9e4745ab98fd6187803b060b933d","observation_id":"5b962831-68d3-4223-a6e7-fc29abcb80b6","resolution":{"observed_at":"2026-08-08T15:48:05.521241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:48:05.524086Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-09T14:10:22.469382Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.524086Z"},"links":{"citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:731025f035a385d52fb015e8fd016c551f2930bcf8055ab528d27ab69b9daaf1","observation_id":"671a1651-b0a5-4294-a807-7dd54cf9ccbf","resolution":{"observed_at":"2026-08-08T15:48:05.524086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:48:05.527731Z","title":"Emerging properties in self-supervised vision transformers,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-09T14:10:22.469382Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.527731Z"},"links":{"citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:fafe60ecc739beaba84a7e17f30a151fe66926ff1f6a7b8fd4d2e628a7859706","observation_id":"f549ddb7-a3b5-4147-a11c-f38f85d2d55e","resolution":{"observed_at":"2026-08-08T15:48:05.527731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:48:05.530625Z","title":"Dense passage retrieval for open-domain question answering,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-09T14:10:22.469382Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.530625Z"},"links":{"citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:f3d4d09266ba61f7c26d1789f549a5ca9dfb99a5d32727d6f0487682f4f76c1f","observation_id":"a764ec8c-961b-4968-96a1-09507f4cd167","resolution":{"observed_at":"2026-08-08T15:48:05.530625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01818","last_updated":"2025-05-11T17:45:02Z","snapshot_observed_at":"2026-08-08T00:45:04.947316Z","submitted_at":"2024-12-02T18:57:40Z","title":"Beyond Text-Visual Attention: Exploiting Visual Cues for Effective Token Pruning in VLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01818","snapshot_observed_at":"2026-08-08T15:48:05.534196Z","title":"[CLS] attention is all you need for training- free visual token pruning: Make vlm inference faster,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-09T14:10:22.469382Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.534196Z"},"links":{"cited_paper":"/paper/2412.01818","citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:713990aaee88a458191d8d92c6bbc71a0fddbcd1abe68bf54f168e24b3bd37ac","observation_id":"00f90a41-8bbb-41cb-a3f2-5cb76184f4b1","resolution":{"observed_at":"2026-08-08T15:48:05.534196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:48:07.504510Z","title":"HiPrune: Training-Free Visual Token Pruning via Hierarchical Attention in Vision-Language Models (Student Ab- stract),","venue":null,"work_id":"a8d88edc-5036-4c99-be98-5717f17109ba","year":2026},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-09T14:10:22.469382Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.537368Z"},"links":{"citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:ab50b15ab36a319d491dbe9204edc9a2fc08a2f489c73d61b6c296824b98b703","observation_id":"825ed448-8683-47ed-81eb-7260bb47b5e6","resolution":{"observed_at":"2026-08-08T15:48:07.507759Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:48:07.495584Z","title":"Atp-llava: Adaptive token pruning for large vision language models,","venue":null,"work_id":"385639e3-d682-48af-9ad7-1f050031f7a3","year":2025},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-09T14:10:22.469382Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.540750Z"},"links":{"citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:f181554b9df28e38494e60fa528e99d2542edfafc8845e0c19bc454b2646bc0a","observation_id":"50900402-f295-4453-b4d4-e4d01cb9b06d","resolution":{"observed_at":"2026-08-08T15:48:07.498714Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:48:07.486374Z","title":"all-minilm-l6-v2: Sentence transformers model,","venue":null,"work_id":"5d09efdf-c7a2-405b-8e43-0469c8413f96","year":2021},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-09T14:10:22.469382Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.543761Z"},"links":{"citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:f7a0ea3d8fd131e6ad3c4e513801d163f49f4da7123c3957aaf321a235e0453f","observation_id":"6bc4df81-91b6-4a07-8c93-e95bf1956905","resolution":{"observed_at":"2026-08-08T15:48:07.489593Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:48:06.176988Z","title":"Pre-Gated MoE: An Algorithm-System Co-Design for Fast and Scalable Mixture-of-Expert Inference,","venue":null,"work_id":"5ecdb95a-a8f5-48b3-bea0-614f5363ab3f","year":2025},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-09T14:10:22.469382Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.547508Z"},"links":{"citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:a776f9edcb581d10db41ff77558e613e0bd88fb407c7163a9f21caf40aae9513","observation_id":"29504228-7919-4bce-8800-7b54eac0093d","resolution":{"observed_at":"2026-08-08T15:48:06.180319Z","resolver_source":"arxiv_id_nonexistent","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:48:05.550292Z","title":"Sigma: A sparse and irregular gemm ac- celerator with flexible interconnects for dnn training,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-09T14:10:22.469382Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.550292Z"},"links":{"citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:e6223fbabbd2bd92083b4e4b92b5a24ba1a6e603ffe8010a6ff2b7d25d5432d6","observation_id":"c2805c7d-735b-49ee-baec-2298e994a166","resolution":{"observed_at":"2026-08-08T15:48:05.550292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:48:07.472740Z","title":"2022, rev","venue":null,"work_id":"5cf98c44-14b0-4092-afab-e0af8eccbbf9","year":2022},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-09T14:10:22.469382Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.554023Z"},"links":{"citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:d3ee7ae18318fa8ecddc9e0dad4426f20a058a8bd392c6db253bc0ed7eab1538","observation_id":"81e16d87-8484-431b-a7dc-94a1f2e2fd3d","resolution":{"observed_at":"2026-08-08T15:48:07.475928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:48:07.463977Z","title":"SCNN: An accelerator for compressed-sparse convolutional neural networks,","venue":null,"work_id":"36ae0132-13e3-43d6-be28-c34e7e5d1e0a","year":2017},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-09T14:10:22.469382Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.556825Z"},"links":{"citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:93e1def5f06d2ef99667189e7cb46ed6857f39a2ed4142b6e2ea5342e4004bb3","observation_id":"d188d3c3-0f45-45c3-9001-e3110bebfdb0","resolution":{"observed_at":"2026-08-08T15:48:07.467223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:48:05.560519Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-09T14:10:22.469382Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.560519Z"},"links":{"citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:bd6ea6b97827ad9ae0a44dbaac0fe490d6302e98798e673bdfc381917eb50392","observation_id":"d61f043c-d1fe-4200-a1e9-596323a909b5","resolution":{"observed_at":"2026-08-08T15:48:05.560519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-08T15:48:05.563489Z","title":"Training verifiers to solve math word problems,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-09T14:10:22.469382Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.563489Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:b7ac6693a521d6291874cb7e0f25db541db0ccad328c3a055ed9fff61cc63489","observation_id":"49e0ac6f-c82f-421f-870a-ebb14c9e39f8","resolution":{"observed_at":"2026-08-08T15:48:05.563489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-09T10:28:06.906299Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-08T15:48:05.566935Z","title":"Measuring massive multitask language understanding,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-09T14:10:22.469382Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.566935Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:a900de5d7735bc207e048d0640d3072176a338e0cf768cc7f6cb919061c860b8","observation_id":"ff4a0b63-6cce-403f-be61-5e4fa02f69d8","resolution":{"observed_at":"2026-08-08T15:48:05.566935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.07830","last_updated":"2019-05-19T23:57:23Z","snapshot_observed_at":"2026-07-31T00:09:56.948833Z","submitted_at":"2019-05-19T23:57:23Z","title":"HellaSwag: Can a Machine Really Finish Your Sentence?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.07830","snapshot_observed_at":"2026-08-08T15:48:05.569995Z","title":"Hel- laswag: Can a machine really finish your sentence?","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-09T14:10:22.469382Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.569995Z"},"links":{"cited_paper":"/paper/1905.07830","citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:545f1915dd4c8846dcc5944724236376059a929d71c98292bd67dfee044be2f5","observation_id":"78b6eddc-74c7-4cde-9c81-9e55b7cab3fd","resolution":{"observed_at":"2026-08-08T15:48:05.569995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-08T15:48:05.573207Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-09T14:10:22.469382Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.573207Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:d515e17e6e0bc795572892e00836c775da02d0887190b2718a1ae0a0527864dd","observation_id":"3a9f32e8-afbd-456d-870b-e8a4b73faf5d","resolution":{"observed_at":"2026-08-08T15:48:05.573207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:48:05.576315Z","title":"Winogrande: An adversarial winograd schema challenge at scale,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-09T14:10:22.469382Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.576315Z"},"links":{"citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:dd6f345e88ec78213ca8662e72d471d39f8517d006bac8349ce6033cf1f9413c","observation_id":"69a296cd-70d0-443a-9e69-0552bbec13ea","resolution":{"observed_at":"2026-08-08T15:48:05.576315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:48:05.579324Z","title":"Piqa: Reasoning about physical commonsense in natural language,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-09T14:10:22.469382Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.579324Z"},"links":{"citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:d947ee06c83badda5916407bbe6f811351501bdea961074bf0f062cd9c9370f6","observation_id":"88be2782-5a1d-43a9-b183-231a003128c7","resolution":{"observed_at":"2026-08-08T15:48:05.579324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.07843","last_updated":"2016-09-26T04:06:13Z","snapshot_observed_at":"2026-07-06T05:12:10.387914Z","submitted_at":"2016-09-26T04:06:13Z","title":"Pointer Sentinel Mixture Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.07843","snapshot_observed_at":"2026-08-08T15:48:05.582063Z","title":"Pointer Sentinel Mixture Models,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-09T14:10:22.469382Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.582063Z"},"links":{"cited_paper":"/paper/1609.07843","citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:c29219f3a73cec72fd9e6dbd54f49f140c263245a9c776427ef883e552f7e61e","observation_id":"5a9cb099-3d82-4296-8501-7d41cfc99c69","resolution":{"observed_at":"2026-08-08T15:48:05.582063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:48:07.440243Z","title":"MLPerf Inference interactive benchmark,","venue":null,"work_id":"dfe70dd5-283c-4d3d-86f0-cbe157863f46","year":2024},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-09T14:10:22.469382Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.585984Z"},"links":{"citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:bb930fe7ff9449d491f30d4ae153632b037fb821654f9c1081015e996035af56","observation_id":"3c6fcc8c-25af-4813-b23b-866bc30e9d7f","resolution":{"observed_at":"2026-08-08T15:48:07.443859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:48:05.589074Z","title":"Spatten: Efficient sparse attention architecture with cascade token and head pruning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-09T14:10:22.469382Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.589074Z"},"links":{"citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:2be3d8bd96fefb1c0a6bab04386b4cb31b22858ffe1244eabf97bb37d7c55a84","observation_id":"dc73aff7-80fb-4e2a-8b99-4cc40d8d1e95","resolution":{"observed_at":"2026-08-08T15:48:05.589074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:48:05.915417Z","title":"FACT: FFN-Attention Co-optimized Transformer Architecture with Eager Correlation Prediction,","venue":null,"work_id":"d548b9ea-4b7a-465e-b8cd-dc90b9e2cad0","year":2023},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-09T14:10:22.469382Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.592441Z"},"links":{"citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:80c9e1c4ea35486db54d94897ffe89b9e2baaf94356bdd766220906d90f12a04","observation_id":"0dbda71c-3190-4436-87ef-c3b05591e032","resolution":{"observed_at":"2026-08-08T15:48:05.921856Z","resolver_source":"arxiv_id_nonexistent","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:48:07.627555Z","title":"Available: https://github.com/ibm-granite/granite-3","venue":null,"work_id":"25b9c610-a6b0-487a-b1ab-6b45cfc98b3f","year":null},"citing_paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","snapshot_observed_at":"2026-08-09T14:10:22.469382Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-08T15:48:05.414109Z"},"links":{"citing_paper":"/paper/2608.05303"},"observation_digest":"sha256:a0eff8f2a5fd9441c95a28775dd6ee78e1bc991e002f4da10de968119deb6cef","observation_id":"55ad2281-72cf-4765-8890-eabf11a64b56","resolution":{"observed_at":"2026-08-08T15:48:07.630644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.05303","last_updated":"2026-08-05T18:03:47Z","latest_version":1,"primary_category":"cs.AR","snapshot_observed_at":"2026-08-09T14:10:22.469382Z","submitted_at":"2026-08-05T18:03:47Z","title":"EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding"},"reference_resolution":{"displayed":69,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":39,"verified_exact":5,"verified_fuzzy":25},"total_outbound_references":69},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 69 of 69 outbound references and 0 inbound Pith citation observations for arXiv:2608.05303."}