{"as_of":"2026-08-08T12:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ac228267ec698a8edc5e100048cb88830581f4e86dc3506f61f505c3848a0590","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:02:10.198594Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.23219/citation-record","integrity":"/paper/2505.23219/integrity","json":"/paper/2505.23219/citation-record.json","paper":"/paper/2505.23219"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:02:06.403875Z","title":"Efficient memory management for large language model serving with pagedattention,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23219","last_updated":"2025-06-10T01:54:59Z","snapshot_observed_at":"2026-08-08T00:09:46.174159Z","submitted_at":"2025-05-29T08:03:43Z","title":"Ghidorah: Fast LLM Inference on Edge with Speculative Decoding and Hetero-Core Parallelism","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:06.403875Z"},"links":{"citing_paper":"/paper/2505.23219"},"observation_digest":"sha256:f3e7dd08b986fa8f1720864c3b841b4fd8f00030981c4c9f61c43c9a33f9a4eb","observation_id":"24ae3333-f6f1-45e2-97c8-e76e0b08e213","resolution":{"observed_at":"2026-08-07T13:02:06.403875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:02:16.780555Z","title":"Specinfer: Accelerating large language model serving with tree-based speculative inference and ver- ification,","venue":null,"work_id":"620102ed-c5d6-4fdc-bc64-1373d4161dea","year":2024},"citing_paper":{"arxiv_id":"2505.23219","last_updated":"2025-06-10T01:54:59Z","snapshot_observed_at":"2026-08-08T00:09:46.174159Z","submitted_at":"2025-05-29T08:03:43Z","title":"Ghidorah: Fast LLM Inference on Edge with Speculative Decoding and Hetero-Core Parallelism","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:06.537216Z"},"links":{"citing_paper":"/paper/2505.23219"},"observation_digest":"sha256:cd4b723ff80c54270c23fb7c7dfa65dea0c9c53219fdc77411caf09b5abd4b52","observation_id":"91206771-a7bc-4a05-a2bb-0b33cdef305d","resolution":{"observed_at":"2026-08-07T13:02:16.911548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10774","last_updated":"2024-06-14T23:32:32Z","snapshot_observed_at":"2026-07-06T17:17:56.276857Z","submitted_at":"2024-01-19T15:48:40Z","title":"Medusa: Simple LLM Inference Acceleration Framework with Multiple Decoding Heads","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10774","snapshot_observed_at":"2026-08-07T13:02:06.695859Z","title":"Medusa: Simple llm inference acceleration framework with multiple decoding heads,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23219","last_updated":"2025-06-10T01:54:59Z","snapshot_observed_at":"2026-08-08T00:09:46.174159Z","submitted_at":"2025-05-29T08:03:43Z","title":"Ghidorah: Fast LLM Inference on Edge with Speculative Decoding and Hetero-Core Parallelism","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:06.695859Z"},"links":{"cited_paper":"/paper/2401.10774","citing_paper":"/paper/2505.23219"},"observation_digest":"sha256:7cd67a5bedefd7ebab63b4a598fbcb078c9cffedc63de85bb51f1d85c1c23ced","observation_id":"9fb6f691-5aac-4615-bf7b-817a44725dce","resolution":{"observed_at":"2026-08-07T13:02:06.695859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:02:16.544921Z","title":"Break the sequential dependency of LLM inference using lookahead decoding,","venue":null,"work_id":"98aee787-5955-41a7-ab63-8d6f06d92e04","year":2024},"citing_paper":{"arxiv_id":"2505.23219","last_updated":"2025-06-10T01:54:59Z","snapshot_observed_at":"2026-08-08T00:09:46.174159Z","submitted_at":"2025-05-29T08:03:43Z","title":"Ghidorah: Fast LLM Inference on Edge with Speculative Decoding and Hetero-Core Parallelism","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:06.850459Z"},"links":{"citing_paper":"/paper/2505.23219"},"observation_digest":"sha256:c394c883026c5e443dfe181373c6cdd31eef637c29a30cc1d30283a464844d95","observation_id":"94627f43-b782-4c43-bcd0-91244600d07d","resolution":{"observed_at":"2026-08-07T13:02:16.657708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:02:06.977455Z","title":"Codl: efficient CPU-GPU co-execution for deep learning inference on mobile devices,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23219","last_updated":"2025-06-10T01:54:59Z","snapshot_observed_at":"2026-08-08T00:09:46.174159Z","submitted_at":"2025-05-29T08:03:43Z","title":"Ghidorah: Fast LLM Inference on Edge with Speculative Decoding and Hetero-Core Parallelism","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:06.977455Z"},"links":{"citing_paper":"/paper/2505.23219"},"observation_digest":"sha256:0567cd51b7f82e22249ac2bb9096727924b69b7b5457ddf4342275f83867daf4","observation_id":"a371d8a0-6efc-4a5c-9ca1-5897462139c6","resolution":{"observed_at":"2026-08-07T13:02:06.977455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:02:16.208359Z","title":"Edgenn: Efficient neural network inference for cpu-gpu integrated edge devices,","venue":null,"work_id":"a4f0362e-ee02-41b8-ab88-884404eea5a4","year":2023},"citing_paper":{"arxiv_id":"2505.23219","last_updated":"2025-06-10T01:54:59Z","snapshot_observed_at":"2026-08-08T00:09:46.174159Z","submitted_at":"2025-05-29T08:03:43Z","title":"Ghidorah: Fast LLM Inference on Edge with Speculative Decoding and Hetero-Core Parallelism","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:07.117354Z"},"links":{"citing_paper":"/paper/2505.23219"},"observation_digest":"sha256:5e4f0a7f7950de39880d219bed7820653fb17825d09ac87633182cff796baec7","observation_id":"4e581d66-b47b-4ca8-b845-521ed67b90f7","resolution":{"observed_at":"2026-08-07T13:02:16.396266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:02:15.755599Z","title":"High-throughput cnn inference on embedded arm big. little multicore processors,","venue":null,"work_id":"a279e1df-a125-4135-a0a6-9b6a543ec6da","year":2019},"citing_paper":{"arxiv_id":"2505.23219","last_updated":"2025-06-10T01:54:59Z","snapshot_observed_at":"2026-08-08T00:09:46.174159Z","submitted_at":"2025-05-29T08:03:43Z","title":"Ghidorah: Fast LLM Inference on Edge with Speculative Decoding and Hetero-Core Parallelism","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:07.252057Z"},"links":{"citing_paper":"/paper/2505.23219"},"observation_digest":"sha256:3ffbea15ff7e8b8e6e8a802f5f2b4b657db6b431ec0f10400458755fed0edad8","observation_id":"0c9e5fbb-7dfa-4666-9e70-05434b1d00ee","resolution":{"observed_at":"2026-08-07T13:02:15.960000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:02:15.446137Z","title":"Dopia: online parallelism management for integrated cpu/gpu archi- tectures,","venue":null,"work_id":"b04799ba-ab34-4ba0-b0da-3236f32e2f72","year":2022},"citing_paper":{"arxiv_id":"2505.23219","last_updated":"2025-06-10T01:54:59Z","snapshot_observed_at":"2026-08-08T00:09:46.174159Z","submitted_at":"2025-05-29T08:03:43Z","title":"Ghidorah: Fast LLM Inference on Edge with Speculative Decoding and Hetero-Core Parallelism","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:07.376808Z"},"links":{"citing_paper":"/paper/2505.23219"},"observation_digest":"sha256:1ee081f557f1d53b71d06207b76ccbc49a4710d0d0440e506cd8af23d8c29ff1","observation_id":"32fc7452-b213-4759-93c1-5844b13f9b00","resolution":{"observed_at":"2026-08-07T13:02:15.597486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:02:15.173302Z","title":"Apple m4,","venue":null,"work_id":"c49cb95b-3d3e-4143-93a8-ce3f360bbed6","year":2024},"citing_paper":{"arxiv_id":"2505.23219","last_updated":"2025-06-10T01:54:59Z","snapshot_observed_at":"2026-08-08T00:09:46.174159Z","submitted_at":"2025-05-29T08:03:43Z","title":"Ghidorah: Fast LLM Inference on Edge with Speculative Decoding and Hetero-Core Parallelism","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:07.475644Z"},"links":{"citing_paper":"/paper/2505.23219"},"observation_digest":"sha256:d7299efec6445f437446ca59d0016bb0ba9259e1e4c9ff2cb240adb650f862d5","observation_id":"c2baf9dd-8904-47ae-9ed1-bba66802decb","resolution":{"observed_at":"2026-08-07T13:02:15.312135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:02:14.853252Z","title":"vllm github,","venue":null,"work_id":"e6545b3d-3068-4dad-8332-43823e40eccf","year":2024},"citing_paper":{"arxiv_id":"2505.23219","last_updated":"2025-06-10T01:54:59Z","snapshot_observed_at":"2026-08-08T00:09:46.174159Z","submitted_at":"2025-05-29T08:03:43Z","title":"Ghidorah: Fast LLM Inference on Edge with Speculative Decoding and Hetero-Core Parallelism","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:07.573662Z"},"links":{"citing_paper":"/paper/2505.23219"},"observation_digest":"sha256:f7b09d6a539a2ddb57edb7b108b09164294f958c4cbd9372c0762b4dd3b6e3f1","observation_id":"a9dad62b-73f1-495f-8299-3ae6003b911f","resolution":{"observed_at":"2026-08-07T13:02:14.987334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-07T13:02:07.687263Z","title":"Megatron-lm: Training multi-billion parameter language models using model parallelism,","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2505.23219","last_updated":"2025-06-10T01:54:59Z","snapshot_observed_at":"2026-08-08T00:09:46.174159Z","submitted_at":"2025-05-29T08:03:43Z","title":"Ghidorah: Fast LLM Inference on Edge with Speculative Decoding and Hetero-Core Parallelism","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:07.687263Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2505.23219"},"observation_digest":"sha256:07606bcb7bc3af39e46fe96e60de398f5420d63cb1eb19e360181eb8f7ceb705","observation_id":"58b9bea6-9407-493a-97a4-732d593c3e7f","resolution":{"observed_at":"2026-08-07T13:02:07.687263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17245","last_updated":"2024-05-27T15:01:04Z","snapshot_observed_at":"2026-08-04T21:01:51.439514Z","submitted_at":"2024-05-27T15:01:04Z","title":"Galaxy: A Resource-Efficient Collaborative Edge AI System for In-situ Transformer Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17245","snapshot_observed_at":"2026-08-07T13:02:07.770435Z","title":"Galaxy: A resource-efficient collaborative edge ai system for in-situ transformer inference,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23219","last_updated":"2025-06-10T01:54:59Z","snapshot_observed_at":"2026-08-08T00:09:46.174159Z","submitted_at":"2025-05-29T08:03:43Z","title":"Ghidorah: Fast LLM Inference on Edge with Speculative Decoding and Hetero-Core Parallelism","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:07.770435Z"},"links":{"cited_paper":"/paper/2405.17245","citing_paper":"/paper/2505.23219"},"observation_digest":"sha256:07b4d3321fcb299a9e51d1d85e6655bcf90ee2d3123a2f4586fc884cb2b746bb","observation_id":"cefeb681-f9e5-4b0f-bc37-fde6ef58283c","resolution":{"observed_at":"2026-08-07T13:02:07.770435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:02:14.531212Z","title":"Intel core ultra processor family,","venue":null,"work_id":"1ac4cc60-c61c-4b5a-894e-dc56c025ffe2","year":2024},"citing_paper":{"arxiv_id":"2505.23219","last_updated":"2025-06-10T01:54:59Z","snapshot_observed_at":"2026-08-08T00:09:46.174159Z","submitted_at":"2025-05-29T08:03:43Z","title":"Ghidorah: Fast LLM Inference on Edge with Speculative Decoding and Hetero-Core Parallelism","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:07.867375Z"},"links":{"citing_paper":"/paper/2505.23219"},"observation_digest":"sha256:138d080429a47d06507f90c90f47dc02115f46b9a16784e2e482de8f22dbd18d","observation_id":"7432d218-f45f-4fdd-8522-98a42ebbed96","resolution":{"observed_at":"2026-08-07T13:02:14.692481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:02:14.186701Z","title":"Meet jetson, the platform for ai at the edge,","venue":null,"work_id":"f4745504-76b8-4153-83bd-b84199851251","year":2024},"citing_paper":{"arxiv_id":"2505.23219","last_updated":"2025-06-10T01:54:59Z","snapshot_observed_at":"2026-08-08T00:09:46.174159Z","submitted_at":"2025-05-29T08:03:43Z","title":"Ghidorah: Fast LLM Inference on Edge with Speculative Decoding and Hetero-Core Parallelism","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:07.993100Z"},"links":{"citing_paper":"/paper/2505.23219"},"observation_digest":"sha256:3e396b71570f86f83706fab9132b52c93f94448967636b4b1a92316d469e8c17","observation_id":"f3fc7d8d-41d0-46f8-9d9f-ff0a5f54c87e","resolution":{"observed_at":"2026-08-07T13:02:14.344380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:02:13.912790Z","title":"Communication effi- cient distributed machine learning with the parameter server,","venue":null,"work_id":"aedb8774-689d-40be-bfc2-bc6d471f9489","year":2014},"citing_paper":{"arxiv_id":"2505.23219","last_updated":"2025-06-10T01:54:59Z","snapshot_observed_at":"2026-08-08T00:09:46.174159Z","submitted_at":"2025-05-29T08:03:43Z","title":"Ghidorah: Fast LLM Inference on Edge with Speculative Decoding and Hetero-Core Parallelism","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:08.088083Z"},"links":{"citing_paper":"/paper/2505.23219"},"observation_digest":"sha256:2dc32669f69d2e4fa40e67f28f8503d842a466141e2b089cef5ffc374ce7ae49","observation_id":"f5589f97-86ef-487d-8f49-38482ae3dc32","resolution":{"observed_at":"2026-08-07T13:02:14.024404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:02:13.592669Z","title":"Deepspeed ulysses: System optimizations for enabling training of extreme long sequence transformer models,","venue":null,"work_id":"cc81bf2b-e05b-4057-96d3-cfaea32663d7","year":null},"citing_paper":{"arxiv_id":"2505.23219","last_updated":"2025-06-10T01:54:59Z","snapshot_observed_at":"2026-08-08T00:09:46.174159Z","submitted_at":"2025-05-29T08:03:43Z","title":"Ghidorah: Fast LLM Inference on Edge with Speculative Decoding and Hetero-Core Parallelism","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:08.196608Z"},"links":{"citing_paper":"/paper/2505.23219"},"observation_digest":"sha256:cba007c5d3fa3f0ea1c92ff2c365c1da7e39d6067c90ffc8e771cacb33e3dec8","observation_id":"f016866a-0884-484b-9494-5f9d5be016f1","resolution":{"observed_at":"2026-08-07T13:02:13.716687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:02:13.346575Z","title":"Codl: efficient cpu-gpu co-execution for deep learning inference on mobile devices","venue":null,"work_id":"cca509c3-164c-4258-852c-156465fe0246","year":2022},"citing_paper":{"arxiv_id":"2505.23219","last_updated":"2025-06-10T01:54:59Z","snapshot_observed_at":"2026-08-08T00:09:46.174159Z","submitted_at":"2025-05-29T08:03:43Z","title":"Ghidorah: Fast LLM Inference on Edge with Speculative Decoding and Hetero-Core Parallelism","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:08.363551Z"},"links":{"citing_paper":"/paper/2505.23219"},"observation_digest":"sha256:f0c572d755eaadb4c661c596e7485ae67d06918ec92653e7ad4cc5555aa4f5d7","observation_id":"5a4f5d34-2367-49d8-981a-1361d9009a5b","resolution":{"observed_at":"2026-08-07T13:02:13.472004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:02:08.445461Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.23219","last_updated":"2025-06-10T01:54:59Z","snapshot_observed_at":"2026-08-08T00:09:46.174159Z","submitted_at":"2025-05-29T08:03:43Z","title":"Ghidorah: Fast LLM Inference on Edge with Speculative Decoding and Hetero-Core Parallelism","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:08.445461Z"},"links":{"citing_paper":"/paper/2505.23219"},"observation_digest":"sha256:0d5016813af96fc666c9b44364846031884809ea2c2f5d3a98e782591054fc02","observation_id":"9c66d894-9c9a-4eb7-98b3-69b0b4c28a22","resolution":{"observed_at":"2026-08-07T13:02:08.445461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08461","last_updated":"2024-03-31T03:06:51Z","snapshot_observed_at":"2026-08-06T22:36:42.010627Z","submitted_at":"2023-10-12T16:21:04Z","title":"DistillSpec: Improving Speculative Decoding via Knowledge Distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08461","snapshot_observed_at":"2026-08-07T13:02:08.525545Z","title":"Distillspec: Improving speculative decoding via knowledge distillation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23219","last_updated":"2025-06-10T01:54:59Z","snapshot_observed_at":"2026-08-08T00:09:46.174159Z","submitted_at":"2025-05-29T08:03:43Z","title":"Ghidorah: Fast LLM Inference on Edge with Speculative Decoding and Hetero-Core Parallelism","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:08.525545Z"},"links":{"cited_paper":"/paper/2310.08461","citing_paper":"/paper/2505.23219"},"observation_digest":"sha256:f2445969a212a2dcdc2aeb4fdbe5f5d265536d57f6f559a9cc06b01424ff1b00","observation_id":"5bb6186d-b056-45b1-953a-ddd20e647f17","resolution":{"observed_at":"2026-08-07T13:02:08.525545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:02:13.023306Z","title":"EAGLE: speculative sampling requires rethinking feature uncertainty,","venue":null,"work_id":"0cdae09a-4733-450b-acb3-ffa880ab8709","year":2024},"citing_paper":{"arxiv_id":"2505.23219","last_updated":"2025-06-10T01:54:59Z","snapshot_observed_at":"2026-08-08T00:09:46.174159Z","submitted_at":"2025-05-29T08:03:43Z","title":"Ghidorah: Fast LLM Inference on Edge with Speculative Decoding and Hetero-Core Parallelism","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:08.621537Z"},"links":{"citing_paper":"/paper/2505.23219"},"observation_digest":"sha256:86e08f4b0ffb08eb2914b1132c19d538a5f70d6c4efd4459ccbb937691a479cb","observation_id":"f6096911-0308-49be-a5c8-4507020568d7","resolution":{"observed_at":"2026-08-07T13:02:13.169659Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:02:12.698292Z","title":"Apple a17,","venue":null,"work_id":"039128e6-af93-4eaa-aea2-20bc878a4f0d","year":2024},"citing_paper":{"arxiv_id":"2505.23219","last_updated":"2025-06-10T01:54:59Z","snapshot_observed_at":"2026-08-08T00:09:46.174159Z","submitted_at":"2025-05-29T08:03:43Z","title":"Ghidorah: Fast LLM Inference on Edge with Speculative Decoding and Hetero-Core Parallelism","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:08.693852Z"},"links":{"citing_paper":"/paper/2505.23219"},"observation_digest":"sha256:8c15d92db027abb54a294185c72cd01649a87d42819743da54957ae7b9c8188f","observation_id":"9f73d127-3366-4a33-8495-f3a5a873b60d","resolution":{"observed_at":"2026-08-07T13:02:12.863170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:02:12.395453Z","title":"Amd reveals next-gen desktop processors for extreme pc gam- ing and creator performance,","venue":null,"work_id":"683c7377-ae4c-4e74-82c9-f005d6ff5643","year":2024},"citing_paper":{"arxiv_id":"2505.23219","last_updated":"2025-06-10T01:54:59Z","snapshot_observed_at":"2026-08-08T00:09:46.174159Z","submitted_at":"2025-05-29T08:03:43Z","title":"Ghidorah: Fast LLM Inference on Edge with Speculative Decoding and Hetero-Core Parallelism","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:08.789304Z"},"links":{"citing_paper":"/paper/2505.23219"},"observation_digest":"sha256:0935db0ce70996ee42638878b98d669f098d8946f41fa32fdc941a4a59d828cf","observation_id":"d9580a79-5031-479f-be40-09730113aa80","resolution":{"observed_at":"2026-08-07T13:02:12.552778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:02:12.086545Z","title":"Qualcomm snapdragon,","venue":null,"work_id":"fa83ee58-f1f3-4f32-b6c5-788221ef4cc2","year":2024},"citing_paper":{"arxiv_id":"2505.23219","last_updated":"2025-06-10T01:54:59Z","snapshot_observed_at":"2026-08-08T00:09:46.174159Z","submitted_at":"2025-05-29T08:03:43Z","title":"Ghidorah: Fast LLM Inference on Edge with Speculative Decoding and Hetero-Core Parallelism","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:08.899326Z"},"links":{"citing_paper":"/paper/2505.23219"},"observation_digest":"sha256:0286bd4fb69b70c678243c2c5f3284f93b10f3e0574e511abc5ddc86f09d7ada","observation_id":"0a0d0a69-c945-4d6d-b371-6b32b9cb5ad6","resolution":{"observed_at":"2026-08-07T13:02:12.235562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01889","last_updated":"2023-11-27T06:38:47Z","snapshot_observed_at":"2026-08-07T09:22:20.831075Z","submitted_at":"2023-10-03T08:44:50Z","title":"Ring Attention with Blockwise Transformers for Near-Infinite Context","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01889","snapshot_observed_at":"2026-08-07T13:02:09.016191Z","title":"Ring attention with blockwise transformers for near- infinite context,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23219","last_updated":"2025-06-10T01:54:59Z","snapshot_observed_at":"2026-08-08T00:09:46.174159Z","submitted_at":"2025-05-29T08:03:43Z","title":"Ghidorah: Fast LLM Inference on Edge with Speculative Decoding and Hetero-Core Parallelism","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:09.016191Z"},"links":{"cited_paper":"/paper/2310.01889","citing_paper":"/paper/2505.23219"},"observation_digest":"sha256:98b09dff7a59be627401de4c32139117d641939cc6a8c5b3eb94b10ee2761e33","observation_id":"0ee5fff8-57fe-4f4d-8b57-00257fc7c042","resolution":{"observed_at":"2026-08-07T13:02:09.016191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:02:11.768978Z","title":"Flashattention: Fast and memory-efficient exact attention with io-awareness,","venue":null,"work_id":"310ab216-53f6-4722-824b-2b3357c3a218","year":2022},"citing_paper":{"arxiv_id":"2505.23219","last_updated":"2025-06-10T01:54:59Z","snapshot_observed_at":"2026-08-08T00:09:46.174159Z","submitted_at":"2025-05-29T08:03:43Z","title":"Ghidorah: Fast LLM Inference on Edge with Speculative Decoding and Hetero-Core Parallelism","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:09.116736Z"},"links":{"citing_paper":"/paper/2505.23219"},"observation_digest":"sha256:6b151786a7b48a60a8fa73e73cf652eff6b7deeb005fe08eafa5e1ed72bd3930","observation_id":"29985fa0-3612-487d-8f4e-3f1164b86d7e","resolution":{"observed_at":"2026-08-07T13:02:11.920095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:02:11.567411Z","title":"Wave quantization,","venue":null,"work_id":"629708ff-e78b-44e5-9f4c-5a1b4c932a55","year":2024},"citing_paper":{"arxiv_id":"2505.23219","last_updated":"2025-06-10T01:54:59Z","snapshot_observed_at":"2026-08-08T00:09:46.174159Z","submitted_at":"2025-05-29T08:03:43Z","title":"Ghidorah: Fast LLM Inference on Edge with Speculative Decoding and Hetero-Core Parallelism","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:09.228587Z"},"links":{"citing_paper":"/paper/2505.23219"},"observation_digest":"sha256:6bfb3a9c3770ceb680709456489038ff050dbc31eb97301c393bc42a0fc1b62c","observation_id":"9b6bcb50-3f38-4bdc-9901-6ba9cc0e51d5","resolution":{"observed_at":"2026-08-07T13:02:11.668637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:02:11.338572Z","title":"Nvidia fastertransformer: Transformer related optimization, including bert, gpt,","venue":null,"work_id":"aa84024a-19eb-409b-92c8-01c79b8e8f87","year":2023},"citing_paper":{"arxiv_id":"2505.23219","last_updated":"2025-06-10T01:54:59Z","snapshot_observed_at":"2026-08-08T00:09:46.174159Z","submitted_at":"2025-05-29T08:03:43Z","title":"Ghidorah: Fast LLM Inference on Edge with Speculative Decoding and Hetero-Core Parallelism","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:09.390790Z"},"links":{"citing_paper":"/paper/2505.23219"},"observation_digest":"sha256:ee7652658612e72f0769b0cfbef0a97072b1b9ca7a58d650cbb9083149f17b61","observation_id":"f69929ea-c697-4a01-94f8-042787a02f7c","resolution":{"observed_at":"2026-08-07T13:02:11.430108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:02:11.156226Z","title":"Ctranslate2,","venue":null,"work_id":"e54c4f63-3d67-4030-a1b7-0ddaf9cada87","year":2024},"citing_paper":{"arxiv_id":"2505.23219","last_updated":"2025-06-10T01:54:59Z","snapshot_observed_at":"2026-08-08T00:09:46.174159Z","submitted_at":"2025-05-29T08:03:43Z","title":"Ghidorah: Fast LLM Inference on Edge with Speculative Decoding and Hetero-Core Parallelism","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:09.458408Z"},"links":{"citing_paper":"/paper/2505.23219"},"observation_digest":"sha256:0202e6f073c3667c919fc2a0523c98b44371276d9c8ab89488975a4b39f27aa2","observation_id":"9f84d62a-3cc6-4af2-a63b-164c31ab2b39","resolution":{"observed_at":"2026-08-07T13:02:11.228226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:02:09.524187Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23219","last_updated":"2025-06-10T01:54:59Z","snapshot_observed_at":"2026-08-08T00:09:46.174159Z","submitted_at":"2025-05-29T08:03:43Z","title":"Ghidorah: Fast LLM Inference on Edge with Speculative Decoding and Hetero-Core Parallelism","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:09.524187Z"},"links":{"citing_paper":"/paper/2505.23219"},"observation_digest":"sha256:8deb80d37087e7cb224f879a21aa8e20927732bf52f6d435ed3e7102c576963a","observation_id":"f060c808-1a7c-4988-9be3-720d8f49e024","resolution":{"observed_at":"2026-08-07T13:02:09.524187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T13:02:09.585286Z","title":"Llama: Open and efficient foundation language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23219","last_updated":"2025-06-10T01:54:59Z","snapshot_observed_at":"2026-08-08T00:09:46.174159Z","submitted_at":"2025-05-29T08:03:43Z","title":"Ghidorah: Fast LLM Inference on Edge with Speculative Decoding and Hetero-Core Parallelism","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:09.585286Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.23219"},"observation_digest":"sha256:b849b0688795564e16a88b31a4716d3f3d2f3dc53db857cbbb39427ca1d3669d","observation_id":"cbe957d3-64d0-4562-ac55-ab52abffefe9","resolution":{"observed_at":"2026-08-07T13:02:09.585286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T13:02:09.637595Z","title":"Training verifiers to solve math word problems,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23219","last_updated":"2025-06-10T01:54:59Z","snapshot_observed_at":"2026-08-08T00:09:46.174159Z","submitted_at":"2025-05-29T08:03:43Z","title":"Ghidorah: Fast LLM Inference on Edge with Speculative Decoding and Hetero-Core Parallelism","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:09.637595Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2505.23219"},"observation_digest":"sha256:efcfd582d1f865e827d18f8a0a5a552e6d14436123d7f9e0dbaee8baa079a3c3","observation_id":"985f7dad-d686-4f00-91bd-36f94c835bb3","resolution":{"observed_at":"2026-08-07T13:02:09.637595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-07T13:02:09.703036Z","title":"Evaluating large language models trained on code,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23219","last_updated":"2025-06-10T01:54:59Z","snapshot_observed_at":"2026-08-08T00:09:46.174159Z","submitted_at":"2025-05-29T08:03:43Z","title":"Ghidorah: Fast LLM Inference on Edge with Speculative Decoding and Hetero-Core Parallelism","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:09.703036Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2505.23219"},"observation_digest":"sha256:126c7815f3fb239229599811430e153b7842624ee3d743b0c4c363b3b76c525c","observation_id":"b32f7167-717d-43fe-93a9-d99c0b8e39ff","resolution":{"observed_at":"2026-08-07T13:02:09.703036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-02T19:23:53.535075Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-07T13:02:09.762157Z","title":"Program synthesis with large language models,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23219","last_updated":"2025-06-10T01:54:59Z","snapshot_observed_at":"2026-08-08T00:09:46.174159Z","submitted_at":"2025-05-29T08:03:43Z","title":"Ghidorah: Fast LLM Inference on Edge with Speculative Decoding and Hetero-Core Parallelism","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:09.762157Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2505.23219"},"observation_digest":"sha256:c086ca7908b047e82149d4c40b35fd007a445448c8a79c6c848866bfd90fc926","observation_id":"eaae6fc4-7c10-4305-896f-fc8f7963e2d3","resolution":{"observed_at":"2026-08-07T13:02:09.762157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2023.00096","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:02:10.566546Z","title":"Edgenn: Efficient neural network inference for CPU-GPU integrated edge devices,","venue":null,"work_id":"ecdda994-f057-4931-8570-4b0a1713441e","year":2023},"citing_paper":{"arxiv_id":"2505.23219","last_updated":"2025-06-10T01:54:59Z","snapshot_observed_at":"2026-08-08T00:09:46.174159Z","submitted_at":"2025-05-29T08:03:43Z","title":"Ghidorah: Fast LLM Inference on Edge with Speculative Decoding and Hetero-Core Parallelism","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:09.831626Z"},"links":{"citing_paper":"/paper/2505.23219"},"observation_digest":"sha256:dba553536ecc6ab0472a702d0ea61094124260829fcdde4db7645158f910d158","observation_id":"0de30b68-523e-419a-a089-cada98f314b7","resolution":{"observed_at":"2026-08-07T13:02:10.643834Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:02:10.957707Z","title":"Taming {Throughput-Latency} tradeoff in {LLM} inference with {Sarathi-Serve},","venue":null,"work_id":"14be6733-6012-458f-bc40-c6cd1a4b5b32","year":2024},"citing_paper":{"arxiv_id":"2505.23219","last_updated":"2025-06-10T01:54:59Z","snapshot_observed_at":"2026-08-08T00:09:46.174159Z","submitted_at":"2025-05-29T08:03:43Z","title":"Ghidorah: Fast LLM Inference on Edge with Speculative Decoding and Hetero-Core Parallelism","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:09.895407Z"},"links":{"citing_paper":"/paper/2505.23219"},"observation_digest":"sha256:e53d77563cef0be7de9a3be3c310062398212ba5d5958c788abd3b9bff1df46d","observation_id":"5c1462e8-01ac-4aa8-b1ee-df2badc6a558","resolution":{"observed_at":"2026-08-07T13:02:11.067511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:02:09.955947Z","title":"Communication-efficient model parallelism for distributed in-situ trans- former inference,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23219","last_updated":"2025-06-10T01:54:59Z","snapshot_observed_at":"2026-08-08T00:09:46.174159Z","submitted_at":"2025-05-29T08:03:43Z","title":"Ghidorah: Fast LLM Inference on Edge with Speculative Decoding and Hetero-Core Parallelism","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:09.955947Z"},"links":{"citing_paper":"/paper/2505.23219"},"observation_digest":"sha256:be30f38fea8a1e2aaa4c5a330aaca014c825d25c5ad4ca817f1cad9fe28a87cf","observation_id":"c58228b5-db65-4718-9996-92174d32b9aa","resolution":{"observed_at":"2026-08-07T13:02:09.955947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.01188","last_updated":"2023-03-02T19:33:31Z","snapshot_observed_at":"2026-07-06T13:48:24.141683Z","submitted_at":"2022-09-02T17:38:03Z","title":"Petals: Collaborative Inference and Fine-tuning of Large Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.01188","snapshot_observed_at":"2026-08-07T13:02:10.010089Z","title":"Petals: Collabo- rative inference and fine-tuning of large models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23219","last_updated":"2025-06-10T01:54:59Z","snapshot_observed_at":"2026-08-08T00:09:46.174159Z","submitted_at":"2025-05-29T08:03:43Z","title":"Ghidorah: Fast LLM Inference on Edge with Speculative Decoding and Hetero-Core Parallelism","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:10.010089Z"},"links":{"cited_paper":"/paper/2209.01188","citing_paper":"/paper/2505.23219"},"observation_digest":"sha256:3eae57993e8ce2a0945563992528cbb621f8cec698907acb210baf2aa15f9517","observation_id":"3d3743d6-38b0-495b-a278-4c1245722ebb","resolution":{"observed_at":"2026-08-07T13:02:10.010089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"7993.34486","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:02:10.369788Z","title":"Asymo: scalable and efficient deep-learning inference on asymmetric mobile cpus,","venue":null,"work_id":"6b94fffb-2e84-4a89-b9b2-737f91ec0545","year":2021},"citing_paper":{"arxiv_id":"2505.23219","last_updated":"2025-06-10T01:54:59Z","snapshot_observed_at":"2026-08-08T00:09:46.174159Z","submitted_at":"2025-05-29T08:03:43Z","title":"Ghidorah: Fast LLM Inference on Edge with Speculative Decoding and Hetero-Core Parallelism","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:10.076767Z"},"links":{"citing_paper":"/paper/2505.23219"},"observation_digest":"sha256:8292e90285e70a98f28ba7fcdfd0570251868e4e425392d33747c405ebcdf5c8","observation_id":"0d670f62-08ce-4a51-8d72-5d4dec06a26e","resolution":{"observed_at":"2026-08-07T13:02:10.429864Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12374","last_updated":"2025-07-05T03:31:01Z","snapshot_observed_at":"2026-08-08T08:32:41.951263Z","submitted_at":"2024-02-19T18:58:32Z","title":"Sequoia: Scalable, Robust, and Hardware-aware Speculative Decoding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12374","snapshot_observed_at":"2026-08-07T13:02:10.146184Z","title":"Sequoia: Scalable, robust, and hardware-aware speculative decoding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23219","last_updated":"2025-06-10T01:54:59Z","snapshot_observed_at":"2026-08-08T00:09:46.174159Z","submitted_at":"2025-05-29T08:03:43Z","title":"Ghidorah: Fast LLM Inference on Edge with Speculative Decoding and Hetero-Core Parallelism","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:10.146184Z"},"links":{"cited_paper":"/paper/2402.12374","citing_paper":"/paper/2505.23219"},"observation_digest":"sha256:717df7fb51d53ef2f482fededc1232d4e5d4395a25d5a5aa6ee989f6b04196dc","observation_id":"d0fb433f-8dc3-4c79-b65e-8b1912fdd96f","resolution":{"observed_at":"2026-08-07T13:02:10.146184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.04255","last_updated":"2023-09-08T10:44:19Z","snapshot_observed_at":"2026-07-06T16:16:07.182657Z","submitted_at":"2023-09-08T10:44:19Z","title":"LLMCad: Fast and Scalable On-device Large Language Model Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.04255","snapshot_observed_at":"2026-08-07T13:02:10.198594Z","title":"Llmcad: Fast and scalable on-device large language model inference,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23219","last_updated":"2025-06-10T01:54:59Z","snapshot_observed_at":"2026-08-08T00:09:46.174159Z","submitted_at":"2025-05-29T08:03:43Z","title":"Ghidorah: Fast LLM Inference on Edge with Speculative Decoding and Hetero-Core Parallelism","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:10.198594Z"},"links":{"cited_paper":"/paper/2309.04255","citing_paper":"/paper/2505.23219"},"observation_digest":"sha256:494415a44b593e6eedc3bb94f6094b5cfbf9f524dfca80931f9b95a7bc78892d","observation_id":"4012f9de-80bc-48e5-bbbf-2660dc0bc53f","resolution":{"observed_at":"2026-08-07T13:02:10.198594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14509","last_updated":"2023-10-04T16:51:13Z","snapshot_observed_at":"2026-08-04T19:27:31.715261Z","submitted_at":"2023-09-25T20:15:57Z","title":"DeepSpeed Ulysses: System Optimizations for Enabling Training of Extreme Long Sequence Transformer Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14509","snapshot_observed_at":"2026-08-07T13:02:08.290303Z","title":"Available: https://arxiv.org/abs/2309.14509","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23219","last_updated":"2025-06-10T01:54:59Z","snapshot_observed_at":"2026-08-08T00:09:46.174159Z","submitted_at":"2025-05-29T08:03:43Z","title":"Ghidorah: Fast LLM Inference on Edge with Speculative Decoding and Hetero-Core Parallelism","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:08.290303Z"},"links":{"cited_paper":"/paper/2309.14509","citing_paper":"/paper/2505.23219"},"observation_digest":"sha256:222cd8412d7ed6f6af3f60cb579e2e010da7f01ab72cd17d77c57072a1951972","observation_id":"84bb3486-6f11-49d1-900f-b3d522f463cb","resolution":{"observed_at":"2026-08-07T13:02:08.290303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.23219","last_updated":"2025-06-10T01:54:59Z","latest_version":2,"primary_category":"cs.DC","snapshot_observed_at":"2026-08-08T00:09:46.174159Z","submitted_at":"2025-05-29T08:03:43Z","title":"Ghidorah: Fast LLM Inference on Edge with Speculative Decoding and Hetero-Core Parallelism"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":18,"verified_exact":1,"verified_fuzzy":21},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 0 inbound Pith citation observations for arXiv:2505.23219."}