{"as_of":"2026-08-21T18:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8c40ae24d7f707490cf51c9aa5e673c653e528d214e8778b3e7543b920be6162","coverage":[{"denominator":18,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":18,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T15:03:31.289211Z","state":"measured"},{"denominator":18,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":18,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.27435/citation-record","integrity":"/paper/2605.27435/integrity","json":"/paper/2605.27435/citation-record.json","paper":"/paper/2605.27435"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.21901","last_updated":"2025-06-27T04:38:20Z","snapshot_observed_at":"2026-08-11T17:40:24.826706Z","submitted_at":"2025-06-27T04:38:20Z","title":"A Survey of LLM Inference Systems","version":1},"cited_work":{"arxiv_id":"2506.21901","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21901","snapshot_observed_at":"2026-06-30T15:04:46.170653Z","title":"A survey of LLM inference systems","venue":null,"work_id":"510b32e3-a3fe-4da8-98dc-b289560c3699","year":2025},"citing_paper":{"arxiv_id":"2605.27435","last_updated":"2026-05-22T10:39:35Z","snapshot_observed_at":"2026-08-08T01:27:25.329843Z","submitted_at":"2026-05-22T10:39:35Z","title":"When NPUs Are Not Always Faster: A Stage-Level Analysis of Mobile LLM Inference","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-30T15:03:31.289211Z"},"links":{"cited_paper":"/paper/2506.21901","citing_paper":"/paper/2605.27435"},"observation_digest":"sha256:2a503c6eb33f7063787963ef9fb4f2f127fe5c50be902dae5858fdc3c01ad2bd","observation_id":"72c2fc1c-2789-47f1-a691-d88637bc627a","resolution":{"observed_at":"2026-06-30T15:04:46.172024Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T18:45:27.629052Z","title":"Empowering edge intelligence: A comprehensive survey on on-device AI models,","venue":null,"work_id":"6ba10c52-84da-414c-808c-1c0e6cb2ac49","year":2025},"citing_paper":{"arxiv_id":"2605.27435","last_updated":"2026-05-22T10:39:35Z","snapshot_observed_at":"2026-08-08T01:27:25.329843Z","submitted_at":"2026-05-22T10:39:35Z","title":"When NPUs Are Not Always Faster: A Stage-Level Analysis of Mobile LLM Inference","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-30T15:03:31.289211Z"},"links":{"citing_paper":"/paper/2605.27435"},"observation_digest":"sha256:187c2301c1f16ed3879880f2452a461c02e0ce2939336f59c5a7b9e788ef22f0","observation_id":"4cd305fd-a733-450c-b296-270d1c1580d9","resolution":{"observed_at":"2026-07-08T18:45:27.630511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T18:45:27.626386Z","title":"LLaMA 3.2: Vision and edge-optimized models for multi- modal and mobile AI,","venue":null,"work_id":"ecf9df9a-246b-4d33-854a-ce1b1bd217e4","year":2024},"citing_paper":{"arxiv_id":"2605.27435","last_updated":"2026-05-22T10:39:35Z","snapshot_observed_at":"2026-08-08T01:27:25.329843Z","submitted_at":"2026-05-22T10:39:35Z","title":"When NPUs Are Not Always Faster: A Stage-Level Analysis of Mobile LLM Inference","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-30T15:03:31.289211Z"},"links":{"citing_paper":"/paper/2605.27435"},"observation_digest":"sha256:93a4ad060e55b7f764ac38508c372c88778a440558b32e4b7b26ca06047dbe64","observation_id":"5474a78b-3d68-46c3-81d5-f5794b57b03b","resolution":{"observed_at":"2026-07-08T18:45:27.628414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2605.27435","last_updated":"2026-05-22T10:39:35Z","snapshot_observed_at":"2026-08-08T01:27:25.329843Z","submitted_at":"2026-05-22T10:39:35Z","title":"When NPUs Are Not Always Faster: A Stage-Level Analysis of Mobile LLM Inference","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-30T15:03:31.289211Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2605.27435"},"observation_digest":"sha256:1037f30d6595f8c84bf2d23790221568763cb03d0cd541f2e77ce75c509e26ff","observation_id":"3a8cdc4c-220d-4b2d-95c9-f8ebc3c82caf","resolution":{"observed_at":"2026-06-30T15:04:46.185045Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.17323","last_updated":"2023-03-22T13:10:47Z","snapshot_observed_at":"2026-08-16T07:57:19.216626Z","submitted_at":"2022-10-31T13:42:40Z","title":"GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers","version":2},"cited_work":{"arxiv_id":"2210.17323","doi":"10.48550/arxiv.2210.17323","metadata_source":"pith","pith_arxiv_id":"2210.17323","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers","venue":"cs.LG","work_id":"19ed8c44-202a-48f6-8169-637d5a5f2408","year":2022},"citing_paper":{"arxiv_id":"2605.27435","last_updated":"2026-05-22T10:39:35Z","snapshot_observed_at":"2026-08-08T01:27:25.329843Z","submitted_at":"2026-05-22T10:39:35Z","title":"When NPUs Are Not Always Faster: A Stage-Level Analysis of Mobile LLM Inference","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-30T15:03:31.289211Z"},"links":{"cited_paper":"/paper/2210.17323","citing_paper":"/paper/2605.27435"},"observation_digest":"sha256:460c428ea3ee3235d69c23dcaabd6445112add5ccb430cf12384f5b416855a95","observation_id":"01f58251-7609-4ccc-bd02-7a78e73df3e5","resolution":{"observed_at":"2026-06-30T15:04:46.174674Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-15T03:08:15.265514+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-15T03:08:15.265514+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T18:45:27.632615Z","title":"AWQ: Activation-aware weight quantiza- tion for on-device LLM compression and acceleration,","venue":null,"work_id":"cfe6bc78-e2bb-4945-a783-d945c0865bd1","year":2024},"citing_paper":{"arxiv_id":"2605.27435","last_updated":"2026-05-22T10:39:35Z","snapshot_observed_at":"2026-08-08T01:27:25.329843Z","submitted_at":"2026-05-22T10:39:35Z","title":"When NPUs Are Not Always Faster: A Stage-Level Analysis of Mobile LLM Inference","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-30T15:03:31.289211Z"},"links":{"citing_paper":"/paper/2605.27435"},"observation_digest":"sha256:3af82d35b2f995d3f6aa65c8abf727377182248f97e36f4dc2d4dd9129f9a72a","observation_id":"729cc128-fa7a-4ba3-b2e9-575a32ef2bff","resolution":{"observed_at":"2026-07-08T18:45:27.633922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T18:45:27.624496Z","title":"SmoothQuant: Accurate and efficient post-training quantization for large language models,","venue":null,"work_id":"2c25b17c-1b87-4d04-aef7-a8384a8df664","year":2023},"citing_paper":{"arxiv_id":"2605.27435","last_updated":"2026-05-22T10:39:35Z","snapshot_observed_at":"2026-08-08T01:27:25.329843Z","submitted_at":"2026-05-22T10:39:35Z","title":"When NPUs Are Not Always Faster: A Stage-Level Analysis of Mobile LLM Inference","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-30T15:03:31.289211Z"},"links":{"citing_paper":"/paper/2605.27435"},"observation_digest":"sha256:b0256f380cf38cf0f204919d6cbf177ba7f2c95868f9c59693f3ff35d47a09e1","observation_id":"889cde39-ecb6-414b-b0ff-bda5ba117faa","resolution":{"observed_at":"2026-07-08T18:45:27.625882Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04330","last_updated":"2024-11-30T02:42:31Z","snapshot_observed_at":"2026-08-18T06:31:48.022505Z","submitted_at":"2024-11-07T00:10:10Z","title":"Scaling Laws for Precision","version":2},"cited_work":{"arxiv_id":"2411.04330","doi":"10.48550/arxiv.2411.04330","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.04330","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spector, Blake Bordelon, Niklas Muennighoff, Mansheej Paul, Cengiz Pehlevan, Christopher Ré, and Aditi Raghunathan","venue":"arXiv (Cornell University)","work_id":"988bd25e-4ff9-47cd-89f4-f30e112706ec","year":2024},"citing_paper":{"arxiv_id":"2605.27435","last_updated":"2026-05-22T10:39:35Z","snapshot_observed_at":"2026-08-08T01:27:25.329843Z","submitted_at":"2026-05-22T10:39:35Z","title":"When NPUs Are Not Always Faster: A Stage-Level Analysis of Mobile LLM Inference","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-30T15:03:31.289211Z"},"links":{"cited_paper":"/paper/2411.04330","citing_paper":"/paper/2605.27435"},"observation_digest":"sha256:5d1cc56728a2a9de298c05d89d56bc0596c2a6167bb69c32c0f8d143e10cb820","observation_id":"d56d4330-afff-4cf2-b55b-6864e4d2789b","resolution":{"observed_at":"2026-06-30T15:04:46.177292Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T18:45:27.620828Z","title":"Efficient memory management for large language model serving with PagedAttention,","venue":null,"work_id":"aede8e1a-5ff6-422a-afc2-9fd2fedb7e67","year":2023},"citing_paper":{"arxiv_id":"2605.27435","last_updated":"2026-05-22T10:39:35Z","snapshot_observed_at":"2026-08-08T01:27:25.329843Z","submitted_at":"2026-05-22T10:39:35Z","title":"When NPUs Are Not Always Faster: A Stage-Level Analysis of Mobile LLM Inference","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-30T15:03:31.289211Z"},"links":{"citing_paper":"/paper/2605.27435"},"observation_digest":"sha256:043237b2571d6eccadd1d34a60413f7b4973c11e335d80f47b1237c75c23dcdd","observation_id":"21935cb9-172e-44a0-b139-cc05bb947124","resolution":{"observed_at":"2026-07-08T18:45:27.622158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T18:45:27.637538Z","title":"MLC-LLM: Universal llm deployment engine with ml com- pilation,","venue":null,"work_id":"fbd19d7b-0160-4fbf-8d99-e54bd068f1ed","year":2024},"citing_paper":{"arxiv_id":"2605.27435","last_updated":"2026-05-22T10:39:35Z","snapshot_observed_at":"2026-08-08T01:27:25.329843Z","submitted_at":"2026-05-22T10:39:35Z","title":"When NPUs Are Not Always Faster: A Stage-Level Analysis of Mobile LLM Inference","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-30T15:03:31.289211Z"},"links":{"citing_paper":"/paper/2605.27435"},"observation_digest":"sha256:bf0dded7cb887b0669640e56d4c1b59399fe0250a485f0b56449731f7493212f","observation_id":"16c7ed9f-6b6e-4285-a022-2b2a5177799d","resolution":{"observed_at":"2026-07-08T18:45:27.639236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T18:45:27.618965Z","title":"Fast on-device LLM inference with NPUs,","venue":null,"work_id":"e124b639-ce06-46b3-a5a8-176b345dcf37","year":2025},"citing_paper":{"arxiv_id":"2605.27435","last_updated":"2026-05-22T10:39:35Z","snapshot_observed_at":"2026-08-08T01:27:25.329843Z","submitted_at":"2026-05-22T10:39:35Z","title":"When NPUs Are Not Always Faster: A Stage-Level Analysis of Mobile LLM Inference","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-30T15:03:31.289211Z"},"links":{"citing_paper":"/paper/2605.27435"},"observation_digest":"sha256:f6354809ee642ba6ea5c696ebd242d8bc654e2502f5d5258b0cc4f36fb9a4071","observation_id":"193de604-d52b-485a-9bf1-930be28d0665","resolution":{"observed_at":"2026-07-08T18:45:27.620264Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06282","last_updated":"2024-12-12T12:24:18Z","snapshot_observed_at":"2026-08-19T12:44:37.940022Z","submitted_at":"2024-06-10T14:01:21Z","title":"PowerInfer-2: Fast Large Language Model Inference on a Smartphone","version":3},"cited_work":{"arxiv_id":"2406.06282","doi":"10.48550/arxiv.2406.06282","metadata_source":"pith","pith_arxiv_id":"2406.06282","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Powerinfer-2: Fast large language model inference on a smartphone","venue":"cs.LG","work_id":"c835ae36-bf61-4365-8156-febeba198d32","year":2024},"citing_paper":{"arxiv_id":"2605.27435","last_updated":"2026-05-22T10:39:35Z","snapshot_observed_at":"2026-08-08T01:27:25.329843Z","submitted_at":"2026-05-22T10:39:35Z","title":"When NPUs Are Not Always Faster: A Stage-Level Analysis of Mobile LLM Inference","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-30T15:03:31.289211Z"},"links":{"cited_paper":"/paper/2406.06282","citing_paper":"/paper/2605.27435"},"observation_digest":"sha256:2842c03b74367aab8b361c9073cfbf6738c80ef48a8410ababc40a5bf0bc7ebb","observation_id":"e6e60fec-694c-40db-a75a-e7b687591a5c","resolution":{"observed_at":"2026-06-30T15:04:46.182427Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T18:45:27.622663Z","title":"Flightllm: Efficient large language model inference with a complete mapping flow on FPGAs,","venue":null,"work_id":"4aa6cc65-52fa-47e9-90da-1fd617bdaffb","year":2024},"citing_paper":{"arxiv_id":"2605.27435","last_updated":"2026-05-22T10:39:35Z","snapshot_observed_at":"2026-08-08T01:27:25.329843Z","submitted_at":"2026-05-22T10:39:35Z","title":"When NPUs Are Not Always Faster: A Stage-Level Analysis of Mobile LLM Inference","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-30T15:03:31.289211Z"},"links":{"citing_paper":"/paper/2605.27435"},"observation_digest":"sha256:1f53e6933194b5e9b485dc33459359986d8b03ee03ca037e2ffbd4f8d1905465","observation_id":"f1bbf492-22d1-4b26-89be-f67b6f343da2","resolution":{"observed_at":"2026-07-08T18:45:27.624019Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.02328","last_updated":"2022-04-06T15:54:44Z","snapshot_observed_at":"2026-08-16T19:01:05.896445Z","submitted_at":"2020-12-03T23:29:03Z","title":"MLPerf Mobile Inference Benchmark","version":4},"cited_work":{"arxiv_id":"2012.02328","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2012.02328","snapshot_observed_at":"2026-06-30T15:04:46.178348Z","title":"MLPerf mobile inference benchmark,","venue":null,"work_id":"a4609c91-e1a7-47eb-a9cc-102dc1bd5301","year":2012},"citing_paper":{"arxiv_id":"2605.27435","last_updated":"2026-05-22T10:39:35Z","snapshot_observed_at":"2026-08-08T01:27:25.329843Z","submitted_at":"2026-05-22T10:39:35Z","title":"When NPUs Are Not Always Faster: A Stage-Level Analysis of Mobile LLM Inference","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-30T15:03:31.289211Z"},"links":{"cited_paper":"/paper/2012.02328","citing_paper":"/paper/2605.27435"},"observation_digest":"sha256:c10c9ad050310c85226ef6f1b98e31494c1e9623e26dc7d28cc2e9cdadb1a264","observation_id":"f0ba2ee1-1d48-4343-abd1-db478141dbaf","resolution":{"observed_at":"2026-06-30T15:04:46.179771Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T18:45:27.641598Z","title":"Characterizing mobile SoC for accelerating heterogeneous LLM inference,","venue":null,"work_id":"c1f7f056-fe4e-4098-ab3e-fc0735462bf4","year":2025},"citing_paper":{"arxiv_id":"2605.27435","last_updated":"2026-05-22T10:39:35Z","snapshot_observed_at":"2026-08-08T01:27:25.329843Z","submitted_at":"2026-05-22T10:39:35Z","title":"When NPUs Are Not Always Faster: A Stage-Level Analysis of Mobile LLM Inference","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-30T15:03:31.289211Z"},"links":{"citing_paper":"/paper/2605.27435"},"observation_digest":"sha256:a37061e69927589f684f4d3b73ea76da66bd2424dd48269c507a575080bbce95","observation_id":"5d1dd023-4a81-4d4f-8038-6656acde83c4","resolution":{"observed_at":"2026-07-08T18:45:27.642901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.23324","doi":"10.48550/arxiv.2509.23324","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling llm test-time compute with mobile npu on smart- phones","venue":"arXiv (Cornell University)","work_id":"3454c8cc-d2a3-42ef-9979-fce84d142057","year":2025},"citing_paper":{"arxiv_id":"2605.27435","last_updated":"2026-05-22T10:39:35Z","snapshot_observed_at":"2026-08-08T01:27:25.329843Z","submitted_at":"2026-05-22T10:39:35Z","title":"When NPUs Are Not Always Faster: A Stage-Level Analysis of Mobile LLM Inference","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-30T15:03:31.289211Z"},"links":{"citing_paper":"/paper/2605.27435"},"observation_digest":"sha256:4ce37feadaa775932e62d0fcc68c07c03adcd18adac7bb656f9a0e00f0aac9be","observation_id":"579fe8a0-dfef-46b8-ac71-1e6ab1fd8449","resolution":{"observed_at":"2026-06-30T15:04:46.187806Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06461","last_updated":"2025-05-09T23:05:53Z","snapshot_observed_at":"2026-08-19T14:32:59.371179Z","submitted_at":"2025-05-09T23:05:53Z","title":"Challenging GPU Dominance: When CPUs Outperform for On-Device LLM Inference","version":1},"cited_work":{"arxiv_id":"2505.06461","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.06461","snapshot_observed_at":"2026-06-30T15:04:46.189133Z","title":"Challenging GPU dominance: When CPUs outperform for on-device LLM inference,","venue":null,"work_id":"77dc9657-894f-4c7f-856e-bb6ecdd26747","year":2025},"citing_paper":{"arxiv_id":"2605.27435","last_updated":"2026-05-22T10:39:35Z","snapshot_observed_at":"2026-08-08T01:27:25.329843Z","submitted_at":"2026-05-22T10:39:35Z","title":"When NPUs Are Not Always Faster: A Stage-Level Analysis of Mobile LLM Inference","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-30T15:03:31.289211Z"},"links":{"cited_paper":"/paper/2505.06461","citing_paper":"/paper/2605.27435"},"observation_digest":"sha256:6663a2d4c10a4db7f9596275e5e7d7c4afdfd8e1eab187013ae4d87dec2d37ff","observation_id":"6613b2e4-7add-4248-9952-8a083720d293","resolution":{"observed_at":"2026-06-30T15:04:46.190798Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T18:45:27.639798Z","title":"llama.cpp: Llm inference in c/c++,","venue":null,"work_id":"8c55e97e-840c-43c2-a70c-606036fc88e7","year":2023},"citing_paper":{"arxiv_id":"2605.27435","last_updated":"2026-05-22T10:39:35Z","snapshot_observed_at":"2026-08-08T01:27:25.329843Z","submitted_at":"2026-05-22T10:39:35Z","title":"When NPUs Are Not Always Faster: A Stage-Level Analysis of Mobile LLM Inference","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-30T15:03:31.289211Z"},"links":{"citing_paper":"/paper/2605.27435"},"observation_digest":"sha256:4ae4b0473567286a72327435b6bff874d83928013bf70c2033c3ed516f962824","observation_id":"6df9f1df-40f1-4179-8587-ec2d85c833c9","resolution":{"observed_at":"2026-07-08T18:45:27.641047Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.27435","last_updated":"2026-05-22T10:39:35Z","latest_version":1,"primary_category":"cs.AR","snapshot_observed_at":"2026-08-08T01:27:25.329843Z","submitted_at":"2026-05-22T10:39:35Z","title":"When NPUs Are Not Always Faster: A Stage-Level Analysis of Mobile LLM Inference"},"reference_resolution":{"displayed":18,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":0,"verified_exact":7,"verified_fuzzy":10},"total_outbound_references":18},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 18 of 18 outbound references and 0 inbound Pith citation observations for arXiv:2605.27435."}