{"as_of":"2026-08-17T02:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ecb4e9ce6f66bf089c1076918818f45f6a0702c48fe6e5b3f67c2d052876a9b6","coverage":[{"denominator":59,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T04:51:31.541760Z","state":"measured"},{"denominator":60,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":60,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:57:30.372775Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-15T20:57:30.733875Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.00232","last_updated":"2025-05-01T00:44:13Z","snapshot_observed_at":"2026-08-16T04:45:07.395209Z","submitted_at":"2025-05-01T00:44:13Z","title":"Scaling On-Device GPU Inference for Large Generative Models","version":1},"cited_work":{"arxiv_id":"2505.00232","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.00232","snapshot_observed_at":"2026-08-15T20:57:30.733875Z","title":"Scaling On-Device GPU Inference for Large Generative Models","venue":"cs.LG","work_id":"a26791e0-6e24-4fee-ae8d-0a067a2e4c84","year":2025},"citing_paper":{"arxiv_id":"2505.11417","last_updated":"2025-05-16T16:29:21Z","snapshot_observed_at":"2026-08-17T01:55:42.600832Z","submitted_at":"2025-05-16T16:29:21Z","title":"EdgeWisePersona: A Dataset for On-Device User Profiling from Natural Language Interactions","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T20:57:30.372775Z"},"links":{"cited_paper":"/paper/2505.00232","citing_paper":"/paper/2505.11417"},"observation_digest":"sha256:849434ff65bf94040f4190a5ee4869029d65ee5b1d29140634ee7c182f7f1f71","observation_id":"035f8d65-6761-4107-896c-35502c5af71f","resolution":{"observed_at":"2026-08-15T20:57:30.740928Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.00232/citation-record","integrity":"/paper/2505.00232/integrity","json":"/paper/2505.00232/citation-record.json","paper":"/paper/2505.00232"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:51:32.223209Z","title":"The Khronos Group Inc., 2019","venue":null,"work_id":"0239b19e-08bd-497c-b630-4aaf9426b2b4","year":2019},"citing_paper":{"arxiv_id":"2505.00232","last_updated":"2025-05-01T00:44:13Z","snapshot_observed_at":"2026-08-16T04:45:07.395209Z","submitted_at":"2025-05-01T00:44:13Z","title":"Scaling On-Device GPU Inference for Large Generative Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T04:51:31.326199Z"},"links":{"citing_paper":"/paper/2505.00232"},"observation_digest":"sha256:fb3dee9563137ff4520806e870cc47ed0fa8594df5b3f97669d39d784fe5ce11","observation_id":"8a6ea8cf-7f83-451e-b584-6b4e92d8fb08","resolution":{"observed_at":"2026-08-16T04:51:32.226757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:51:32.212554Z","title":"The Khronos Group Inc., 2025","venue":null,"work_id":"c5da3856-e50b-4dc9-aeb0-b04c32c06756","year":2025},"citing_paper":{"arxiv_id":"2505.00232","last_updated":"2025-05-01T00:44:13Z","snapshot_observed_at":"2026-08-16T04:45:07.395209Z","submitted_at":"2025-05-01T00:44:13Z","title":"Scaling On-Device GPU Inference for Large Generative Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T04:51:31.330309Z"},"links":{"citing_paper":"/paper/2505.00232"},"observation_digest":"sha256:ecc9a69e8977f1a286d3a121d3ea2669fbaad86b7a66957dc69e2e4b570db587","observation_id":"84050aef-ddba-42d5-b04b-ecb0c3593d90","resolution":{"observed_at":"2026-08-16T04:51:32.216060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:51:32.201914Z","title":"AMD ROCm Soft- ware","venue":null,"work_id":"3dda1f9d-1e25-425d-84ce-39e66ac8fca8","year":2025},"citing_paper":{"arxiv_id":"2505.00232","last_updated":"2025-05-01T00:44:13Z","snapshot_observed_at":"2026-08-16T04:45:07.395209Z","submitted_at":"2025-05-01T00:44:13Z","title":"Scaling On-Device GPU Inference for Large Generative Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T04:51:31.333808Z"},"links":{"citing_paper":"/paper/2505.00232"},"observation_digest":"sha256:60881da2147a5136632805633f61003955a9e14b93dfb8306fe5d7b99098c7c2","observation_id":"64e918cc-7901-4b36-ac95-2d2349573ec9","resolution":{"observed_at":"2026-08-16T04:51:32.205450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:51:32.191176Z","title":"LLM in a flash: Effi- cient Large Language Model Inference with Limited Mem- ory, 2024","venue":null,"work_id":"e045d97c-a54e-450c-9e5f-36c422d758f8","year":2024},"citing_paper":{"arxiv_id":"2505.00232","last_updated":"2025-05-01T00:44:13Z","snapshot_observed_at":"2026-08-16T04:45:07.395209Z","submitted_at":"2025-05-01T00:44:13Z","title":"Scaling On-Device GPU Inference for Large Generative Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T04:51:31.337188Z"},"links":{"citing_paper":"/paper/2505.00232"},"observation_digest":"sha256:79b11c4bfb0800436e9f8f520e0d00e1ce28e6fdf023ce8ecf0438d0e57c40ea","observation_id":"35619c9e-5e6b-4bf3-80c4-cf0862e6fb69","resolution":{"observed_at":"2026-08-16T04:51:32.195166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:51:32.181158Z","title":"Core ML Stable Diffusion","venue":null,"work_id":"5d61f5fe-5b2a-4803-a326-db0a25dd4f21","year":2025},"citing_paper":{"arxiv_id":"2505.00232","last_updated":"2025-05-01T00:44:13Z","snapshot_observed_at":"2026-08-16T04:45:07.395209Z","submitted_at":"2025-05-01T00:44:13Z","title":"Scaling On-Device GPU Inference for Large Generative Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T04:51:31.340853Z"},"links":{"citing_paper":"/paper/2505.00232"},"observation_digest":"sha256:4f0f200f0bcf06e61e4f70a8a8b9c4399418024f59969f51321ece8af232a4f1","observation_id":"50f83bf4-3208-4146-9e8f-0d8a1022d446","resolution":{"observed_at":"2026-08-16T04:51:32.184617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:51:32.170941Z","title":null,"venue":null,"work_id":"3ac17250-98a7-46b0-90ca-3fc0548b30ba","year":2025},"citing_paper":{"arxiv_id":"2505.00232","last_updated":"2025-05-01T00:44:13Z","snapshot_observed_at":"2026-08-16T04:45:07.395209Z","submitted_at":"2025-05-01T00:44:13Z","title":"Scaling On-Device GPU Inference for Large Generative Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T04:51:31.343987Z"},"links":{"citing_paper":"/paper/2505.00232"},"observation_digest":"sha256:1435ddb5ac7c5178ce935cefd4c17778d0510f99d6aae4de19d9721019d6731d","observation_id":"1600da46-e464-4788-8bf6-58925191c0e6","resolution":{"observed_at":"2026-08-16T04:51:32.174494Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:51:32.160339Z","title":"Compute Library","venue":null,"work_id":"19f75e87-c0ce-4967-987f-87d3aa28c023","year":2025},"citing_paper":{"arxiv_id":"2505.00232","last_updated":"2025-05-01T00:44:13Z","snapshot_observed_at":"2026-08-16T04:45:07.395209Z","submitted_at":"2025-05-01T00:44:13Z","title":"Scaling On-Device GPU Inference for Large Generative Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T04:51:31.347636Z"},"links":{"citing_paper":"/paper/2505.00232"},"observation_digest":"sha256:874657483b6efa1f4bf66c7035096fef681725147af2c32ada8ca17f5787023c","observation_id":"03b334a5-6335-4ae8-a223-c2118fe97de6","resolution":{"observed_at":"2026-08-16T04:51:32.163667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:51:32.149964Z","title":"TVM: An automated End-to-End optimizing com- piler for deep learning","venue":null,"work_id":"4a8bb17b-3e38-409b-8ac1-b49445fa5945","year":2018},"citing_paper":{"arxiv_id":"2505.00232","last_updated":"2025-05-01T00:44:13Z","snapshot_observed_at":"2026-08-16T04:45:07.395209Z","submitted_at":"2025-05-01T00:44:13Z","title":"Scaling On-Device GPU Inference for Large Generative Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T04:51:31.350756Z"},"links":{"citing_paper":"/paper/2505.00232"},"observation_digest":"sha256:b7297c36d307a1c6f22583bfe06f9e7f91e05d70d59027201a42a250b7bd4d91","observation_id":"3a2aac5d-634a-4b7f-9068-6a346dbb38e6","resolution":{"observed_at":"2026-08-16T04:51:32.153440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:51:32.139117Z","title":"Speed Is All You Need: On-Device Acceleration of Large Diffusion Models via GPU-Aware Optimizations, 2023","venue":null,"work_id":"773b64ee-65ce-4b0a-a86a-3a2e757495c3","year":2023},"citing_paper":{"arxiv_id":"2505.00232","last_updated":"2025-05-01T00:44:13Z","snapshot_observed_at":"2026-08-16T04:45:07.395209Z","submitted_at":"2025-05-01T00:44:13Z","title":"Scaling On-Device GPU Inference for Large Generative Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T04:51:31.353895Z"},"links":{"citing_paper":"/paper/2505.00232"},"observation_digest":"sha256:190a8cf43162dfdf5705923298bec2a79572c1646f5e9d76bd21b4d0604d2bd6","observation_id":"ea88d8f3-31d9-4065-b0a5-4af7c03d8324","resolution":{"observed_at":"2026-08-16T04:51:32.143000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:51:32.129370Z","title":"LMDeploy: A Toolkit for Com- pressing, Deploying, and Serving LLM","venue":null,"work_id":"48c4fd0f-a816-4ed6-b112-cc09eed5b683","year":2023},"citing_paper":{"arxiv_id":"2505.00232","last_updated":"2025-05-01T00:44:13Z","snapshot_observed_at":"2026-08-16T04:45:07.395209Z","submitted_at":"2025-05-01T00:44:13Z","title":"Scaling On-Device GPU Inference for Large Generative Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T04:51:31.356758Z"},"links":{"citing_paper":"/paper/2505.00232"},"observation_digest":"sha256:841e50d5c7121c5c1d266ef535ee15c88edee63ce6bc5d2f5f5b22bd3e92c69d","observation_id":"1bb45ed1-17a1-458f-8cd6-cb1221f0cc8f","resolution":{"observed_at":"2026-08-16T04:51:32.132514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:51:32.119237Z","title":"Fu, Stefano Ermon, Atri Rudra, and Christopher R´e","venue":null,"work_id":"140bc731-7e08-421e-acec-4526cdb89492","year":2022},"citing_paper":{"arxiv_id":"2505.00232","last_updated":"2025-05-01T00:44:13Z","snapshot_observed_at":"2026-08-16T04:45:07.395209Z","submitted_at":"2025-05-01T00:44:13Z","title":"Scaling On-Device GPU Inference for Large Generative Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T04:51:31.359871Z"},"links":{"citing_paper":"/paper/2505.00232"},"observation_digest":"sha256:8069ff74b335ded78c25605c2d29a892101b666926b8ce801a8558a4abea9f55","observation_id":"a02154a5-1f7c-46cc-85ef-d54b8eef9de5","resolution":{"observed_at":"2026-08-16T04:51:32.122766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-16T09:25:53.087782Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-16T04:51:31.363141Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.00232","last_updated":"2025-05-01T00:44:13Z","snapshot_observed_at":"2026-08-16T04:45:07.395209Z","submitted_at":"2025-05-01T00:44:13Z","title":"Scaling On-Device GPU Inference for Large Generative Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T04:51:31.363141Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2505.00232"},"observation_digest":"sha256:1c9687a7fde35da599c9f59410a56174a8ed796748f4cc636ca10b7c4e51454c","observation_id":"d1287604-d0ae-4cfc-aa76-73f52a5097b6","resolution":{"observed_at":"2026-08-16T04:51:31.363141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:51:32.106984Z","title":"GPTQ: Accurate Post-Training Quantization for Gen- erative Pre-trained Transformers, 2023","venue":null,"work_id":"feca3a62-455a-4af5-b1e0-f9e7e0fed8dd","year":2023},"citing_paper":{"arxiv_id":"2505.00232","last_updated":"2025-05-01T00:44:13Z","snapshot_observed_at":"2026-08-16T04:45:07.395209Z","submitted_at":"2025-05-01T00:44:13Z","title":"Scaling On-Device GPU Inference for Large Generative Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T04:51:31.367086Z"},"links":{"citing_paper":"/paper/2505.00232"},"observation_digest":"sha256:ee30bd280c0f66e0f7f2d54ce10ecdcb38f9068a0580017092a326bc4b7f2461","observation_id":"677ff3df-9209-451b-a302-346cbdb2a438","resolution":{"observed_at":"2026-08-16T04:51:32.111893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:51:32.094773Z","title":"Gemma 2: Improving Open Language Mod- els at a Practical Size, 2024","venue":null,"work_id":"a7df04b4-8ed1-4332-adc8-6877e34165af","year":2024},"citing_paper":{"arxiv_id":"2505.00232","last_updated":"2025-05-01T00:44:13Z","snapshot_observed_at":"2026-08-16T04:45:07.395209Z","submitted_at":"2025-05-01T00:44:13Z","title":"Scaling On-Device GPU Inference for Large Generative Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T04:51:31.370650Z"},"links":{"citing_paper":"/paper/2505.00232"},"observation_digest":"sha256:9c72469edb55a6fc0f9f92836e456f20efd32b7b8383833507eefaa3f94f592f","observation_id":"02d036d3-af8f-4eee-b43d-c27a107cd2d7","resolution":{"observed_at":"2026-08-16T04:51:32.099149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:51:32.082153Z","title":"Gemma: Open Models Based on Gemini Research and Technology, 2024","venue":null,"work_id":"48dbd899-3831-4367-bf6d-5c4b86869f7e","year":2024},"citing_paper":{"arxiv_id":"2505.00232","last_updated":"2025-05-01T00:44:13Z","snapshot_observed_at":"2026-08-16T04:45:07.395209Z","submitted_at":"2025-05-01T00:44:13Z","title":"Scaling On-Device GPU Inference for Large Generative Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T04:51:31.374881Z"},"links":{"citing_paper":"/paper/2505.00232"},"observation_digest":"sha256:4eade257f55bd2a2500401c69a31801a5b37bfb455ed1f7e715c36aaeedb5e9c","observation_id":"c7015efd-80bd-4314-9f32-01401939d2b7","resolution":{"observed_at":"2026-08-16T04:51:32.085958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:51:32.071242Z","title":"llama.cpp","venue":null,"work_id":"175dd877-2eda-4b68-8070-549860e8e86e","year":2025},"citing_paper":{"arxiv_id":"2505.00232","last_updated":"2025-05-01T00:44:13Z","snapshot_observed_at":"2026-08-16T04:45:07.395209Z","submitted_at":"2025-05-01T00:44:13Z","title":"Scaling On-Device GPU Inference for Large Generative Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T04:51:31.379167Z"},"links":{"citing_paper":"/paper/2505.00232"},"observation_digest":"sha256:80cd84be5fe3854312c6c5418e7b7f3f7efc6e3b06077fc7ca995d92ca890d6c","observation_id":"0aea38be-4609-4085-89ad-90ae866ed3ee","resolution":{"observed_at":"2026-08-16T04:51:32.075012Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:51:32.059645Z","title":null,"venue":null,"work_id":"6cc0a570-0834-445a-b7e7-6308a12f1e66","year":2025},"citing_paper":{"arxiv_id":"2505.00232","last_updated":"2025-05-01T00:44:13Z","snapshot_observed_at":"2026-08-16T04:45:07.395209Z","submitted_at":"2025-05-01T00:44:13Z","title":"Scaling On-Device GPU Inference for Large Generative Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T04:51:31.383046Z"},"links":{"citing_paper":"/paper/2505.00232"},"observation_digest":"sha256:b3a25b7f83069a5661b2592f2216695dfb76ebce46101f3e3fd63a939210384a","observation_id":"6e8b1186-d337-49c2-8e95-ddfdba6a5788","resolution":{"observed_at":"2026-08-16T04:51:32.064032Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:51:32.048824Z","title":"LiteRT Overview","venue":null,"work_id":"3c35d641-2c18-4413-955b-e56c147ae5c7","year":2025},"citing_paper":{"arxiv_id":"2505.00232","last_updated":"2025-05-01T00:44:13Z","snapshot_observed_at":"2026-08-16T04:45:07.395209Z","submitted_at":"2025-05-01T00:44:13Z","title":"Scaling On-Device GPU Inference for Large Generative Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T04:51:31.387319Z"},"links":{"citing_paper":"/paper/2505.00232"},"observation_digest":"sha256:adb63c6dc778701e4ef024a61668f453d122f22d484aa297ddfb0323af5f695e","observation_id":"be793fe5-21cb-4c21-858d-104d7958d003","resolution":{"observed_at":"2026-08-16T04:51:32.052536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:51:32.035713Z","title":"Huawei HiAI","venue":null,"work_id":"bb9aa5c4-1a6e-415c-946a-2467cd286d2c","year":2025},"citing_paper":{"arxiv_id":"2505.00232","last_updated":"2025-05-01T00:44:13Z","snapshot_observed_at":"2026-08-16T04:45:07.395209Z","submitted_at":"2025-05-01T00:44:13Z","title":"Scaling On-Device GPU Inference for Large Generative Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T04:51:31.392090Z"},"links":{"citing_paper":"/paper/2505.00232"},"observation_digest":"sha256:336ab7b2466b7d4dd6e178ad56c3981d43a61492870baa891898029270082b86","observation_id":"4f96f6ab-f0fe-43a4-a47c-bdc7b9ba331f","resolution":{"observed_at":"2026-08-16T04:51:32.038995Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:51:32.026031Z","title":null,"venue":null,"work_id":"24286c02-765b-45dd-9634-4459560369c1","year":2025},"citing_paper":{"arxiv_id":"2505.00232","last_updated":"2025-05-01T00:44:13Z","snapshot_observed_at":"2026-08-16T04:45:07.395209Z","submitted_at":"2025-05-01T00:44:13Z","title":"Scaling On-Device GPU Inference for Large Generative Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T04:51:31.396993Z"},"links":{"citing_paper":"/paper/2505.00232"},"observation_digest":"sha256:e0d5a084852ef227bc2c0e58da1ca4451de8f76b4c9c7925297ee3b6f05f514e","observation_id":"4c372e43-57e6-4f94-a62a-e31759ed6572","resolution":{"observed_at":"2026-08-16T04:51:32.029100Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:51:32.014963Z","title":"OpenVINO","venue":null,"work_id":"d7be2a19-acb7-41a0-a077-363c76a238ce","year":2025},"citing_paper":{"arxiv_id":"2505.00232","last_updated":"2025-05-01T00:44:13Z","snapshot_observed_at":"2026-08-16T04:45:07.395209Z","submitted_at":"2025-05-01T00:44:13Z","title":"Scaling On-Device GPU Inference for Large Generative Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T04:51:31.401664Z"},"links":{"citing_paper":"/paper/2505.00232"},"observation_digest":"sha256:a1638a172792c10f40b13d3b5d74dfb3115a8dbcbdddf990a1bfb708ef830b41","observation_id":"a88a2194-250a-488e-9509-80693c5284fe","resolution":{"observed_at":"2026-08-16T04:51:32.018800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:51:32.004058Z","title":"Intel Core Ultra Series 2 Media Deck","venue":null,"work_id":"06d692da-f379-403e-873d-fce434536259","year":2024},"citing_paper":{"arxiv_id":"2505.00232","last_updated":"2025-05-01T00:44:13Z","snapshot_observed_at":"2026-08-16T04:45:07.395209Z","submitted_at":"2025-05-01T00:44:13Z","title":"Scaling On-Device GPU Inference for Large Generative Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T04:51:31.405781Z"},"links":{"citing_paper":"/paper/2505.00232"},"observation_digest":"sha256:3eeb8f6e8a3c24f1a27b721f8f047974878e1d7045fd9556b81aec739b589e44","observation_id":"9ac07930-d5b7-4318-8149-b9713f0d4c83","resolution":{"observed_at":"2026-08-16T04:51:32.007819Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:51:31.993273Z","title":null,"venue":null,"work_id":"24e44edb-95dd-43db-a71f-50338a9219c1","year":2025},"citing_paper":{"arxiv_id":"2505.00232","last_updated":"2025-05-01T00:44:13Z","snapshot_observed_at":"2026-08-16T04:45:07.395209Z","submitted_at":"2025-05-01T00:44:13Z","title":"Scaling On-Device GPU Inference for Large Generative Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T04:51:31.411970Z"},"links":{"citing_paper":"/paper/2505.00232"},"observation_digest":"sha256:18dc1e80a9e5d8ccc58abc65181e9c4d984082e3f39c3638e51807b8b2a615e4","observation_id":"64a14253-3f9a-4fb7-ba60-b5f0216bb40d","resolution":{"observed_at":"2026-08-16T04:51:31.996993Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.12418","last_updated":"2020-02-27T20:03:16Z","snapshot_observed_at":"2026-08-16T11:32:44.645888Z","submitted_at":"2020-02-27T20:03:16Z","title":"MNN: A Universal and Efficient Inference Engine","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.12418","snapshot_observed_at":"2026-08-16T04:51:31.415946Z","title":"MNN: A Universal and Efficient Inference Engine","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2505.00232","last_updated":"2025-05-01T00:44:13Z","snapshot_observed_at":"2026-08-16T04:45:07.395209Z","submitted_at":"2025-05-01T00:44:13Z","title":"Scaling On-Device GPU Inference for Large Generative Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T04:51:31.415946Z"},"links":{"cited_paper":"/paper/2002.12418","citing_paper":"/paper/2505.00232"},"observation_digest":"sha256:e5aaebf974d7fd9a767de6bedfd70208b914e77af4d9994aff4f854c5a199c4f","observation_id":"5171003c-2e67-4fdb-8567-d34c505fe892","resolution":{"observed_at":"2026-08-16T04:51:31.415946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:51:31.982105Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":"4796ab5a-9906-4581-93c0-14abc845962d","year":2023},"citing_paper":{"arxiv_id":"2505.00232","last_updated":"2025-05-01T00:44:13Z","snapshot_observed_at":"2026-08-16T04:45:07.395209Z","submitted_at":"2025-05-01T00:44:13Z","title":"Scaling On-Device GPU Inference for Large Generative Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T04:51:31.420135Z"},"links":{"citing_paper":"/paper/2505.00232"},"observation_digest":"sha256:6dbfadfa638da89e6c8e06a56b7f97a852c682c290dda8a398d8c6a4d5e4977b","observation_id":"f28ca99f-b57a-461b-8dde-39ac0ab86c1f","resolution":{"observed_at":"2026-08-16T04:51:31.985623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:51:31.970805Z","title":"On-Device Neu- ral Net Inference with Mobile GPUs","venue":null,"work_id":"82e05135-7856-49b7-a5b8-87dbb87e86eb","year":2019},"citing_paper":{"arxiv_id":"2505.00232","last_updated":"2025-05-01T00:44:13Z","snapshot_observed_at":"2026-08-16T04:45:07.395209Z","submitted_at":"2025-05-01T00:44:13Z","title":"Scaling On-Device GPU Inference for Large Generative Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T04:51:31.424276Z"},"links":{"citing_paper":"/paper/2505.00232"},"observation_digest":"sha256:f4e299b2670920721164da517b2947792b6920e2603f9492d338d5239ca5038a","observation_id":"01410587-29d5-48ee-a2fe-8319d24df45f","resolution":{"observed_at":"2026-08-16T04:51:31.974737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:51:31.959166Z","title":"OpenGL ES Version 3.1","venue":null,"work_id":"67f899a4-62f8-4602-9e25-e764eaf64f5c","year":2016},"citing_paper":{"arxiv_id":"2505.00232","last_updated":"2025-05-01T00:44:13Z","snapshot_observed_at":"2026-08-16T04:45:07.395209Z","submitted_at":"2025-05-01T00:44:13Z","title":"Scaling On-Device GPU Inference for Large Generative Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T04:51:31.427827Z"},"links":{"citing_paper":"/paper/2505.00232"},"observation_digest":"sha256:de1c54d0a35852d109c7d768f819d5436b265797ffed1c92a5ffbd06be6dd76e","observation_id":"6ac4ea48-9622-4f7b-92d0-760a9b383d46","resolution":{"observed_at":"2026-08-16T04:51:31.963044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:51:31.948546Z","title":"Fast In- ference from Transformers via Speculative Decoding, 2023","venue":null,"work_id":"56b04c60-2c5b-4faf-a226-8b87eb948a81","year":2023},"citing_paper":{"arxiv_id":"2505.00232","last_updated":"2025-05-01T00:44:13Z","snapshot_observed_at":"2026-08-16T04:45:07.395209Z","submitted_at":"2025-05-01T00:44:13Z","title":"Scaling On-Device GPU Inference for Large Generative Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T04:51:31.431461Z"},"links":{"citing_paper":"/paper/2505.00232"},"observation_digest":"sha256:0e458cf1fbe1d115cd55b29609fdf1d07f5e25ea7e73bf7d53134ae9d469e6f7","observation_id":"b7b87274-5c91-466f-82f3-535ef56f05ce","resolution":{"observed_at":"2026-08-16T04:51:31.951919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:51:31.939159Z","title":"AWQ: Activation-aware Weight Quantization for LLM Compression and Accelera- tion","venue":null,"work_id":"d882d63d-6f08-4fd0-a025-ae36167c342d","year":2024},"citing_paper":{"arxiv_id":"2505.00232","last_updated":"2025-05-01T00:44:13Z","snapshot_observed_at":"2026-08-16T04:45:07.395209Z","submitted_at":"2025-05-01T00:44:13Z","title":"Scaling On-Device GPU Inference for Large Generative Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T04:51:31.435413Z"},"links":{"citing_paper":"/paper/2505.00232"},"observation_digest":"sha256:d746cd92352eddd65758c7abebc69b90a762ead349b0328f1f7a04c703b269f9","observation_id":"48103cb2-cd68-40b7-8954-9ca3ef371738","resolution":{"observed_at":"2026-08-16T04:51:31.942289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:51:31.929044Z","title":"The Llama 3 Herd of Models, 2024","venue":null,"work_id":"bbf62c34-8996-47ea-96e2-1adbbb909bfc","year":2024},"citing_paper":{"arxiv_id":"2505.00232","last_updated":"2025-05-01T00:44:13Z","snapshot_observed_at":"2026-08-16T04:45:07.395209Z","submitted_at":"2025-05-01T00:44:13Z","title":"Scaling On-Device GPU Inference for Large Generative Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T04:51:31.438744Z"},"links":{"citing_paper":"/paper/2505.00232"},"observation_digest":"sha256:1b973c7f7e84af193a6dbd74e97648c0d956c8aae41dafea7c9e2c0ac26eef79","observation_id":"d5a778d6-56d8-4ef9-88ce-5d00b8bba3a9","resolution":{"observed_at":"2026-08-16T04:51:31.932892Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:51:31.917427Z","title":"DeepMon: Mobile GPU-based Deep Learning Framework for Continuous Vision Applications","venue":null,"work_id":"fc854b42-0799-4786-8864-8bebc22a3a09","year":2017},"citing_paper":{"arxiv_id":"2505.00232","last_updated":"2025-05-01T00:44:13Z","snapshot_observed_at":"2026-08-16T04:45:07.395209Z","submitted_at":"2025-05-01T00:44:13Z","title":"Scaling On-Device GPU Inference for Large Generative Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T04:51:31.442284Z"},"links":{"citing_paper":"/paper/2505.00232"},"observation_digest":"sha256:e089866e4f9840d74c7e526f1aa1b93ab7f52dcbd75b1541e546128763a58cd9","observation_id":"39867c08-cad7-418b-bd15-3f6fba21ecca","resolution":{"observed_at":"2026-08-16T04:51:31.921260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:51:31.906088Z","title":"NeuroPilot","venue":null,"work_id":"b450a5bc-bf9d-4f4a-b89d-56549435b1b2","year":2025},"citing_paper":{"arxiv_id":"2505.00232","last_updated":"2025-05-01T00:44:13Z","snapshot_observed_at":"2026-08-16T04:45:07.395209Z","submitted_at":"2025-05-01T00:44:13Z","title":"Scaling On-Device GPU Inference for Large Generative Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T04:51:31.445790Z"},"links":{"citing_paper":"/paper/2505.00232"},"observation_digest":"sha256:70d26caff7c99f7119ea1ed14e4cdda1ce528db1d3e84dfa80a137cc5a7ba98c","observation_id":"bee3c6e9-0c36-4cf2-8a12-31c50c1489ac","resolution":{"observed_at":"2026-08-16T04:51:31.909923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:51:31.894613Z","title":"ExecuTorch","venue":null,"work_id":"bc269500-017a-45ab-9155-e7de96d44dea","year":2025},"citing_paper":{"arxiv_id":"2505.00232","last_updated":"2025-05-01T00:44:13Z","snapshot_observed_at":"2026-08-16T04:45:07.395209Z","submitted_at":"2025-05-01T00:44:13Z","title":"Scaling On-Device GPU Inference for Large Generative Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T04:51:31.449046Z"},"links":{"citing_paper":"/paper/2505.00232"},"observation_digest":"sha256:5d0ce33bf512f3a63e2806826c2f96832ce4348fe5f0c5ab0418c9be9338bbc8","observation_id":"c3ef5adf-bf8c-4145-8251-dab241f281a6","resolution":{"observed_at":"2026-08-16T04:51:31.898276Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:51:31.883491Z","title":"Llama 3.2: Revolutionizing edge AI and vision with open, customizable models","venue":null,"work_id":"fdf70234-8b81-44b1-951a-efe22e782eba","year":2024},"citing_paper":{"arxiv_id":"2505.00232","last_updated":"2025-05-01T00:44:13Z","snapshot_observed_at":"2026-08-16T04:45:07.395209Z","submitted_at":"2025-05-01T00:44:13Z","title":"Scaling On-Device GPU Inference for Large Generative Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T04:51:31.452475Z"},"links":{"citing_paper":"/paper/2505.00232"},"observation_digest":"sha256:e1af933726fe57dc3d4806f4b93a557ccd5d178c4513506d5475ace4e2574987","observation_id":"ac7b1861-7567-46ab-9388-0652468d864f","resolution":{"observed_at":"2026-08-16T04:51:31.887304Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:51:31.872177Z","title":"DirectML Overview","venue":null,"work_id":"529a6c7d-48ab-44fe-a7c2-9cbfaeade0b6","year":2025},"citing_paper":{"arxiv_id":"2505.00232","last_updated":"2025-05-01T00:44:13Z","snapshot_observed_at":"2026-08-16T04:45:07.395209Z","submitted_at":"2025-05-01T00:44:13Z","title":"Scaling On-Device GPU Inference for Large Generative Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T04:51:31.456091Z"},"links":{"citing_paper":"/paper/2505.00232"},"observation_digest":"sha256:f0267f2e9af851360a86569bb7c3aaf79207c55eb6452bfdbd78ea7b21d0627e","observation_id":"c0838d42-45f4-4b9e-a3a1-48effb96e14d","resolution":{"observed_at":"2026-08-16T04:51:31.876047Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:51:31.861401Z","title":"Get started with ONNX Run- time Mobile","venue":null,"work_id":"106275ec-47a6-4ff3-a887-03bb54da8fde","year":2025},"citing_paper":{"arxiv_id":"2505.00232","last_updated":"2025-05-01T00:44:13Z","snapshot_observed_at":"2026-08-16T04:45:07.395209Z","submitted_at":"2025-05-01T00:44:13Z","title":"Scaling On-Device GPU Inference for Large Generative Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T04:51:31.459461Z"},"links":{"citing_paper":"/paper/2505.00232"},"observation_digest":"sha256:6ceaf10470dbc1406b37e7bb240cb7b8e724938591328699b99c1aafd1893398","observation_id":"af0ad225-015b-4b94-b423-7c10975a72c6","resolution":{"observed_at":"2026-08-16T04:51:31.864756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:51:31.850467Z","title":"Stable Diffusion Op- timization with DirectML","venue":null,"work_id":"18e6a482-cc94-4ccf-a204-db8c3574be04","year":2025},"citing_paper":{"arxiv_id":"2505.00232","last_updated":"2025-05-01T00:44:13Z","snapshot_observed_at":"2026-08-16T04:45:07.395209Z","submitted_at":"2025-05-01T00:44:13Z","title":"Scaling On-Device GPU Inference for Large Generative Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T04:51:31.463215Z"},"links":{"citing_paper":"/paper/2505.00232"},"observation_digest":"sha256:fe429a5bf5b2a32acc8e682c35faba1a95809fd8b56b876d648a194f01a8c86f","observation_id":"d0268f61-6ea7-4c56-9c13-91e0b67c767b","resolution":{"observed_at":"2026-08-16T04:51:31.854183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:51:31.837119Z","title":null,"venue":null,"work_id":"b01c5486-23f1-47ce-88bc-e412fdfb8712","year":2025},"citing_paper":{"arxiv_id":"2505.00232","last_updated":"2025-05-01T00:44:13Z","snapshot_observed_at":"2026-08-16T04:45:07.395209Z","submitted_at":"2025-05-01T00:44:13Z","title":"Scaling On-Device GPU Inference for Large Generative Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T04:51:31.466325Z"},"links":{"citing_paper":"/paper/2505.00232"},"observation_digest":"sha256:40ac25090030df083a371adbef85a054806881b5fca6fc05d0729eca69dd2548","observation_id":"bfa471c6-016f-43ce-96da-0bb3acfc7576","resolution":{"observed_at":"2026-08-16T04:51:31.842022Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:51:31.824903Z","title":null,"venue":null,"work_id":"b0d37217-4d5a-4e31-a6cf-b4cdcf35d6f7","year":2025},"citing_paper":{"arxiv_id":"2505.00232","last_updated":"2025-05-01T00:44:13Z","snapshot_observed_at":"2026-08-16T04:45:07.395209Z","submitted_at":"2025-05-01T00:44:13Z","title":"Scaling On-Device GPU Inference for Large Generative Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T04:51:31.469475Z"},"links":{"citing_paper":"/paper/2505.00232"},"observation_digest":"sha256:53c5d21ec9d7cbeb25fe9b884dad13ce33ae838ffe1f2ab6996898f9fd903bf4","observation_id":"67262328-6b4d-4379-a936-70c921ad655a","resolution":{"observed_at":"2026-08-16T04:51:31.828786Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:51:31.812364Z","title":"NVIDIA Tensor Cores","venue":null,"work_id":"12e6618c-9f51-4f69-b7bb-c631bcc83507","year":2025},"citing_paper":{"arxiv_id":"2505.00232","last_updated":"2025-05-01T00:44:13Z","snapshot_observed_at":"2026-08-16T04:45:07.395209Z","submitted_at":"2025-05-01T00:44:13Z","title":"Scaling On-Device GPU Inference for Large Generative Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T04:51:31.473074Z"},"links":{"citing_paper":"/paper/2505.00232"},"observation_digest":"sha256:2b1bff9942ca41a800eaf37d1b3fcd42bdea01576d6b8accf0d1e853d28d0403","observation_id":"96c5db1d-d03b-4196-b9ad-5167ee423445","resolution":{"observed_at":"2026-08-16T04:51:31.816678Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:51:31.799315Z","title":"TensorRT","venue":null,"work_id":"8803b98b-576e-48c8-957d-e9b7e61cc11b","year":2025},"citing_paper":{"arxiv_id":"2505.00232","last_updated":"2025-05-01T00:44:13Z","snapshot_observed_at":"2026-08-16T04:45:07.395209Z","submitted_at":"2025-05-01T00:44:13Z","title":"Scaling On-Device GPU Inference for Large Generative Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T04:51:31.475989Z"},"links":{"citing_paper":"/paper/2505.00232"},"observation_digest":"sha256:76271d77d66af87f45797a7e3013a6f5edc1ae31732d4408dff9cd09cc97c2d6","observation_id":"f4b38987-3aeb-4e27-a84d-b1d2b3938805","resolution":{"observed_at":"2026-08-16T04:51:31.803472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:51:31.789643Z","title":null,"venue":null,"work_id":"297b0cd7-6ec9-4603-96cc-436d956ca767","year":2025},"citing_paper":{"arxiv_id":"2505.00232","last_updated":"2025-05-01T00:44:13Z","snapshot_observed_at":"2026-08-16T04:45:07.395209Z","submitted_at":"2025-05-01T00:44:13Z","title":"Scaling On-Device GPU Inference for Large Generative Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T04:51:31.479341Z"},"links":{"citing_paper":"/paper/2505.00232"},"observation_digest":"sha256:655667e18d9b57442c68a8078b2ec5759a6e37017d48d0c15a806c942489e86c","observation_id":"17bc6ceb-1dde-4cc4-9ee9-81596a10cf25","resolution":{"observed_at":"2026-08-16T04:51:31.792711Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:51:31.778797Z","title":"Efficient Memory Manage- ment for Deep Neural Net Inference","venue":null,"work_id":"fcb91fa1-30b9-442c-ad13-47764a6bd170","year":2020},"citing_paper":{"arxiv_id":"2505.00232","last_updated":"2025-05-01T00:44:13Z","snapshot_observed_at":"2026-08-16T04:45:07.395209Z","submitted_at":"2025-05-01T00:44:13Z","title":"Scaling On-Device GPU Inference for Large Generative Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T04:51:31.482345Z"},"links":{"citing_paper":"/paper/2505.00232"},"observation_digest":"sha256:30e7568884de3483e4c8e05a81742dba7784b928290871d511e765d22d9e6d03","observation_id":"2572a02f-e45d-4571-9175-ec554570753e","resolution":{"observed_at":"2026-08-16T04:51:31.782707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:51:31.767238Z","title":"Snapdragon Neural Processing Engine SDK","venue":null,"work_id":"db666567-85d3-42cb-b0aa-3e9164f8c55a","year":2025},"citing_paper":{"arxiv_id":"2505.00232","last_updated":"2025-05-01T00:44:13Z","snapshot_observed_at":"2026-08-16T04:45:07.395209Z","submitted_at":"2025-05-01T00:44:13Z","title":"Scaling On-Device GPU Inference for Large Generative Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T04:51:31.485334Z"},"links":{"citing_paper":"/paper/2505.00232"},"observation_digest":"sha256:9363385dc4eed011ee5ba628f5cf73469e6a43aff98d24386195607ff997a51d","observation_id":"c1f17b16-a16d-4582-99ac-55d254b36740","resolution":{"observed_at":"2026-08-16T04:51:31.771094Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:51:31.756709Z","title":"QualComm AI Hub Llama-v3.2-3B-Chat","venue":null,"work_id":"79fea51c-d978-4ea5-bb0c-94e35a451b31","year":2025},"citing_paper":{"arxiv_id":"2505.00232","last_updated":"2025-05-01T00:44:13Z","snapshot_observed_at":"2026-08-16T04:45:07.395209Z","submitted_at":"2025-05-01T00:44:13Z","title":"Scaling On-Device GPU Inference for Large Generative Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-16T04:51:31.488945Z"},"links":{"citing_paper":"/paper/2505.00232"},"observation_digest":"sha256:2136925ecec90c50945e9f0ea5cd711123205c3e08ec3194af8d70410c918c86","observation_id":"cfda3ff7-68cc-4da5-914f-db7745bd842e","resolution":{"observed_at":"2026-08-16T04:51:31.760222Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:51:31.745009Z","title":"World’s first on-device demonstration of Stable Diffusion on an Android phone","venue":null,"work_id":"d0d73137-2e97-4ff5-b031-1150d59993b0","year":2023},"citing_paper":{"arxiv_id":"2505.00232","last_updated":"2025-05-01T00:44:13Z","snapshot_observed_at":"2026-08-16T04:45:07.395209Z","submitted_at":"2025-05-01T00:44:13Z","title":"Scaling On-Device GPU Inference for Large Generative Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-16T04:51:31.492697Z"},"links":{"citing_paper":"/paper/2505.00232"},"observation_digest":"sha256:7d0c5903457c01f39863c8dcad5095a4c0185b71309cc1701bbd8664accd9571","observation_id":"5e70183f-a43b-4b95-81a6-02a97d5caadb","resolution":{"observed_at":"2026-08-16T04:51:31.749703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:51:31.733195Z","title":"Ruan, Yucheng Qin, Xun Zhou, Ruihang Lai, Hongyi Jin, Yixin Dong, Bohan Hou, Meng-Shiun Yu, Yiyan Zhai, Sudeep Agarwal, Hangrui Cao, Siyuan Feng, and Tianqi Chen","venue":null,"work_id":"113755b2-cbe4-4aa4-a963-913ffeca83c2","year":2024},"citing_paper":{"arxiv_id":"2505.00232","last_updated":"2025-05-01T00:44:13Z","snapshot_observed_at":"2026-08-16T04:45:07.395209Z","submitted_at":"2025-05-01T00:44:13Z","title":"Scaling On-Device GPU Inference for Large Generative Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-16T04:51:31.496210Z"},"links":{"citing_paper":"/paper/2505.00232"},"observation_digest":"sha256:b56c83399ab046b11d44c2973193a96645f553b57190c9a97ea9a1628533b5d1","observation_id":"9ed90683-f398-487f-a7d3-b88063eda807","resolution":{"observed_at":"2026-08-16T04:51:31.737091Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:51:31.721811Z","title":"XLA: Compiling Machine Learning for Peak Performance, 2020","venue":null,"work_id":"c543175b-52b1-40b0-a572-3daa7cf9c7db","year":2020},"citing_paper":{"arxiv_id":"2505.00232","last_updated":"2025-05-01T00:44:13Z","snapshot_observed_at":"2026-08-16T04:45:07.395209Z","submitted_at":"2025-05-01T00:44:13Z","title":"Scaling On-Device GPU Inference for Large Generative Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-16T04:51:31.499934Z"},"links":{"citing_paper":"/paper/2505.00232"},"observation_digest":"sha256:53d937f901c27fa80a7d1fcd92c472c4f1212a05fbd9cbb2a4fcb177e1bc0094","observation_id":"f547c7bc-5890-481e-b1d7-8b8c3decf77e","resolution":{"observed_at":"2026-08-16T04:51:31.725717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:51:31.710256Z","title":"Introducing Stable Diffusion 3.5","venue":null,"work_id":"d021a543-3784-4a7f-8e93-ffa6ce2290f6","year":2025},"citing_paper":{"arxiv_id":"2505.00232","last_updated":"2025-05-01T00:44:13Z","snapshot_observed_at":"2026-08-16T04:45:07.395209Z","submitted_at":"2025-05-01T00:44:13Z","title":"Scaling On-Device GPU Inference for Large Generative Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-16T04:51:31.503769Z"},"links":{"citing_paper":"/paper/2505.00232"},"observation_digest":"sha256:0a5906db88482ace12726698994f9a5ebf1d0cc222b0c492abbdf82c777c64db","observation_id":"10aef569-a863-4b62-a5e4-f42a03f003c5","resolution":{"observed_at":"2026-08-16T04:51:31.713687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:51:31.699405Z","title":"Introducing torchchat: Accelerating Local LLM Inference on Laptop, Desktop and Mobile","venue":null,"work_id":"bac9ea7f-77dd-4b93-bfb5-a6faa3e24069","year":2025},"citing_paper":{"arxiv_id":"2505.00232","last_updated":"2025-05-01T00:44:13Z","snapshot_observed_at":"2026-08-16T04:45:07.395209Z","submitted_at":"2025-05-01T00:44:13Z","title":"Scaling On-Device GPU Inference for Large Generative Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-16T04:51:31.507604Z"},"links":{"citing_paper":"/paper/2505.00232"},"observation_digest":"sha256:1d2396f91ef35d25c1caa8af44e92e1f5cf24fa67d593de5cad8850e9bd6afb1","observation_id":"7fa999f2-5162-44ad-a18e-57d302ee4093","resolution":{"observed_at":"2026-08-16T04:51:31.703132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:51:31.688478Z","title":null,"venue":null,"work_id":"ab0c929c-9b3c-4f34-9ed0-25856dc421c9","year":2025},"citing_paper":{"arxiv_id":"2505.00232","last_updated":"2025-05-01T00:44:13Z","snapshot_observed_at":"2026-08-16T04:45:07.395209Z","submitted_at":"2025-05-01T00:44:13Z","title":"Scaling On-Device GPU Inference for Large Generative Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-16T04:51:31.511990Z"},"links":{"citing_paper":"/paper/2505.00232"},"observation_digest":"sha256:e5f93dbd70494db06d8204b5429b12d90d6c2bd28cf8cc082ffba71b15206180","observation_id":"8524c447-e6d9-4edc-9d07-816c3c206f37","resolution":{"observed_at":"2026-08-16T04:51:31.691885Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:51:31.676362Z","title":"Dawn, a WebGPU implemen- tation","venue":null,"work_id":"741157cf-58fe-4a0a-8268-14ee4e320f74","year":2025},"citing_paper":{"arxiv_id":"2505.00232","last_updated":"2025-05-01T00:44:13Z","snapshot_observed_at":"2026-08-16T04:45:07.395209Z","submitted_at":"2025-05-01T00:44:13Z","title":"Scaling On-Device GPU Inference for Large Generative Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-16T04:51:31.515581Z"},"links":{"citing_paper":"/paper/2505.00232"},"observation_digest":"sha256:d872037495c95d1099278a724771c98ef11b4d95a4a79f5d3a196374e8196e13","observation_id":"6adc8945-0d67-42f6-8bbd-27b2fb14f743","resolution":{"observed_at":"2026-08-16T04:51:31.680108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:51:31.663958Z","title":null,"venue":null,"work_id":"424c6797-b56f-446a-85da-c14cddd35f46","year":2025},"citing_paper":{"arxiv_id":"2505.00232","last_updated":"2025-05-01T00:44:13Z","snapshot_observed_at":"2026-08-16T04:45:07.395209Z","submitted_at":"2025-05-01T00:44:13Z","title":"Scaling On-Device GPU Inference for Large Generative Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-16T04:51:31.519818Z"},"links":{"citing_paper":"/paper/2505.00232"},"observation_digest":"sha256:d73a9720a3e9c84b9f208267d3a5442f4bdde93310cb056e5151115f28688081","observation_id":"050b6cd3-07d8-4802-aa26-7d3b9057637f","resolution":{"observed_at":"2026-08-16T04:51:31.668575Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:51:31.650909Z","title":"SmoothQuant: Accurate and Effi- cient Post-Training Quantization for Large Language Mod- els","venue":null,"work_id":"1c10eca3-8aa2-4dd1-ae8a-e29710337481","year":2023},"citing_paper":{"arxiv_id":"2505.00232","last_updated":"2025-05-01T00:44:13Z","snapshot_observed_at":"2026-08-16T04:45:07.395209Z","submitted_at":"2025-05-01T00:44:13Z","title":"Scaling On-Device GPU Inference for Large Generative Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-16T04:51:31.523550Z"},"links":{"citing_paper":"/paper/2505.00232"},"observation_digest":"sha256:211265fdefde2fa0227e2120cf4c3b0a83d934fdad4548fb30ce5f51c687ef05","observation_id":"3b55a910-0d4c-4677-8cf2-78534dd35c7e","resolution":{"observed_at":"2026-08-16T04:51:31.655869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:51:31.639783Z","title":null,"venue":null,"work_id":"30ab8492-256a-404d-80aa-c9b02f07b4a8","year":2025},"citing_paper":{"arxiv_id":"2505.00232","last_updated":"2025-05-01T00:44:13Z","snapshot_observed_at":"2026-08-16T04:45:07.395209Z","submitted_at":"2025-05-01T00:44:13Z","title":"Scaling On-Device GPU Inference for Large Generative Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-16T04:51:31.527151Z"},"links":{"citing_paper":"/paper/2505.00232"},"observation_digest":"sha256:ba9dd8e39ea4e9cadc67a48d230257abc9d690d55462ae002973465419b122a8","observation_id":"4ebfc85a-c516-44d0-8f83-2390397b2c97","resolution":{"observed_at":"2026-08-16T04:51:31.643405Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:51:31.628948Z","title":"LLMCad: Fast and Scalable On-device Large Language Model Inference, 2023","venue":null,"work_id":"16802121-2221-41d4-b2f2-e5955a1baf69","year":2023},"citing_paper":{"arxiv_id":"2505.00232","last_updated":"2025-05-01T00:44:13Z","snapshot_observed_at":"2026-08-16T04:45:07.395209Z","submitted_at":"2025-05-01T00:44:13Z","title":"Scaling On-Device GPU Inference for Large Generative Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-16T04:51:31.530744Z"},"links":{"citing_paper":"/paper/2505.00232"},"observation_digest":"sha256:5774d7a67d00125b3a081bab2d3505b1b0da0aceeb4f442b70cdf5c6fc4c08a1","observation_id":"4c0350f0-bd82-43d1-a93e-54649577265e","resolution":{"observed_at":"2026-08-16T04:51:31.632711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:51:31.617678Z","title":"Fast On-device LLM Inference with NPUs","venue":null,"work_id":"ce536a5d-6ee2-4382-9e26-2c85133b497e","year":2024},"citing_paper":{"arxiv_id":"2505.00232","last_updated":"2025-05-01T00:44:13Z","snapshot_observed_at":"2026-08-16T04:45:07.395209Z","submitted_at":"2025-05-01T00:44:13Z","title":"Scaling On-Device GPU Inference for Large Generative Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-16T04:51:31.534059Z"},"links":{"citing_paper":"/paper/2505.00232"},"observation_digest":"sha256:64721b180d9e459975973863d391861cb6d4cd6b3938871cd9209d3eb411fb37","observation_id":"d73f38fa-cffa-4fa2-b165-fbec16e9cc78","resolution":{"observed_at":"2026-08-16T04:51:31.621573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06282","last_updated":"2024-12-12T12:24:18Z","snapshot_observed_at":"2026-08-16T13:44:33.550467Z","submitted_at":"2024-06-10T14:01:21Z","title":"PowerInfer-2: Fast Large Language Model Inference on a Smartphone","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06282","snapshot_observed_at":"2026-08-16T04:51:31.537714Z","title":"PowerInfer-2: Fast Large Language Model Inference on a Smartphone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00232","last_updated":"2025-05-01T00:44:13Z","snapshot_observed_at":"2026-08-16T04:45:07.395209Z","submitted_at":"2025-05-01T00:44:13Z","title":"Scaling On-Device GPU Inference for Large Generative Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-16T04:51:31.537714Z"},"links":{"cited_paper":"/paper/2406.06282","citing_paper":"/paper/2505.00232"},"observation_digest":"sha256:95b1cfa2810d11b3307136897722dbc3415b82b5c72d75577826f57fd2b34d3c","observation_id":"339db099-dd19-46ef-be92-964ead0a53a3","resolution":{"observed_at":"2026-08-16T04:51:31.537714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:51:31.603802Z","title":"Gonzalez, Clark Barrett, and Ying Sheng","venue":null,"work_id":"85b96b79-ee1b-4957-a4e2-5c2f37821b8f","year":2024},"citing_paper":{"arxiv_id":"2505.00232","last_updated":"2025-05-01T00:44:13Z","snapshot_observed_at":"2026-08-16T04:45:07.395209Z","submitted_at":"2025-05-01T00:44:13Z","title":"Scaling On-Device GPU Inference for Large Generative Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-16T04:51:31.541760Z"},"links":{"citing_paper":"/paper/2505.00232"},"observation_digest":"sha256:7e8bffe1d5487ec1c5b8836cb66d80687afe114ccd1ae55419123b0e2940115c","observation_id":"984377af-19f7-4a48-9783-9de59c1de3fc","resolution":{"observed_at":"2026-08-16T04:51:31.609190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.00232","last_updated":"2025-05-01T00:44:13Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-16T04:45:07.395209Z","submitted_at":"2025-05-01T00:44:13Z","title":"Scaling On-Device GPU Inference for Large Generative Models"},"reference_resolution":{"displayed":59,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":0,"verified_fuzzy":46},"total_outbound_references":59},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 59 of 59 outbound references and 1 inbound Pith citation observation for arXiv:2505.00232."}