{"as_of":"2026-08-08T21:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2c34bb067a3b4a1a84c7c09e2e46ea6511c140016a19c6b4f3bc2afcb380dcb7","coverage":[{"denominator":28,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-10T11:11:55.188720Z","state":"measured"},{"denominator":28,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":28,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.08215/citation-record","integrity":"/paper/2607.08215/integrity","json":"/paper/2607.08215/citation-record.json","paper":"/paper/2607.08215"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2401.10774","last_updated":"2024-06-14T23:32:32Z","snapshot_observed_at":"2026-07-06T17:17:56.276857Z","submitted_at":"2024-01-19T15:48:40Z","title":"Medusa: Simple LLM Inference Acceleration Framework with Multiple Decoding Heads","version":3},"cited_work":{"arxiv_id":"2401.10774","doi":"10.48550/arxiv.2401.10774","metadata_source":"pith","pith_arxiv_id":"2401.10774","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Medusa: Simple LLM Inference Acceleration Framework with Multiple Decoding Heads","venue":"cs.LG","work_id":"f6202cd1-1a78-4c19-8242-688acf4952b6","year":2024},"citing_paper":{"arxiv_id":"2607.08215","last_updated":"2026-07-09T08:12:15Z","snapshot_observed_at":"2026-08-02T18:52:23.462003Z","submitted_at":"2026-07-09T08:12:15Z","title":"On the Limitations of Non-GPU AI Accelerators for Large-Model Inference: A Field Study of MoE and Multimodal Serving on Huawei Ascend","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-10T11:11:55.188720Z"},"links":{"cited_paper":"/paper/2401.10774","citing_paper":"/paper/2607.08215"},"observation_digest":"sha256:cca7122c58cb975faa757255239324c9fc5d6b81cf365a320d30778cf938a3ad","observation_id":"897c8722-3ab0-4963-9a71-eba72526e343","resolution":{"observed_at":"2026-07-10T11:17:03.651965Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08691","last_updated":"2023-07-17T17:50:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-17T17:50:36Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","version":1},"cited_work":{"arxiv_id":"2307.08691","doi":"10.48550/arxiv.2307.08691","metadata_source":"pith","pith_arxiv_id":"2307.08691","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","venue":"cs.LG","work_id":"fff3953b-5efb-4753-bee4-002f59995810","year":2023},"citing_paper":{"arxiv_id":"2607.08215","last_updated":"2026-07-09T08:12:15Z","snapshot_observed_at":"2026-08-02T18:52:23.462003Z","submitted_at":"2026-07-09T08:12:15Z","title":"On the Limitations of Non-GPU AI Accelerators for Large-Model Inference: A Field Study of MoE and Multimodal Serving on Huawei Ascend","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-10T11:11:55.188720Z"},"links":{"cited_paper":"/paper/2307.08691","citing_paper":"/paper/2607.08215"},"observation_digest":"sha256:3720c0044e675a597c3210811e5116c8c465907dab209223cfeb51bad4a7fa9e","observation_id":"e66b49e2-54d3-4c08-875f-b7759226bc93","resolution":{"observed_at":"2026-07-10T11:17:03.647232Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:50:18.243793+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:50:18.243793+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:27:49.168075Z","title":"Fu, Stefano Ermon, Atri Rudra, and Christopher Ré","venue":null,"work_id":"e5783130-2780-45b8-acc5-8d738e2d3e5e","year":2022},"citing_paper":{"arxiv_id":"2607.08215","last_updated":"2026-07-09T08:12:15Z","snapshot_observed_at":"2026-08-02T18:52:23.462003Z","submitted_at":"2026-07-09T08:12:15Z","title":"On the Limitations of Non-GPU AI Accelerators for Large-Model Inference: A Field Study of MoE and Multimodal Serving on Huawei Ascend","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-10T11:11:55.188720Z"},"links":{"citing_paper":"/paper/2607.08215"},"observation_digest":"sha256:adcae3a06f46e783c78a0f16759fc926a99e163f28c6ed481efa80df32829bd3","observation_id":"80283ae9-d170-43b4-b891-24b98ccdd472","resolution":{"observed_at":"2026-07-10T11:17:03.951895Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":"2405.04434","doi":"10.1145/3593013.3594097","metadata_source":"pith","pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","venue":"cs.CL","work_id":"1e1df141-cac8-47fd-b068-c4c96e51e331","year":2024},"citing_paper":{"arxiv_id":"2607.08215","last_updated":"2026-07-09T08:12:15Z","snapshot_observed_at":"2026-08-02T18:52:23.462003Z","submitted_at":"2026-07-09T08:12:15Z","title":"On the Limitations of Non-GPU AI Accelerators for Large-Model Inference: A Field Study of MoE and Multimodal Serving on Huawei Ascend","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-10T11:11:55.188720Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2607.08215"},"observation_digest":"sha256:99d47897eec58598f22d48c11042aab50592c397c912107ee65d8b4834cacf7c","observation_id":"fbbf6edf-a691-4e0f-a2dc-2d08c5b65790","resolution":{"observed_at":"2026-07-10T11:17:03.654359Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":"2412.19437","doi":"10.1016/j.neucom.2023.127063.url:https://www.sciencedirect","metadata_source":"pith","pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeek-V3 Technical Report","venue":"cs.CL","work_id":"57d2791d-2219-4c31-a077-afc04b12a75c","year":2024},"citing_paper":{"arxiv_id":"2607.08215","last_updated":"2026-07-09T08:12:15Z","snapshot_observed_at":"2026-08-02T18:52:23.462003Z","submitted_at":"2026-07-09T08:12:15Z","title":"On the Limitations of Non-GPU AI Accelerators for Large-Model Inference: A Field Study of MoE and Multimodal Serving on Huawei Ascend","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-10T11:11:55.188720Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2607.08215"},"observation_digest":"sha256:1999dda7f57398335ec68c7b60cafd72bfdd0ba139c3437fbafe73d9eb69e157","observation_id":"ac465b48-fb90-404e-895c-b07fd8522086","resolution":{"observed_at":"2026-07-10T11:17:03.656488Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T11:17:03.954021Z","title":"Switch Transformers: Scaling to trillion parameter models with simple and efficient sparsity.Journal of Machine Learning Research, 23(120):1–39, 2022","venue":null,"work_id":"36155c96-0caa-49eb-b623-b0f9e1a4468a","year":2022},"citing_paper":{"arxiv_id":"2607.08215","last_updated":"2026-07-09T08:12:15Z","snapshot_observed_at":"2026-08-02T18:52:23.462003Z","submitted_at":"2026-07-09T08:12:15Z","title":"On the Limitations of Non-GPU AI Accelerators for Large-Model Inference: A Field Study of MoE and Multimodal Serving on Huawei Ascend","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-10T11:11:55.188720Z"},"links":{"citing_paper":"/paper/2607.08215"},"observation_digest":"sha256:16e55e5a0f88c084aeb470d5a431a981efa9b2495a33af025480c4241e339968","observation_id":"075d6415-14e4-4c52-9554-8eacd184263e","resolution":{"observed_at":"2026-07-10T11:17:03.955259Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.17323","last_updated":"2023-03-22T13:10:47Z","snapshot_observed_at":"2026-08-07T08:38:54.025062Z","submitted_at":"2022-10-31T13:42:40Z","title":"GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers","version":2},"cited_work":{"arxiv_id":"2210.17323","doi":"10.48550/arxiv.2210.17323","metadata_source":"pith","pith_arxiv_id":"2210.17323","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers","venue":"cs.LG","work_id":"19ed8c44-202a-48f6-8169-637d5a5f2408","year":2022},"citing_paper":{"arxiv_id":"2607.08215","last_updated":"2026-07-09T08:12:15Z","snapshot_observed_at":"2026-08-02T18:52:23.462003Z","submitted_at":"2026-07-09T08:12:15Z","title":"On the Limitations of Non-GPU AI Accelerators for Large-Model Inference: A Field Study of MoE and Multimodal Serving on Huawei Ascend","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-10T11:11:55.188720Z"},"links":{"cited_paper":"/paper/2210.17323","citing_paper":"/paper/2607.08215"},"observation_digest":"sha256:18d25a53634cb938af00b81713976acdb26fc7d42b1f034f30b5c4124c031733","observation_id":"f4b94852-e38b-4d51-bc2a-87c2046b499b","resolution":{"observed_at":"2026-07-10T11:17:03.658979Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-17T20:22:03.028003+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-17T20:22:03.028003+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T11:17:03.957916Z","title":"Le, Yonghui Wu, and Zhifeng Chen","venue":null,"work_id":"999b5b3b-6f3b-4b75-9c91-363b509c03c9","year":2019},"citing_paper":{"arxiv_id":"2607.08215","last_updated":"2026-07-09T08:12:15Z","snapshot_observed_at":"2026-08-02T18:52:23.462003Z","submitted_at":"2026-07-09T08:12:15Z","title":"On the Limitations of Non-GPU AI Accelerators for Large-Model Inference: A Field Study of MoE and Multimodal Serving on Huawei Ascend","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-10T11:11:55.188720Z"},"links":{"citing_paper":"/paper/2607.08215"},"observation_digest":"sha256:b1fe1e737fed2e982245831ddd74a756856b1e362e5e42c72feba954345fe98c","observation_id":"b9970f5c-570b-4a96-a4b1-97c1a9088a8a","resolution":{"observed_at":"2026-07-10T11:17:03.958961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T11:17:03.961519Z","title":"CANN: Compute architecture for neural networks — documentation","venue":null,"work_id":"e5dc6a58-7190-4bdc-ace4-665512e0254e","year":2024},"citing_paper":{"arxiv_id":"2607.08215","last_updated":"2026-07-09T08:12:15Z","snapshot_observed_at":"2026-08-02T18:52:23.462003Z","submitted_at":"2026-07-09T08:12:15Z","title":"On the Limitations of Non-GPU AI Accelerators for Large-Model Inference: A Field Study of MoE and Multimodal Serving on Huawei Ascend","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-10T11:11:55.188720Z"},"links":{"citing_paper":"/paper/2607.08215"},"observation_digest":"sha256:d6fc66c96e5624d47d3d091eb042fba19b454c40ea306c0399c7c159a69b8d56","observation_id":"0babd0a7-68ce-4a4c-a87a-51bc8ee76706","resolution":{"observed_at":"2026-07-10T11:17:03.962697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-08T06:16:25.839566Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":"2401.04088","doi":"10.48550/arxiv.2401.04088","metadata_source":"pith","pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mixtral of Experts","venue":"cs.LG","work_id":"0de8c352-9daa-4e1e-8c7b-3d0dec69f369","year":2024},"citing_paper":{"arxiv_id":"2607.08215","last_updated":"2026-07-09T08:12:15Z","snapshot_observed_at":"2026-08-02T18:52:23.462003Z","submitted_at":"2026-07-09T08:12:15Z","title":"On the Limitations of Non-GPU AI Accelerators for Large-Model Inference: A Field Study of MoE and Multimodal Serving on Huawei Ascend","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-10T11:11:55.188720Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2607.08215"},"observation_digest":"sha256:753c6fd1c8ba2e59a51bd19f42a53b91274965c9fca9d78e19b5d1dc38605071","observation_id":"52f93f76-9e2c-49a1-a96f-f8c95a9f0ff4","resolution":{"observed_at":"2026-07-10T11:17:03.639556Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T21:08:09.485243+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T21:08:09.485243+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T21:08:09.485243+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"0006.361316","doi":"10.1145/3600006.3613163","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention , booktitle =","venue":null,"work_id":"1b10f2a9-a178-4d23-97fb-8db2354c7e6c","year":2023},"citing_paper":{"arxiv_id":"2607.08215","last_updated":"2026-07-09T08:12:15Z","snapshot_observed_at":"2026-08-02T18:52:23.462003Z","submitted_at":"2026-07-09T08:12:15Z","title":"On the Limitations of Non-GPU AI Accelerators for Large-Model Inference: A Field Study of MoE and Multimodal Serving on Huawei Ascend","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-10T11:11:55.188720Z"},"links":{"citing_paper":"/paper/2607.08215"},"observation_digest":"sha256:7e74fd4647b5d6975f7ca2513c5349ad5f4bd3395e6f49a7398b6051bb6539b3","observation_id":"cbb4e218-af68-4820-aced-9213ad750dcb","resolution":{"observed_at":"2026-07-10T11:17:03.600722Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16668","last_updated":"2020-06-30T10:42:02Z","snapshot_observed_at":"2026-08-07T09:27:36.420559Z","submitted_at":"2020-06-30T10:42:02Z","title":"GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding","version":1},"cited_work":{"arxiv_id":"2006.16668","doi":"10.48550/arxiv.2006.16668","metadata_source":"pith","pith_arxiv_id":"2006.16668","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding","venue":"cs.CL","work_id":"52b3c9a6-2a27-45a7-ba2b-ebe4b5bb5a5f","year":2020},"citing_paper":{"arxiv_id":"2607.08215","last_updated":"2026-07-09T08:12:15Z","snapshot_observed_at":"2026-08-02T18:52:23.462003Z","submitted_at":"2026-07-09T08:12:15Z","title":"On the Limitations of Non-GPU AI Accelerators for Large-Model Inference: A Field Study of MoE and Multimodal Serving on Huawei Ascend","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-10T11:11:55.188720Z"},"links":{"cited_paper":"/paper/2006.16668","citing_paper":"/paper/2607.08215"},"observation_digest":"sha256:d482b795efc1c46419109316ca9d607d4cd580499d68bea87abd1e72c8820d10","observation_id":"ff08e0d9-58a2-4217-8ea1-a6155940bf6c","resolution":{"observed_at":"2026-07-10T11:17:03.627839Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.17192","last_updated":"2023-05-18T20:28:20Z","snapshot_observed_at":"2026-08-08T11:03:33.403601Z","submitted_at":"2022-11-30T17:33:28Z","title":"Fast Inference from Transformers via Speculative Decoding","version":2},"cited_work":{"arxiv_id":"2211.17192","doi":"10.48550/arxiv.2211.17192","metadata_source":"pith","pith_arxiv_id":"2211.17192","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fast Inference from Transformers via Speculative Decoding","venue":"cs.LG","work_id":"a17596db-fb15-4793-9ce6-fc620a92ae36","year":2022},"citing_paper":{"arxiv_id":"2607.08215","last_updated":"2026-07-09T08:12:15Z","snapshot_observed_at":"2026-08-02T18:52:23.462003Z","submitted_at":"2026-07-09T08:12:15Z","title":"On the Limitations of Non-GPU AI Accelerators for Large-Model Inference: A Field Study of MoE and Multimodal Serving on Huawei Ascend","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-10T11:11:55.188720Z"},"links":{"cited_paper":"/paper/2211.17192","citing_paper":"/paper/2607.08215"},"observation_digest":"sha256:c09f31f36d16a06905a555709993a35678681b2a8b27e0efc094aab5a43f80be","observation_id":"2383e7e1-9dca-4091-bd4d-ec137da3ee53","resolution":{"observed_at":"2026-07-10T11:17:03.661344Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.15077","last_updated":"2025-03-04T13:58:39Z","snapshot_observed_at":"2026-08-03T09:40:31.365295Z","submitted_at":"2024-01-26T18:59:01Z","title":"EAGLE: Speculative Sampling Requires Rethinking Feature Uncertainty","version":3},"cited_work":{"arxiv_id":"2401.15077","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.15077","snapshot_observed_at":"2026-07-10T21:57:38.979373Z","title":"EAGLE: Speculative Sampling Requires Rethinking Feature Uncertainty","venue":"cs.LG","work_id":"9d4637dd-1cab-4f10-82d4-8c8d14bb96ed","year":2024},"citing_paper":{"arxiv_id":"2607.08215","last_updated":"2026-07-09T08:12:15Z","snapshot_observed_at":"2026-08-02T18:52:23.462003Z","submitted_at":"2026-07-09T08:12:15Z","title":"On the Limitations of Non-GPU AI Accelerators for Large-Model Inference: A Field Study of MoE and Multimodal Serving on Huawei Ascend","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-10T11:11:55.188720Z"},"links":{"cited_paper":"/paper/2401.15077","citing_paper":"/paper/2607.08215"},"observation_digest":"sha256:cb41029c8f6b367a234b2007f5a423b850047607c38ce24adf14c079ebb72a30","observation_id":"af5ff6bf-dfc2-4cae-8b5e-f6d934e557ed","resolution":{"observed_at":"2026-07-10T11:17:03.632648Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T11:17:03.955909Z","title":"DaVinci: A scalable architecture for neural network computing","venue":null,"work_id":"9d8ca7a2-542e-4963-ab16-80d3f40f8222","year":2019},"citing_paper":{"arxiv_id":"2607.08215","last_updated":"2026-07-09T08:12:15Z","snapshot_observed_at":"2026-08-02T18:52:23.462003Z","submitted_at":"2026-07-09T08:12:15Z","title":"On the Limitations of Non-GPU AI Accelerators for Large-Model Inference: A Field Study of MoE and Multimodal Serving on Huawei Ascend","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-10T11:11:55.188720Z"},"links":{"citing_paper":"/paper/2607.08215"},"observation_digest":"sha256:b67f4c80e1c83b45c47c7b3f272fe12e14ecf744f6ce23d82cdc1c77755ea87d","observation_id":"474e0dc6-8c1c-429f-b6ea-8ab81a78b075","resolution":{"observed_at":"2026-07-10T11:17:03.957134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T11:17:03.959525Z","title":"Ascend: A scalable and unified architecture for ubiquitous deep neural network computing — industry track paper","venue":null,"work_id":"49422cb4-1118-4c9d-9d67-8e98772815d8","year":null},"citing_paper":{"arxiv_id":"2607.08215","last_updated":"2026-07-09T08:12:15Z","snapshot_observed_at":"2026-08-02T18:52:23.462003Z","submitted_at":"2026-07-09T08:12:15Z","title":"On the Limitations of Non-GPU AI Accelerators for Large-Model Inference: A Field Study of MoE and Multimodal Serving on Huawei Ascend","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-10T11:11:55.188720Z"},"links":{"citing_paper":"/paper/2607.08215"},"observation_digest":"sha256:6cda582552eb66356ccc5fa2de842a9ac6715732790e341ddb056aca2dce55f9","observation_id":"bc4c22cc-3733-4152-bbcb-16b3bd90348b","resolution":{"observed_at":"2026-07-10T11:17:03.960802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1647.2021","doi":"10.1080/01441647.2021.1958952","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Villa et al","venue":"Transport Reviews","work_id":"10945d39-ec5e-4f5a-b59b-26238807ec70","year":2021},"citing_paper":{"arxiv_id":"2607.08215","last_updated":"2026-07-09T08:12:15Z","snapshot_observed_at":"2026-08-02T18:52:23.462003Z","submitted_at":"2026-07-09T08:12:15Z","title":"On the Limitations of Non-GPU AI Accelerators for Large-Model Inference: A Field Study of MoE and Multimodal Serving on Huawei Ascend","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-10T11:11:55.188720Z"},"links":{"citing_paper":"/paper/2607.08215"},"observation_digest":"sha256:ee6271b223be07d87f19a8f7cd6c93550dbf5e6e985cde1815a415eb82de4066","observation_id":"ef1077cc-dc58-4c02-98c2-a8748651db36","resolution":{"observed_at":"2026-07-10T11:17:03.598028Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00978","last_updated":"2026-04-25T06:58:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-01T17:59:10Z","title":"AWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration","version":6},"cited_work":{"arxiv_id":"2306.00978","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.00978","snapshot_observed_at":"2026-07-10T11:17:03.640788Z","title":"AWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration","venue":"cs.CL","work_id":"ea9d1d72-db24-4cae-8c89-4ecd83dd87c1","year":2023},"citing_paper":{"arxiv_id":"2607.08215","last_updated":"2026-07-09T08:12:15Z","snapshot_observed_at":"2026-08-02T18:52:23.462003Z","submitted_at":"2026-07-09T08:12:15Z","title":"On the Limitations of Non-GPU AI Accelerators for Large-Model Inference: A Field Study of MoE and Multimodal Serving on Huawei Ascend","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-10T11:11:55.188720Z"},"links":{"cited_paper":"/paper/2306.00978","citing_paper":"/paper/2607.08215"},"observation_digest":"sha256:d63706cdfc9a0ab802df55e8b007046ba520c68af9940b85e68eeb01bec36fdc","observation_id":"0c805e96-a852-43d1-a064-730d043576f1","resolution":{"observed_at":"2026-07-10T11:17:03.642054Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2304.08485","doi":"10.48550/arxiv.2304.08485","metadata_source":"pith","pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Visual Instruction Tuning","venue":"cs.CV","work_id":"68be622d-a6dc-4a13-82de-e3054a3dc509","year":2023},"citing_paper":{"arxiv_id":"2607.08215","last_updated":"2026-07-09T08:12:15Z","snapshot_observed_at":"2026-08-02T18:52:23.462003Z","submitted_at":"2026-07-09T08:12:15Z","title":"On the Limitations of Non-GPU AI Accelerators for Large-Model Inference: A Field Study of MoE and Multimodal Serving on Huawei Ascend","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-10T11:11:55.188720Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2607.08215"},"observation_digest":"sha256:1821698869b7a7b0961e9a5488672b7195a7083b328677a94371ced1e30f3df1","observation_id":"0e2ac552-fbc7-4114-909c-a3122c01d833","resolution":{"observed_at":"2026-07-10T11:17:03.637295Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-12T21:49:44.742124+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T21:49:44.742124+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T11:17:03.948796Z","title":"PyTorch: An imperative style, high- performance deep learning library","venue":null,"work_id":"e78cc228-70a5-47c3-bd0e-d853e02a3b1f","year":null},"citing_paper":{"arxiv_id":"2607.08215","last_updated":"2026-07-09T08:12:15Z","snapshot_observed_at":"2026-08-02T18:52:23.462003Z","submitted_at":"2026-07-09T08:12:15Z","title":"On the Limitations of Non-GPU AI Accelerators for Large-Model Inference: A Field Study of MoE and Multimodal Serving on Huawei Ascend","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-10T11:11:55.188720Z"},"links":{"citing_paper":"/paper/2607.08215"},"observation_digest":"sha256:bb3ebd0018741f606281e513ed6ecde31a25a61b3892abcce5e6bdc24cd6623b","observation_id":"520683a6-f800-4144-b9bb-cdfd752c4fa7","resolution":{"observed_at":"2026-07-10T11:17:03.950078Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":"2103.00020","doi":"10.1021/acs.jcim.0c00174","metadata_source":"pith","pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Learning Transferable Visual Models From Natural Language Supervision","venue":"cs.CV","work_id":"6de86bb5-27bd-4d5c-8b89-967ebfc52659","year":2021},"citing_paper":{"arxiv_id":"2607.08215","last_updated":"2026-07-09T08:12:15Z","snapshot_observed_at":"2026-08-02T18:52:23.462003Z","submitted_at":"2026-07-09T08:12:15Z","title":"On the Limitations of Non-GPU AI Accelerators for Large-Model Inference: A Field Study of MoE and Multimodal Serving on Huawei Ascend","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-10T11:11:55.188720Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2607.08215"},"observation_digest":"sha256:ffacf84abcf273cdb366a97c1f77ec47fc13aaeec63f00561b931f51eeb47ee0","observation_id":"7d6012de-f9a1-497b-81d4-145711defedc","resolution":{"observed_at":"2026-07-10T11:17:03.635016Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1701.06538","last_updated":"2017-01-23T18:10:00Z","snapshot_observed_at":"2026-07-06T05:27:13.416519Z","submitted_at":"2017-01-23T18:10:00Z","title":"Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer","version":1},"cited_work":{"arxiv_id":"1701.06538","doi":"10.48550/arxiv.1701.06538","metadata_source":"pith","pith_arxiv_id":"1701.06538","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer","venue":"cs.LG","work_id":"2c6b3f6d-54e4-4df7-baa7-475a490799af","year":2017},"citing_paper":{"arxiv_id":"2607.08215","last_updated":"2026-07-09T08:12:15Z","snapshot_observed_at":"2026-08-02T18:52:23.462003Z","submitted_at":"2026-07-09T08:12:15Z","title":"On the Limitations of Non-GPU AI Accelerators for Large-Model Inference: A Field Study of MoE and Multimodal Serving on Huawei Ascend","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-10T11:11:55.188720Z"},"links":{"cited_paper":"/paper/1701.06538","citing_paper":"/paper/2607.08215"},"observation_digest":"sha256:5285a04e6d9501a07753398626dc51f6d4f33b0bc757ac3add59e78592b4a0b0","observation_id":"be493855-4b23-41f1-a0f3-057dc266a059","resolution":{"observed_at":"2026-07-10T11:17:03.644722Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-01T08:08:24.174744+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T08:08:24.174744+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":"1909.08053","doi":"10.48550/arxiv.1909.08053","metadata_source":"pith","pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","venue":"cs.CL","work_id":"c888e6d1-0b1d-43d6-9ef5-f0912a0efa1b","year":2019},"citing_paper":{"arxiv_id":"2607.08215","last_updated":"2026-07-09T08:12:15Z","snapshot_observed_at":"2026-08-02T18:52:23.462003Z","submitted_at":"2026-07-09T08:12:15Z","title":"On the Limitations of Non-GPU AI Accelerators for Large-Model Inference: A Field Study of MoE and Multimodal Serving on Huawei Ascend","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-10T11:11:55.188720Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2607.08215"},"observation_digest":"sha256:7f8bbfa9342deba607892200226c675720f8bf470a3c88a458d2b157414838ba","observation_id":"8914cb5e-0ea8-437e-822a-44a85d158b13","resolution":{"observed_at":"2026-07-10T11:17:03.649613Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:33.392193+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:33.392193+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T11:17:03.952425Z","title":"Gomez, Łukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":"dda4e97d-f759-4160-be35-a689c9737aef","year":2017},"citing_paper":{"arxiv_id":"2607.08215","last_updated":"2026-07-09T08:12:15Z","snapshot_observed_at":"2026-08-02T18:52:23.462003Z","submitted_at":"2026-07-09T08:12:15Z","title":"On the Limitations of Non-GPU AI Accelerators for Large-Model Inference: A Field Study of MoE and Multimodal Serving on Huawei Ascend","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-10T11:11:55.188720Z"},"links":{"citing_paper":"/paper/2607.08215"},"observation_digest":"sha256:ecd48a8aa93ad3e5a0722ae65ef1b7ceead06199538765387b970ca469b773a6","observation_id":"30170d5b-f11a-479d-a145-a5c690ad7408","resolution":{"observed_at":"2026-07-10T11:17:03.953518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T11:17:03.947044Z","title":"vLLM Ascend plugin (vllm-ascend) documentation.https://vllm-ascend","venue":null,"work_id":"168f9f19-d65b-46dc-890e-d99bfdf5c861","year":2024},"citing_paper":{"arxiv_id":"2607.08215","last_updated":"2026-07-09T08:12:15Z","snapshot_observed_at":"2026-08-02T18:52:23.462003Z","submitted_at":"2026-07-09T08:12:15Z","title":"On the Limitations of Non-GPU AI Accelerators for Large-Model Inference: A Field Study of MoE and Multimodal Serving on Huawei Ascend","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-10T11:11:55.188720Z"},"links":{"citing_paper":"/paper/2607.08215"},"observation_digest":"sha256:62505b569a4f7bc63ec5e9486cd0d7811ff01d9c1eb3b8f8209fb46c7beb79e9","observation_id":"e20f6114-626b-4f78-a0c9-7d43a4ab4a73","resolution":{"observed_at":"2026-07-10T11:17:03.948244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":"2409.12191","doi":"10.48550/arxiv.2409.12191","metadata_source":"pith","pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","venue":"cs.CV","work_id":"8abcfe4f-e0fb-44b7-9123-448fac95f90a","year":2024},"citing_paper":{"arxiv_id":"2607.08215","last_updated":"2026-07-09T08:12:15Z","snapshot_observed_at":"2026-08-02T18:52:23.462003Z","submitted_at":"2026-07-09T08:12:15Z","title":"On the Limitations of Non-GPU AI Accelerators for Large-Model Inference: A Field Study of MoE and Multimodal Serving on Huawei Ascend","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-10T11:11:55.188720Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2607.08215"},"observation_digest":"sha256:fc9590c965e07764ba3a5aa0e49c250fb8cd1eccc760d9096b160141d95a78ef","observation_id":"d2aee196-2cde-4ef4-85af-ce384a7e2106","resolution":{"observed_at":"2026-07-10T11:17:03.630296Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-11T02:19:33.884263+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T02:19:33.884263+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.10438","last_updated":"2024-03-29T19:21:58Z","snapshot_observed_at":"2026-08-07T09:04:32.994880Z","submitted_at":"2022-11-18T18:59:33Z","title":"SmoothQuant: Accurate and Efficient Post-Training Quantization for Large Language Models","version":7},"cited_work":{"arxiv_id":"2211.10438","doi":"10.48550/arxiv.2211.10438","metadata_source":"pith","pith_arxiv_id":"2211.10438","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Smoothquant: Accurate and efficient post-training quantization for large language models","venue":"cs.CL","work_id":"f6c42722-63d3-433b-98d3-748754b9c451","year":2022},"citing_paper":{"arxiv_id":"2607.08215","last_updated":"2026-07-09T08:12:15Z","snapshot_observed_at":"2026-08-02T18:52:23.462003Z","submitted_at":"2026-07-09T08:12:15Z","title":"On the Limitations of Non-GPU AI Accelerators for Large-Model Inference: A Field Study of MoE and Multimodal Serving on Huawei Ascend","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-10T11:11:55.188720Z"},"links":{"cited_paper":"/paper/2211.10438","citing_paper":"/paper/2607.08215"},"observation_digest":"sha256:5e04dd4edf6c2c8d66c6ada6bf1ea4e13fb87f75acb4e56a611a9170ca4f36f4","observation_id":"619f3c47-2f2b-44a3-8616-3e195866da7f","resolution":{"observed_at":"2026-07-10T11:17:03.625272Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T11:17:03.945279Z","title":"Orca: A distributed serving system for Transformer-based generative models","venue":null,"work_id":"ee925244-fff7-49bb-ae1b-ea1bde12cdce","year":2022},"citing_paper":{"arxiv_id":"2607.08215","last_updated":"2026-07-09T08:12:15Z","snapshot_observed_at":"2026-08-02T18:52:23.462003Z","submitted_at":"2026-07-09T08:12:15Z","title":"On the Limitations of Non-GPU AI Accelerators for Large-Model Inference: A Field Study of MoE and Multimodal Serving on Huawei Ascend","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-10T11:11:55.188720Z"},"links":{"citing_paper":"/paper/2607.08215"},"observation_digest":"sha256:b6ea1514aa321bd34459a65b28b71986dedf65aab1d2c1aa3d107a995c3a8775","observation_id":"b52fa409-2221-4a6d-81cc-6993095aa59c","resolution":{"observed_at":"2026-07-10T11:17:03.946484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2607.08215","last_updated":"2026-07-09T08:12:15Z","latest_version":1,"primary_category":"cs.DC","snapshot_observed_at":"2026-08-02T18:52:23.462003Z","submitted_at":"2026-07-09T08:12:15Z","title":"On the Limitations of Non-GPU AI Accelerators for Large-Model Inference: A Field Study of MoE and Multimodal Serving on Huawei Ascend"},"reference_resolution":{"displayed":28,"state_counts":{"malformed_identifier":0,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":0,"verified_exact":15,"verified_fuzzy":10},"total_outbound_references":28},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 28 of 28 outbound references and 0 inbound Pith citation observations for arXiv:2607.08215."}