{"as_of":"2026-08-04T20:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a89a56f936f7a6d4baab441c7ca4c83f244b273a03c57b2d5bf6b6a2efa36517","coverage":[{"denominator":79,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":79,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-18T00:16:27.497363Z","state":"measured"},{"denominator":81,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":81,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T09:52:39.415504Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-07-06T22:35:22.282985Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.06838","snapshot_observed_at":"2026-08-03T09:52:39.415504Z","title":"P3-llm: An integrated npu-pim accelerator for llm infer- ence using hybrid numerical formats,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.12298","last_updated":"2026-01-18T07:58:23Z","snapshot_observed_at":"2026-08-03T09:52:37.357903Z","submitted_at":"2026-01-18T07:58:23Z","title":"CD-PIM: A High-Bandwidth and Compute-Efficient LPDDR5-Based PIM for Low-Batch LLM Acceleration on Edge-Device","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T09:52:39.415504Z"},"links":{"cited_paper":"/paper/2511.06838","citing_paper":"/paper/2601.12298"},"observation_digest":"sha256:a118f1e33808e23989fcecca4709ca8202b3ef33811e63183cf271092a65c8cd","observation_id":"6e5d9942-adc4-496a-9eb2-3d3afd6144d7","resolution":{"observed_at":"2026-08-03T09:52:39.415504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-07-06T22:35:22.282985Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.06838","snapshot_observed_at":"2026-07-31T22:36:29.218635Z","title":"P3-llm: An integrated npu-pim accelerator for llm inference using hybrid numerical formats.arXiv preprint arXiv:2511.06838, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24148","last_updated":"2026-07-27T08:29:05Z","snapshot_observed_at":"2026-07-31T22:36:27.209638Z","submitted_at":"2026-07-27T08:29:05Z","title":"A Motion-Aware Vector Quantization Framework with Centroid Reuse for Efficient VLA Inference","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-31T22:36:29.218635Z"},"links":{"cited_paper":"/paper/2511.06838","citing_paper":"/paper/2607.24148"},"observation_digest":"sha256:1810c220a77f33f06d1f3dcd11f5ff6626135d98a1c73d4add03ba03d139e6b3","observation_id":"3c97f8a5-465f-478d-86b0-258194387a0e","resolution":{"observed_at":"2026-07-31T22:36:29.218635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2511.06838/citation-record","integrity":"/paper/2511.06838/integrity","json":"/paper/2511.06838/citation-record.json","paper":"/paper/2511.06838"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"AMD INSTINCT™ MI350X GPU","venue":null,"work_id":"f8b357d5-6efe-4d30-9a4c-e01cf2eab664","year":null},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-07-06T22:35:22.282985Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:6591cd66ce71020ee6bf96d3682e4fa747de6e35b9562b93d1d4a7da377849da","observation_id":"91c0cbda-410f-4f64-9607-3dcedc025466","resolution":{"observed_at":"2026-05-18T00:20:33.381545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"QuaRot: Outlier-Free 4-Bit Inference in Rotated LLMs","venue":null,"work_id":"618c37e2-8bd4-4868-8ac6-6e40b798d0a2","year":2024},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-07-06T22:35:22.282985Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:5c6f53a2a733b80123ca5966df2079df08fc4f4b98acd4a83ee6d389d264ece6","observation_id":"0466a4a0-b073-41c4-90d2-aa0ad4611b80","resolution":{"observed_at":"2026-05-18T00:20:33.385570Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":"2308.12966","doi":"10.48550/arxiv.2308.12966","metadata_source":"pith","pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-07-10T11:37:03.214945Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","venue":"cs.CV","work_id":"cbc2bb21-b6bb-46c0-80bf-107e195ffe10","year":2023},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-07-06T22:35:22.282985Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:40a661ae4d88821a79c07388c2fd5e7691571a0049cca5db94a77e3d0edd9819","observation_id":"5ffe8591-3f1b-422f-be20-b97d8420901e","resolution":{"observed_at":"2026-05-18T00:20:32.193780Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"LongBench: A Bilingual, Multitask Benchmark for Long Context Understanding","venue":null,"work_id":"a8d18c76-2481-463a-ae4a-1b3876a36b53","year":2024},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-07-06T22:35:22.282985Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:7cef491c1f2b7ff9b442b7e919fd900e70e3fbdfd5a4392403b61ddd03c3a7c4","observation_id":"c9058645-61af-400b-9d8b-72c2ae33df5f","resolution":{"observed_at":"2026-05-18T00:20:33.388138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"CACTI 7: New tools for interconnect exploration in innovative off-chip memories","venue":null,"work_id":"91e421d1-f6c0-4325-a1fc-fdb26ef1f837","year":2017},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-07-06T22:35:22.282985Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:9df0c5b01e2fbe9d6c288c0487020cde48facc919003382780b7937f29a22f56","observation_id":"8ca165b9-7a3c-442c-ad7f-7a252ee8e115","resolution":{"observed_at":"2026-05-18T00:20:33.473674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Language Models are Few-Shot Learners","venue":null,"work_id":"2d64e5ff-f6b8-4d6b-a84e-ff2e2b8e245b","year":2020},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-07-06T22:35:22.282985Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:1804dee978053d32d62bfed2590297ad6eff9c000a9403508c5a92292f449ba7","observation_id":"86fd75e1-3aa8-4d7a-be30-4c2a9b166c8f","resolution":{"observed_at":"2026-05-18T00:20:33.358350Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"BitMoD: Bit-serial Mixture-of- Datatype LLM Acceleration","venue":null,"work_id":"557ec5d1-c816-4507-baff-53389de911a1","year":2025},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-07-06T22:35:22.282985Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:7cce9e4cac40817f26fce480b4d89cbdfd48070d65ce34ea9f4fc7908f17b089","observation_id":"94742906-3c9b-4726-92fd-5aafa83d2ef5","resolution":{"observed_at":"2026-05-18T00:20:33.501615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ecco: Improving Memory Band- width and Capacity for LLMs via Entropy-Aware Cache Compression","venue":null,"work_id":"74e1f8c3-faf4-439a-99a8-db72ae9d44fd","year":2025},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-07-06T22:35:22.282985Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:eea58f9ec554aef91285bc255ed59b036a54c94e1e38e8da06e99f1a5ddf4963","observation_id":"3bfbabd8-5e52-45fe-956a-2cf4d8fd5442","resolution":{"observed_at":"2026-05-18T00:20:33.476680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":"1803.05457","doi":"10.1162/tacl_a_00448.https://aclanthology.org/2022.tacl-1.5","metadata_source":"pith","pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","venue":"cs.AI","work_id":"28ea1282-d657-4c61-a83c-f1249be6d6b1","year":2018},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-07-06T22:35:22.282985Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:b2ba3c66a1e330d3bdc061c3c410a4c25033a28db55f07e64bb8aff1ebfb94f6","observation_id":"5b80588a-b746-4f55-9cb6-9fa6eb4302f7","resolution":{"observed_at":"2026-05-18T00:20:32.226910Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"DeepSeek R1","venue":null,"work_id":"39eb3f41-d99a-4c78-8d1a-3920c7f3e087","year":null},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-07-06T22:35:22.282985Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:4c401118ddac04b9cfa6235e22703cf84b7d4dd7a27ad06cd7823b5e8ab3b8ef","observation_id":"0a46fa4d-337c-4a22-a73d-0f95d19bc213","resolution":{"observed_at":"2026-05-18T00:20:33.351770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.07339","last_updated":"2022-11-10T18:14:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-08-15T17:08:50Z","title":"LLM.int8(): 8-bit Matrix Multiplication for Transformers at Scale","version":2},"cited_work":{"arxiv_id":"2208.07339","doi":"10.18653/v1/2020.findings-emnlp.314","metadata_source":"pith","pith_arxiv_id":"2208.07339","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"LLM.int8(): 8-bit Matrix Multiplication for Transformers at Scale","venue":"cs.LG","work_id":"98201f98-f4e5-4d1c-9ed7-b795e3c8f76c","year":2022},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-07-06T22:35:22.282985Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"cited_paper":"/paper/2208.07339","citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:848fc88dbea63a5013330b2956d858427aba80addfcce32fb52b634ac73071db","observation_id":"7ce4bcba-230c-4174-a0e2-6326a867e548","resolution":{"observed_at":"2026-05-18T00:20:32.221843Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The true Processing In Memory accelerator","venue":null,"work_id":"49a6cdab-3408-4e35-93c3-13bb4dd3cf07","year":2019},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-07-06T22:35:22.282985Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:660f9242566f3515ec0354662561f469f0ce3183af028434e99af7bc6c2bd1c2","observation_id":"d89f3c01-9891-409b-ae6c-ab27d4be13f7","resolution":{"observed_at":"2026-05-18T00:20:33.344619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Documenting large webtext corpora: A case study on the colossal clean crawled corpus","venue":null,"work_id":"2208e3af-80a8-412d-ac7d-51a2698658d3","year":2021},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-07-06T22:35:22.282985Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:6f2c7009f4c55227f285bbb601bc1285f6e9184483f20f4a4a9adf2f40bef2a4","observation_id":"0aa2b922-6b06-47ce-a15c-99b451485171","resolution":{"observed_at":"2026-05-18T00:20:33.349072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning from Students: Applying t-Distributions to Explore Accurate and Efficient Formats for LLMs","venue":null,"work_id":"7d9049f4-8f43-4236-8dbc-25eb3f479e92","year":2024},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-07-06T22:35:22.282985Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:1c56e7f7c38183c873c0c5d7107c557b7c854c452a1e1ea9464ec5068925c5dd","observation_id":"4d617caa-5ed4-4368-a3c5-f0e4732d6285","resolution":{"observed_at":"2026-05-18T00:20:33.342113Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Anda: Unlocking Efficient LLM Inference with a Variable-Length Grouped Activation Data Format","venue":null,"work_id":"c053ab65-1592-4413-92d9-119751af37cd","year":2025},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-07-06T22:35:22.282985Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:3f3f57c8b7549eec1e408ec99b86b96ac0b7345fefeb8615578e34a3ae84c279","observation_id":"92c72bcc-f4ed-4cf7-82c9-048c642bef3b","resolution":{"observed_at":"2026-05-18T00:20:33.433912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"GPTQ: Accurate Post-training Compression for Generative Pretrained Transformers","venue":null,"work_id":"52a36ff0-8528-4b5c-9094-ab43fdf255d5","year":2023},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-07-06T22:35:22.282985Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:761090bcf47e8cb3a8176aedf6d4216719f732517bca4d7b2b2a86a6e536ca01","observation_id":"fd0a485e-3ccd-4422-9514-ede7d9e78e35","resolution":{"observed_at":"2026-05-18T00:20:33.338936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00027","last_updated":"2020-12-31T19:00:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-12-31T19:00:10Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","version":1},"cited_work":{"arxiv_id":"2101.00027","doi":"10.1117/1.jmi.10.6.061104","metadata_source":"pith","pith_arxiv_id":"2101.00027","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","venue":"cs.CL","work_id":"9b10667a-da61-4358-aceb-10578234d45d","year":2020},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-07-06T22:35:22.282985Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"cited_paper":"/paper/2101.00027","citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:80cab9f245849bf8f6576909e23951622eb5aab972c2a60b5160eaed9f921be1","observation_id":"fe1e1bfc-e012-415b-a232-62872a374461","resolution":{"observed_at":"2026-05-18T00:20:32.232926Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"records/1260860","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T14:47:14.558044Z","title":"He, B., Yin, L., Zhen, H.-L., Liu, S., Wu, H., Zhang, X., Yuan, M., and Ma, C","venue":null,"work_id":"e7e9d443-273d-4722-8ec7-59adb893de0e","year":2024},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-07-06T22:35:22.282985Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:0f8bda8c7085bcb37cb2b77f13d0ac19e28edf945bef123cde3f223f9ffe7987","observation_id":"a7d3720c-d2c1-4338-80dc-2e0477ee3806","resolution":{"observed_at":"2026-05-18T00:20:32.211612Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Energy Cost Modelling for Optimizing Large Language Model Inference on Hardware Accelerators","venue":null,"work_id":"b89cd754-85e3-4ed3-bbe7-2ee96d53e48d","year":2024},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-07-06T22:35:22.282985Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:d1289cc8736c710217e4d524e34edf29e5499a0f783bcd61dd6491c62fee5d15","observation_id":"730c8e44-014a-4199-bf83-7497416de775","resolution":{"observed_at":"2026-05-18T00:20:33.391034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"OliVe: Accelerating Large Language Models via Hardware-friendly Outlier-Victim Pair Quantization","venue":null,"work_id":"f0a3a08a-e258-4e1d-a0ef-7e41a0af9ed3","year":2023},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-07-06T22:35:22.282985Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:6996a4d1b44f592e1499054782bcd5bea3afd99250cbc96bdb0ea82fcf53351c","observation_id":"b3e9ca14-f00a-4855-871a-65d16eeecdcd","resolution":{"observed_at":"2026-05-18T00:20:33.403649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ANT: Exploiting Adaptive Numerical Data Type for Low-bit Deep Neural Network Quantization","venue":null,"work_id":"e6577c0a-86f1-4c2f-9738-e9a095b3c4df","year":2022},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-07-06T22:35:22.282985Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:4d3172b82d0e2c73bd6f754525f176d9b9aa1018fbe1b1c22fd536f5fa9ac305","observation_id":"a301124c-f97e-48c7-bce5-84946469ebf0","resolution":{"observed_at":"2026-05-18T00:20:33.555058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Newton: A DRAM-maker’s Accelerator-in- Memory (AiM) Architecture for Machine Learning","venue":null,"work_id":"29461282-729f-45ac-8411-9a61a9a50e51","year":2020},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-07-06T22:35:22.282985Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:0aef4ba7474bce71eba970a3e9b78dd833a1390928e3dd2aae8df884d1dd5595","observation_id":"f4ae97eb-9a0a-448a-a701-865a7cfd32ab","resolution":{"observed_at":"2026-05-18T00:20:33.557822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"LP-Spec: Leveraging LPDDR PIM for Efficient LLM Mobile Speculative Inference with Architecture- Dataflow Co-Optimization","venue":null,"work_id":"b81abb32-6018-48b7-aa7f-898813351a9d","year":2025},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-07-06T22:35:22.282985Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:c199e1da23b0b7b0ccf7560098470fc00c3ef82cc6b035d63de405ee0397c5f5","observation_id":"4258aa8e-5cc0-4a2e-89a0-78261b683fac","resolution":{"observed_at":"2026-05-18T00:20:33.562943Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.52202/068431-1349","metadata_source":"crossref","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"How Would the Viewer Feel? Estimating Wellbeing from Video Scenarios","venue":"Advances in Neural Information Processing Systems 35","work_id":"05596c6d-8f18-44cf-b887-1077e7ca1ad3","year":2022},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-07-06T22:35:22.282985Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:b0c4dfba77117a4edb31f930082fff14e789351fa5ff0d59be578c656b210965","observation_id":"7636e3b1-8978-4041-a7ac-96c90721699b","resolution":{"observed_at":"2026-05-18T00:20:33.547004Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"NeuPIMs: NPU-PIM Heterogeneous Acceleration for Batched LLM Inferencing","venue":null,"work_id":"b1e8d98b-385e-426c-98aa-ba97c74f5d6e","year":2024},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-07-06T22:35:22.282985Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:829451c4ab9e822b96afe223dc508fbfe66f3161b8879ddcff30ea8370572539","observation_id":"223b3dd1-693a-4b74-bb2a-7b2810876f34","resolution":{"observed_at":"2026-05-18T00:20:33.549665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","venue":null,"work_id":"e945eda3-fb23-4cc0-869a-3feb7695244b","year":2024},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-07-06T22:35:22.282985Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:eea2645352531507bfc4650d7b1dba2339ff9157ee81a9ea44e4ddfce29ca97f","observation_id":"ec386510-1f74-4678-8581-679a8b1da606","resolution":{"observed_at":"2026-05-18T00:20:33.565565Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"M-ANT: Efficient Low-bit Group Quantization 13 for LLMs via Mathematically Adaptive Numerical Type","venue":null,"work_id":"4ff8e270-cbf4-43ca-aade-3fdeaf988e6e","year":2025},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-07-06T22:35:22.282985Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:e85d7d4043a6e5f21674e6f318a0cf32ed41de7181174ed85522f57d2c0d8c92","observation_id":"b18f5743-db24-4491-acf6-16b565ecb9f0","resolution":{"observed_at":"2026-05-18T00:20:33.537830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"PLAIN: Leveraging High Internal Bandwidth in PIM for Accelerating Large Language Model Inference via Mixed-Precision Quantization","venue":null,"work_id":"f422fe14-9cd9-46db-8902-e34b77a9e1ab","year":2025},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-07-06T22:35:22.282985Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:7e38d99ccd30c44da0156ebc64fbb3e1563222ef0b685da66d57ca7285407eef","observation_id":"80654548-de0e-471d-8be6-49fe29b618bc","resolution":{"observed_at":"2026-05-18T00:20:33.543646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"FIGNA: Integer unit-based accelerator design for fp-int gemm preserving numerical accuracy","venue":null,"work_id":"7c7b7351-13c5-44f3-8c6b-8cb819060499","year":2024},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-07-06T22:35:22.282985Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:6e9ed5d248faf1073b26402b8b76005afb8a63e6b40ba227bea976f841942f29","observation_id":"51813f2e-16d3-4639-ac90-41c9a433f04b","resolution":{"observed_at":"2026-05-18T00:20:33.531034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"BlockDialect: Block-wise Fine-grained Mixed Format Quantization for Energy-Efficient LLM Inference","venue":null,"work_id":"cc57d9cd-c73c-4709-98e1-ba2f9edfcae2","year":2025},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-07-06T22:35:22.282985Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:8b49da5032d7460440a3addf995dde0ec560980821a2d0c29bdd80cfcff601cb","observation_id":"4d924579-6091-423b-b186-3eb49ad1d2e8","resolution":{"observed_at":"2026-05-18T00:20:33.533641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"High Bandwidth Memory DRAM","venue":null,"work_id":"606681c9-785d-414b-b1ea-1e5abd03abc8","year":2021},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-07-06T22:35:22.282985Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:297b994c94ba6cd2901e92ce1a0ebe3ddaf0de9ae880cd0dce2e35aea0f950ed","observation_id":"da94f300-dd5a-4261-a94a-4a3b8d313b0b","resolution":{"observed_at":"2026-05-18T00:20:33.525525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"High Bandwidth Memory (HBM3) DRAM","venue":null,"work_id":"bbba0016-b1be-4625-99f6-ca0b1ea4a0af","year":2025},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-07-06T22:35:22.282985Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:96e5ef7815dca6299508c921a3df2ec3ccd5cbe379e9e9deac46233baffed796","observation_id":"2529d643-ad30-41e9-8c70-a908eea353ea","resolution":{"observed_at":"2026-05-18T00:20:33.516901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"High Bandwidth Memory (HBM4) DRAM","venue":null,"work_id":"e3b2e1e8-3b86-4820-b6bf-ebf38047fa7f","year":2025},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-07-06T22:35:22.282985Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:a1572cec3e4e819e1f94a2a4ed7e45fd0226fbf0d008e8c7024ef10bc863dabc","observation_id":"b29bf160-1749-4b53-921e-7d66abece790","resolution":{"observed_at":"2026-05-18T00:20:33.519297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":"2310.06825","doi":"10.48550/arxiv.2310.06825","metadata_source":"pith","pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-07-10T14:47:14.537301Z","title":"Mistral 7B","venue":"cs.CL","work_id":"eb5e1305-ad11-4875-ad8d-ad8b8f697599","year":2023},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-07-06T22:35:22.282985Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:0388282d2ddc5787fe6ddd9d62f723cba1af6c8da512230ed0718fcd293ffd28","observation_id":"3200a273-e128-414a-9922-878b8eddc9a0","resolution":{"observed_at":"2026-05-18T00:20:32.203892Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-02T03:08:12.282824+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-02T03:08:12.282824+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ten Lessons From Three Generations Shaped Google’s TPUv4i: Industrial Product","venue":null,"work_id":"0eea97d0-5631-4188-8fa9-7526406c9d22","year":2021},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-07-06T22:35:22.282985Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:ab3b5004f660570e727d9a11cae548d500850c12895108a033feda33b905c3d7","observation_id":"57c2c5a6-3de8-43ed-80b8-51209280a230","resolution":{"observed_at":"2026-05-18T00:20:33.510404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"SK Hynix AI-Specific Computing Memory Solution: From AiM Device to Heterogeneous AiMX-xPU System for Comprehensive LLM Inference","venue":null,"work_id":"baf1229a-738c-4832-a469-be1ceb73ffb2","year":2024},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-07-06T22:35:22.282985Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:11a54573530792a7b70a9f503eaf7b41ad9eefb6ddbaf76fd7beb8e12d6868c3","observation_id":"18815ced-57ba-4c65-9637-f4cad0e07032","resolution":{"observed_at":"2026-05-18T00:20:33.512917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Samsung PIM/PNM for Transfmer Based AI : Energy Efficiency on PIM/PNM Cluster","venue":null,"work_id":"68924669-fab8-468c-96c0-139a8b2d859d","year":2023},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-07-06T22:35:22.282985Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:76dee7f48c8adde71d56a0074f5944b40494f07f48b84575e4f53cb95fb19f08","observation_id":"98a5828b-bcab-47f5-b38c-8744fa088213","resolution":{"observed_at":"2026-05-18T00:20:33.521864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Oaken: Fast and Efficient LLM Serving with Online-Offline Hybrid KV Cache Quantization","venue":null,"work_id":"0a4b72fe-9917-4569-81da-35e7e99a1f89","year":2025},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-07-06T22:35:22.282985Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:051df41c9910fd592f16324314cfb7a11815a5738b92b41aa443236ed6fe2833","observation_id":"4119634a-03db-4c84-8e7c-bf3219ed4ba0","resolution":{"observed_at":"2026-05-18T00:20:33.540602Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pimba: A Processing- in-Memory Acceleration for Post-Transformer Large Language Model Serving","venue":null,"work_id":"8450649a-e7ec-4775-b543-4c85f2f0763a","year":2025},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-07-06T22:35:22.282985Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:23f206faf7bbe87900797a0ad6d27c455a68076092c7b2ebc776d1b635bda743","observation_id":"13268a75-31ce-41c5-afb3-3b5db08816e7","resolution":{"observed_at":"2026-05-18T00:20:33.560520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tender: Accelerating Large Language Mod- els via Tensor Decomposition and Runtime Requantization","venue":null,"work_id":"85695d3d-74a6-4813-834c-6c382437b898","year":2024},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-07-06T22:35:22.282985Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:ddd807e663a0ab3c23c2feafc83992206d59b5233f89616c5fe3ee35c2fdeb19","observation_id":"4bed79c1-8e12-4a1a-9097-fb40f4493735","resolution":{"observed_at":"2026-05-18T00:20:33.495865Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"MX+: Pushing the Limits of Microscaling Formats for Efficient Large Language Model Serving","venue":null,"work_id":"98dfb53f-a41f-4227-b739-b9bee6593908","year":2025},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-07-06T22:35:22.282985Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:478cb2f8046a74e12f09bf722dd30453a529793d2a470ea1716738c17dd45a21","observation_id":"2d268b78-fc49-4542-b8da-6d5404da4f2d","resolution":{"observed_at":"2026-05-18T00:20:33.505237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A 1ynm 1.25V 8Gb 16Gb/s/Pin GDDR6- Based Accelerator-in-Memory Supporting 1TFLOPS MAC Operation and Various Activation Functions for Deep Learning Application","venue":null,"work_id":"d6cc8505-db8d-4210-9df0-4bbabf13052a","year":2023},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-07-06T22:35:22.282985Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:0854efea2bcd153b08bd856ad74a8564ecdf20192d00e5df0d18f05ac8068c2c","observation_id":"cfe3a37d-6b99-4a4b-9a51-624b39404277","resolution":{"observed_at":"2026-05-18T00:20:33.491616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hardware Architecture and Software Stack for PIM Based on Commercial DRAM Technology: Industrial Product","venue":null,"work_id":"2b1b2bdb-c8b8-46a2-8013-059c34203ecf","year":2021},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-07-06T22:35:22.282985Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:d85b450d0e4379c3fe451b1b2af251b13d84a2995b288deac6ae6615f7a84109","observation_id":"86221d5b-e162-42e8-ab32-738c4119ca63","resolution":{"observed_at":"2026-05-18T00:20:33.486287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"H2-LLM: Hardware-Dataflow Co-Exploration for Heterogeneous Hybrid-Bonding-based Low-Batch LLM Inference","venue":null,"work_id":"9c881444-2b6e-4aa2-b24a-63e60a15872c","year":2025},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-07-06T22:35:22.282985Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:3421cfd5d5a19c2dbc897c3b80f7cee0ed78a05ab3d6d5c15bc0775783c8da42","observation_id":"910caeb7-a98b-4182-a0ef-9451d363122b","resolution":{"observed_at":"2026-05-18T00:20:33.488924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ORCHES: Orchestrated Test-Time- Compute-based LLM Reasoning on Collaborative GPU-PIM HEteroge- neous System","venue":null,"work_id":"81157be2-edfb-40de-8b2c-b8e736491d6d","year":2025},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-07-06T22:35:22.282985Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:89c7825fa0cc81cd62a8be37416ea0815021cf46b8a1805b3cb7de51953bd334","observation_id":"f029eb9a-5252-4338-bc54-5c292db6e0fe","resolution":{"observed_at":"2026-05-18T00:20:33.507758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"AWQ: Activation-aware Weight Quan- tization for LLM Compression and Acceleration","venue":null,"work_id":"a092739b-df90-4f08-acb7-802b4d947c00","year":2024},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-07-06T22:35:22.282985Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:062928b9f6db47ce2726ad22dc36ef536cd8f9bdf293ea726077236890522946","observation_id":"a7c7dd20-0c88-4026-adb0-4a3e17011c33","resolution":{"observed_at":"2026-05-18T00:20:33.483421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"QServe: W4A8KV4 Quantization and System Co-design for Efficient LLM Serving","venue":null,"work_id":"33f54e8e-3a99-4037-84be-89d260d77b79","year":2025},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-07-06T22:35:22.282985Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:7494eed26f66499d1901a570f10938fdfa2e97e03348b6396645dbe250107275","observation_id":"7eb3f5a8-fed2-4360-b683-6b1fbe435314","resolution":{"observed_at":"2026-05-18T00:20:33.463754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"SPARK: Scalable and Precision-Aware Acceleration of Neural Networks via Ef- ficient Encoding","venue":null,"work_id":"deb0bf5f-6d10-4f2c-abc9-40170f9e1e1f","year":2024},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-07-06T22:35:22.282985Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:7c01cc9a48c2332550fc4e53b344b1d17f26ee98e2a0762838397b8ee0556719","observation_id":"d00ef8dd-72a6-4f6e-aa24-477d713a4d0a","resolution":{"observed_at":"2026-05-18T00:20:33.467168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"KIVI: A Tuning-Free Asymmetric 2bit Quantization for KV Cache","venue":null,"work_id":"15d3c6a4-df66-4df7-ba9c-96731fc7e22b","year":2024},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-07-06T22:35:22.282985Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:f7938b6dcddf187498812668955608a306d88f6d3146c5a1f70a3a1aba5a55ae","observation_id":"4b9b8b7c-91c6-44dc-a0c2-0e6b37189d8c","resolution":{"observed_at":"2026-05-18T00:20:33.470279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ramulator 2.0: A Modern, Modular, and Extensible DRAM Simulator","venue":null,"work_id":"eea7a6d2-2f9d-4fcc-80b5-bcfbb1efc269","year":2023},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-07-06T22:35:22.282985Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:b32bc61267c0d9827577e21f60a9233adfa48d957a0ab7b261c08c117d6b1c17","observation_id":"370a2073-acda-4e41-a9a1-f4bbd43360f2","resolution":{"observed_at":"2026-05-18T00:20:33.479541Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pointer sentinel mixture models","venue":null,"work_id":"4a8c0ec2-0aa7-433f-bedf-fae1cd536378","year":2017},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-07-06T22:35:22.282985Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:0463309a7c499eb66c7185d734b04bd1f64ca9ac78581eec1e414c627ca8c921","observation_id":"f560dd81-1e11-4663-be9e-d10ed09d5862","resolution":{"observed_at":"2026-05-18T00:20:33.498845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Introducing Llama 3.1: Our most capable models to date","venue":null,"work_id":"4612e6e9-f284-4124-a126-d863daa5c963","year":null},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-07-06T22:35:22.282985Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:d8ab760c977cf7886f6411191eadef5084425938708e32fbf5b0767b2b27fc36","observation_id":"04b1a893-0387-4d43-9ed3-4cbe65cf78bd","resolution":{"observed_at":"2026-05-18T00:20:33.452529Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llama-3.2-90B-Vision-Instruct","venue":null,"work_id":"43cfdbf5-214c-46b2-83ca-600fe3d430ac","year":null},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-07-06T22:35:22.282985Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:82069e75fb189a51a292884b2d3b8a86a6c2529a6ea602da36a2e003290f1ed0","observation_id":"5b87c798-2369-44d1-8b9a-d1c7a15dd751","resolution":{"observed_at":"2026-05-18T00:20:33.458550Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llama 3.2: Revolutionizing edge AI and vision with open, customizable models","venue":null,"work_id":"2d8664f6-63c4-4d12-bcd8-2d12202c6720","year":2024},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-07-06T22:35:22.282985Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:d0e2bfd474db82a7d10ad6b83abc4885caf2db0c24a1868c4de08ae5f34bdd1c","observation_id":"b2b80751-7dd5-49d2-8f89-c2600d8ab179","resolution":{"observed_at":"2026-05-18T00:20:33.448130Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Meta Llama 2","venue":null,"work_id":"f9e7d852-f149-46a7-9325-bfad0d983083","year":null},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-07-06T22:35:22.282985Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:ec9a001d37be7da2d4fb2fe51065dc232f39211679d4370536c1ec52663afa73","observation_id":"e16d8a53-e957-4f1f-8ae8-234a62a67c34","resolution":{"observed_at":"2026-05-18T00:20:33.455706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The Llama 4 herd: The beginning of a new era of natively multimodal AI innovation","venue":null,"work_id":"4f5a009a-b2e6-42d2-b412-0c7f57cdeb95","year":null},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-07-06T22:35:22.282985Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:1a0e9f11652d00cdb85a598269369f52b3d9779c9484cf512dda23018a028689","observation_id":"474e1aa6-4ec8-40a1-b4fe-a129476d8109","resolution":{"observed_at":"2026-05-18T00:20:33.528443Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.05433","last_updated":"2022-09-29T20:47:07Z","snapshot_observed_at":"2026-07-06T13:51:20.183063Z","submitted_at":"2022-09-12T17:39:55Z","title":"FP8 Formats for Deep Learning","version":2},"cited_work":{"arxiv_id":"2209.05433","doi":"10.48550/arxiv.2209.05433","metadata_source":"pith","pith_arxiv_id":"2209.05433","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"FP8 Formats for Deep Learning","venue":"cs.LG","work_id":"c7217bc9-e53d-40c5-a437-25a74abc36cd","year":2022},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-07-06T22:35:22.282985Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"cited_paper":"/paper/2209.05433","citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:d60e7bb23b833f7faf4e7f7e2fda60cc7093a171fa7b101e01bc41ee5a978941","observation_id":"bb3509a2-068d-4a9b-b2d5-f5c029e1ec85","resolution":{"observed_at":"2026-05-18T00:20:32.216570Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:35.618396+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:35.618396+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Introducing NVFP4 for Efficient and Accurate Low-Precision Inference","venue":null,"work_id":"51e5d2a7-da5f-4960-a5d4-84358cd1fbdb","year":null},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-07-06T22:35:22.282985Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:421ca5d56a6cb993d73b994306d92bd94c31bec894b2647a83fe4ae1c69b099b","observation_id":"5093e4e9-adfc-4cd1-828d-101a3284c8da","resolution":{"observed_at":"2026-05-18T00:20:33.437286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"NVIDIA Blackwell GPU Architecture","venue":null,"work_id":"9a510f83-c1ae-4dd8-a55c-df8f9ba50836","year":null},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-07-06T22:35:22.282985Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:921453ff76cf01acc2833f154858fd3531b085892bbf79e20cde4ea77897370d","observation_id":"c1b5315e-0c17-41a2-9933-d09ccb181804","resolution":{"observed_at":"2026-05-18T00:20:33.441718Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Openai o3-mini","venue":null,"work_id":"092cc02e-7806-4c94-9e70-8b0c45c167f6","year":null},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-07-06T22:35:22.282985Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:b1ccefb331cb36179c40e18517828478108b30ca2b9fd1626c17c7565c968c07","observation_id":"ac45eb04-401d-49ec-99e3-160476b0c899","resolution":{"observed_at":"2026-05-18T00:20:33.429274Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gsm8k dataset","venue":null,"work_id":"4bb0b0f0-35ce-439e-a76f-222dbe8f766f","year":null},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-07-06T22:35:22.282985Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:171c46c6eb40123116274cefae3d0ba54f2071e19dc34630d957cda15894c322","observation_id":"93764bbe-b56a-4fb8-91c1-507055548e46","resolution":{"observed_at":"2026-05-18T00:20:33.426603Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"FIGLUT: An Energy-Efficient Accelerator Design for FP-INT GEMM Using Look-Up Tables","venue":null,"work_id":"24e06716-9535-4e4d-b274-98670c043db0","year":2025},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-07-06T22:35:22.282985Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:bb7ad63c1b3dbb9db84e62feb161e9835854b17055a64248e61e7f5cd6d9e187","observation_id":"ec768789-ed4b-46d9-b381-57899850a37f","resolution":{"observed_at":"2026-05-18T00:20:33.393649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"AttAcc! Unleashing the Power of PIM for Batched Transformer- based Generative Model Inference","venue":null,"work_id":"4586b3f9-523b-4c08-b6af-ba9ec733b4bd","year":2024},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-07-06T22:35:22.282985Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:2f024ffb69e0bde506fc203d99954ede3e6c02cf7322ea509d017a96cf8fc375","observation_id":"93f03422-2c83-4024-b65d-1f3bfbff073f","resolution":{"observed_at":"2026-05-18T00:20:33.444850Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"MicroScopiQ: Ac- celerating Foundational Models through Outlier-Aware Microscaling Quantization","venue":null,"work_id":"53168261-8aca-4366-886c-17b724462db1","year":2025},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-07-06T22:35:22.282985Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:df35693d629d4d8a31990153091aa6e6cf1e83ab72fa2200d7b696dade8f71ee","observation_id":"913f3582-5df7-48b6-83e0-a79860ba73bc","resolution":{"observed_at":"2026-05-18T00:20:33.354666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"With Shared Microexponents, A Little Shifting Goes a Long Way","venue":null,"work_id":"141f2004-9ca4-4a19-af02-7c85f5dc41e2","year":2023},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-07-06T22:35:22.282985Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:3d90571adc69158941f9a444352c8fe1cdffd3b0e01ee4ee23b97ea930d939fc","observation_id":"82a7c380-c6ea-4179-8f22-dd0fa2eceba7","resolution":{"observed_at":"2026-05-18T00:20:33.421658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"IANUS: Integrated Accelerator based on NPU-PIM Unified Memory System","venue":null,"work_id":"142272af-04dc-4fa8-a2dd-b6b68aa8bd00","year":2024},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-07-06T22:35:22.282985Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:a80e7babd6f582d742a5776fe4fa3faabeea41a8f72ccc9491386bc26b281e80","observation_id":"bf252da6-c9db-4ab1-a5d5-5bf9851bd74e","resolution":{"observed_at":"2026-05-18T00:20:33.424042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"OmniQuant: Omnidirectionally Calibrated Quantization for Large Language Models","venue":null,"work_id":"60897690-93d6-4073-a9eb-133f55dc3f18","year":2024},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-07-06T22:35:22.282985Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:b0cedc153a39cc79f8ee50a25cc35d8453f4464474833ca425767b71016f6688","observation_id":"bbb88c1a-9395-482d-8aad-0a3394ea7e9c","resolution":{"observed_at":"2026-05-18T00:20:33.418893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"RoFormer: Enhanced Transformer with Rotary Position Embedding","venue":null,"work_id":"e10abbac-ace9-4966-a035-c8b123cb32ff","year":2024},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-07-06T22:35:22.282985Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:c1b2da9f9ee9a966c91e9c2873c5d110d0a872a27b102e676a566c088150f245","observation_id":"dfc59e7d-6eae-497f-9578-b4905e295fd1","resolution":{"observed_at":"2026-05-18T00:20:33.361607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":"2302.13971","doi":"10.48550/arxiv.2302.13971","metadata_source":"pith","pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-07-11T03:47:48.508181Z","title":"LLaMA: Open and Efficient Foundation Language Models","venue":"cs.CL","work_id":"c018fc23-6f3f-4035-9d02-28a2173b2b9d","year":2023},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-07-06T22:35:22.282985Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:132a54a889cab83b1260b643d9507b6480fa42739649cb84232d921990ad0c3a","observation_id":"461f9047-e068-43af-98fe-113a9a93a2bf","resolution":{"observed_at":"2026-05-18T00:20:32.170271Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-01T11:08:05.851253+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T11:08:05.851253+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.17951","last_updated":"2023-06-15T08:14:02Z","snapshot_observed_at":"2026-07-06T15:10:30.312833Z","submitted_at":"2023-03-31T10:29:17Z","title":"FP8 versus INT8 for efficient deep learning inference","version":2},"cited_work":{"arxiv_id":"2303.17951","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2303.17951","snapshot_observed_at":"2026-07-02T02:06:26.126499Z","title":"van Baalen, A","venue":null,"work_id":"c1042045-61e3-424f-89ce-fae064220f68","year":2023},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-07-06T22:35:22.282985Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"cited_paper":"/paper/2303.17951","citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:864bd57649849d798dea179d3394691867bd59efc1a6e6835992603eab999322","observation_id":"a0879e73-781c-4dcd-a536-8001cd9782b6","resolution":{"observed_at":"2026-05-18T00:20:32.176875Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09782","last_updated":"2023-07-20T18:47:20Z","snapshot_observed_at":"2026-07-06T15:55:45.131112Z","submitted_at":"2023-07-19T06:58:03Z","title":"ZeroQuant-FP: A Leap Forward in LLMs Post-Training W4A8 Quantization Using Floating-Point Formats","version":2},"cited_work":{"arxiv_id":"2307.09782","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2307.09782","snapshot_observed_at":"2026-07-03T04:37:36.371757Z","title":"ZeroQuant-FP: A Leap Forward in LLMs Post-Training W4A8 Quantization Using Floating-Point Formats","venue":null,"work_id":"1c9e9bbd-5ff2-40e0-a4e0-1e34f93c7895","year":2023},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-07-06T22:35:22.282985Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"cited_paper":"/paper/2307.09782","citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:041e3108d92065648df1da9e9b154c245eff21c7b71846b76974eefbf94cfc77","observation_id":"3c4815e1-f3c6-4828-9b6f-ad776c5e7580","resolution":{"observed_at":"2026-05-18T00:20:32.183663Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"SmoothQuant: Accurate and Efficient Post-Training Quantization for Large Language Models","venue":null,"work_id":"10cb6af3-dd1e-42ba-9684-9eadb5327957","year":2023},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-07-06T22:35:22.282985Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:ae5c09491d24a3ed666bf7076b10058d4470551fa7fd3170326ec42df496f2b5","observation_id":"49cc89dc-9e41-440a-8596-e2db780c35d4","resolution":{"observed_at":"2026-05-18T00:20:33.413716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Amove: Accelerating LLMs through Mitigating Outliers and Salient Points via Fine-Grained Grouped Vectorized Data Type","venue":null,"work_id":"0724c7de-40da-46d6-b5b0-0f33d6ec5440","year":2025},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-07-06T22:35:22.282985Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:561c7b475149ed921a607961c94d7eac1aedc5cb2ea20c5c4cf0a8f63b6f67a6","observation_id":"2a03912f-72ba-44c6-9c7c-0db39722b8e6","resolution":{"observed_at":"2026-05-18T00:20:33.416502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2412.15115","doi":"10.1145/3581783.3612503","metadata_source":"pith","pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen2.5 Technical Report","venue":"cs.CL","work_id":"d8432992-4980-4a81-85c7-9fa2c2b87f85","year":2024},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-07-06T22:35:22.282985Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:aa65e2cbfe14da439c1c79579d414e5026d74af30a723bcf9bf1b42e493cc087","observation_id":"5eb34fdd-7deb-4ff6-aee9-ffd31afc069a","resolution":{"observed_at":"2026-05-18T00:20:32.188473Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"FlashInfer: Efficient and Customizable Attention Engine for LLM Inference Serving","venue":null,"work_id":"8a0f501c-6a65-419c-abe2-0fa97bd52eb8","year":2025},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-07-06T22:35:22.282985Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:705a3cba253b4ef666bf5166882feba9e97d94ced4c77368147dd35e3bccbda9","observation_id":"6aca5194-9473-4521-8077-568ed4212ed6","resolution":{"observed_at":"2026-05-18T00:20:33.411176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Duplex: A Device for Large Language Models with Mixture of Experts, Grouped Query Attention, and Continuous Batch- ing","venue":null,"work_id":"7239c0ae-d930-4e77-9d96-0bd8e49c432a","year":2024},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-07-06T22:35:22.282985Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:73888c5f337997734223248f4b29e955e07b6597a73f9c49b751fd56817ec078","observation_id":"a23971a4-014b-412e-b08c-da7d65ce5ceb","resolution":{"observed_at":"2026-05-18T00:20:33.400872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"SageAttention: Accurate 8-Bit Attention for Plug-and-play Inference Acceleration","venue":null,"work_id":"55e01fba-fac8-4d95-abce-8a681cdf945c","year":2025},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-07-06T22:35:22.282985Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:d1bcc54573b58131e6f3dc72c9ac5a3d620eccd0de82b86303c7f3d2c0a84926","observation_id":"7cce09f4-7b68-494d-bc38-8972158ae4e1","resolution":{"observed_at":"2026-05-18T00:20:33.396613Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"DistServe: Disaggregating Prefill and Decoding for Goodput- optimized Large Language Model Serving","venue":null,"work_id":"3c1b0cc6-393f-4fae-b69a-51a29fecb908","year":2024},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-07-06T22:35:22.282985Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:f04d3ba9b5dae602008ca39d8c9a8808e7557d74d6f02e050697f4edec5c6165","observation_id":"0e81c5fb-20f9-4e49-a0a4-3ed5e59f177f","resolution":{"observed_at":"2026-05-18T00:20:33.406530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14294","last_updated":"2024-07-19T04:47:36Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T15:53:08Z","title":"A Survey on Efficient Inference for Large Language Models","version":3},"cited_work":{"arxiv_id":"2404.14294","doi":"10.48550/arxiv.2404.14294","metadata_source":"pith","pith_arxiv_id":"2404.14294","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"A Survey on Efficient Inference for Large Language Models","venue":"cs.CL","work_id":"4e58b7d0-2870-4ddb-955f-798b34deb447","year":2024},"citing_paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","snapshot_observed_at":"2026-07-06T22:35:22.282985Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats","version":4},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-18T00:16:27.497363Z"},"links":{"cited_paper":"/paper/2404.14294","citing_paper":"/paper/2511.06838"},"observation_digest":"sha256:1cbae9684790fa5ca14f5dee1b1ab4d0f3440389d224cbd4cba036d69c3ade38","observation_id":"f067f8df-4765-48fc-aab2-61a31f82e5ad","resolution":{"observed_at":"2026-05-18T00:20:32.198469Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-24T00:53:38.535897+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T00:53:38.535897+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2511.06838","last_updated":"2026-05-03T00:30:12Z","latest_version":4,"primary_category":"cs.AR","snapshot_observed_at":"2026-07-06T22:35:22.282985Z","submitted_at":"2025-11-10T08:29:34Z","title":"P3-LLM: An Integrated NPU-PIM Accelerator for Edge LLM Inference Using Hybrid Numerical Formats"},"reference_resolution":{"displayed":79,"state_counts":{"malformed_identifier":0,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":0,"verified_exact":10,"verified_fuzzy":66},"total_outbound_references":79},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 79 of 79 outbound references and 2 inbound Pith citation observations for arXiv:2511.06838."}