{"as_of":"2026-08-14T11:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:02bc7285081e75578822032a0cd2eb53d50c5011c7a8b2d88cab0c473d38ef81","coverage":[{"denominator":68,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":68,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T17:07:38.016961Z","state":"measured"},{"denominator":68,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":68,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.06989/citation-record","integrity":"/paper/2608.06989/integrity","json":"/paper/2608.06989/citation-record.json","paper":"/paper/2608.06989"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:39.057857Z","title":"cublas docs,","venue":null,"work_id":"daa27e4d-d9ad-439b-b3e3-72ce679248ec","year":2024},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-14T05:50:38.446501Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.695553Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:6c20085e8fa7e31b214b26018012dd920460f3d4536900ec927d8ec439beb603","observation_id":"080f7c07-e0e8-47ca-b1b9-04d6b9377184","resolution":{"observed_at":"2026-08-10T17:07:39.062564Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:39.042453Z","title":"High bandwidth memory dram (hbm1, hbm2) jesd235d,","venue":null,"work_id":"439f96dd-8f5e-490e-8d3d-68f24a4241c6","year":2020},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-14T05:50:38.446501Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.700788Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:8b3df2f0a184b64a8c72c11323e40c1e836e009f1cdc984e391e5305e7105e9a","observation_id":"3b74aec1-f5df-4baa-8530-498f67f321dd","resolution":{"observed_at":"2026-08-10T17:07:39.047523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:37.705355Z","title":"Analyzing cuda workloads using a detailed gpu simulator,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-14T05:50:38.446501Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.705355Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:8e39f0990be701993f743d6f4e470fa77ebf6df6ec498bd7cc92bd7b3d24d4c9","observation_id":"7468b991-2e9c-4c07-bbf3-33ac2f79386e","resolution":{"observed_at":"2026-08-10T17:07:37.705355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:37.711044Z","title":"Moe-lightning: High-throughput moe inference on memory-constrained gpus,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-14T05:50:38.446501Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.711044Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:19158d80cc3ea0ca962544f5ce4f6a695f6ab96784841b3ad8c20102affe1645","observation_id":"378b0234-3b45-48ff-a9de-f7567c195570","resolution":{"observed_at":"2026-08-10T17:07:37.711044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:37.715953Z","title":"Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-14T05:50:38.446501Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.715953Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:484229d2241beb1d8990200f8568feec09c2192dac47cdad2b3a5c45f8f74a8a","observation_id":"444dc580-08d2-4c80-a5a2-a38ff775be57","resolution":{"observed_at":"2026-08-10T17:07:37.715953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:37.720747Z","title":"Palm: Scal- ing language modeling with pathways,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-14T05:50:38.446501Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.720747Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:2408747dd63d6583502532471baf54df3cc553c02cb8c123d7a93a18687bb1ac","observation_id":"e90bd290-db89-4fdc-9e77-870ed6ebfafc","resolution":{"observed_at":"2026-08-10T17:07:37.720747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:37.726009Z","title":"Asap7: A 7-nm finfet predictive process design kit,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-14T05:50:38.446501Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.726009Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:6665981732dde9f74fd11813a01720cfa7839a2b17058d167dcc220b7f14ded8","observation_id":"4e7cea13-109a-4cc0-89e2-fe66b3d6da83","resolution":{"observed_at":"2026-08-10T17:07:37.726009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:38.977158Z","title":"Projects – COIN-OR: Computational infrastruc- ture for operations research,","venue":null,"work_id":"99b061ae-21c3-40a4-8121-644cef559c5b","year":2025},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-14T05:50:38.446501Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.730812Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:235f6b7fb02c2998b3a176854d92efbbf3c66963550cfc17487123e08a1c8d59","observation_id":"20fef4f4-2bdd-4f8d-9c9b-1bbd8eb785b5","resolution":{"observed_at":"2026-08-10T17:07:38.983040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:38.960052Z","title":"Deepseekmoe: Towards ultimate expert special- ization in mixture-of-experts language models,","venue":null,"work_id":"7023bc37-9705-4879-8f25-65b9523f7899","year":2024},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-14T05:50:38.446501Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.735097Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:c74545a717fb87efb00cd8052860da86ef3d9c2527bee563fb1b369f7cd423f7","observation_id":"57bb3874-8eea-4b32-99e2-08dbf80f3092","resolution":{"observed_at":"2026-08-10T17:07:38.965110Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:37.739364Z","title":"The true processing in memory accelerator,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-14T05:50:38.446501Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.739364Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:6cd1ea72db922f7a3798c7ed22bdc3863af4075e12cc23add16b69f895204eeb","observation_id":"7d215e54-60af-4e43-ac25-35cb46e632be","resolution":{"observed_at":"2026-08-10T17:07:37.739364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2504.06319","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:38.258911Z","title":"Accelerating llm inference throughput via asynchronous kv cache prefetching,","venue":null,"work_id":"7d9abf81-05a9-4796-98d2-adde95218249","year":2025},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-14T05:50:38.446501Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.743717Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:7f79e1331e2dfb6d9d8a78eb47de4cbaf36756f2123029d04cad4aee4fd607f3","observation_id":"b71ffb43-2818-4c36-af5b-cf38e62eec34","resolution":{"observed_at":"2026-08-10T17:07:38.266524Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-10T17:07:37.748311Z","title":"The llama 3 herd of models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-14T05:50:38.446501Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.748311Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:a9bb147ad76dc93fd6929aa92dd4d4491087be23d5d87e80a722cb2f904a7bbc","observation_id":"50e9a289-18c4-43d8-9783-6937f46a02a9","resolution":{"observed_at":"2026-08-10T17:07:37.748311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:38.931250Z","title":"Klotski: Efficient mixture-of-expert inference via expert- aware multi-batch pipeline,","venue":null,"work_id":"2190ccc7-17e4-469b-9e64-84237ae139f0","year":2025},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-14T05:50:38.446501Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.753254Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:2787f806214b93120b97c2e5e8d9e7cd7e2da737a59afbe76db4720fe4f3a91b","observation_id":"2b136343-57ca-44f0-93c7-7c43136ff078","resolution":{"observed_at":"2026-08-10T17:07:38.936738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:37.758985Z","title":"Switch transformers: Scaling to trillion parameter models with simple and efficient sparsity,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-14T05:50:38.446501Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.758985Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:cd3c53f30d7be82fe056f524d2871cd20bc26277296a2db115051da042315c0d","observation_id":"235f5503-dd76-40d3-b23f-ff66dc40534a","resolution":{"observed_at":"2026-08-10T17:07:37.758985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:38.903289Z","title":"The future of low-latency memory: Why near memory requires a new interface,","venue":null,"work_id":"4705fb05-db22-4d56-ac2c-179b3ad41374","year":2021},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-14T05:50:38.446501Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.763452Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:f3efaeae55c078a167c355d70dc978df473693cb2ed923bd8a528724c2a4b94c","observation_id":"d274dc01-2f97-413f-ab86-9d08951e2c2c","resolution":{"observed_at":"2026-08-10T17:07:38.908916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:38.886962Z","title":"Papi: Exploiting dynamic parallelism in large language model decoding with a processing-in-memory-enabled computing system,","venue":null,"work_id":"f232a899-e231-478a-af0e-dab96c17bb76","year":2025},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-14T05:50:38.446501Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.767957Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:b4bc90bcdb65e76ed0fee3d26a5179a0bda614f9f9d598a805d5fa52b5a53b2e","observation_id":"3ff899c6-eaac-45f7-8bf5-314a966c18ac","resolution":{"observed_at":"2026-08-10T17:07:38.892099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:38.872099Z","title":"Neupims: Npu-pim heterogeneous acceleration for batched llm inferencing,","venue":null,"work_id":"20730e84-5533-4275-8c87-2b9ab0b478f4","year":2024},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-14T05:50:38.446501Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.772704Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:ec0600223e7309d0400d1f4d3eeb5a22123f8f57f90d5c35f793c939a2acdbf4","observation_id":"b22b43ca-6b2c-4ab5-bd37-ff753a166092","resolution":{"observed_at":"2026-08-10T17:07:38.876912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:38.856909Z","title":"Lightllm: A versatile large language model for predictive light sensing,","venue":null,"work_id":"7bc5787d-c411-4cd4-b134-7a3775420005","year":2025},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-14T05:50:38.446501Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.778011Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:d1c9ceacb2f6c5e78053c977cc96cbb0bc994d011b2ccd03690491de8de3138c","observation_id":"4d57ed89-8e91-4723-b661-49ead71d38c0","resolution":{"observed_at":"2026-08-10T17:07:38.862011Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:38.841628Z","title":"Decoding llm performance—prefill phase is compute bound on npu,","venue":null,"work_id":"aca4a95b-6b1b-4d89-9106-f7539baab0b1","year":2025},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-14T05:50:38.446501Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.782728Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:0a054296df142702a2f1390b59cb2f546a10f1994a7cb74998a8c96dc3c90c42","observation_id":"d50537ad-5740-4fbb-94c1-ee347a01d742","resolution":{"observed_at":"2026-08-10T17:07:38.846499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-13T19:43:49.936776Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-10T17:07:37.787253Z","title":"Mixtral of experts,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-14T05:50:38.446501Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.787253Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:97351cd02a6e4433d0af33be258bbfa994f398f2724969c6c6b9c958b4f138da","observation_id":"705e2e2a-8662-45f5-9cdc-ad0240330214","resolution":{"observed_at":"2026-08-10T17:07:37.787253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:38.827120Z","title":"The battle of chatbot giants: an ex- perimental comparison of chatgpt and bard,","venue":null,"work_id":"818a0070-0de6-460b-8e48-d0ea311dd825","year":2024},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-14T05:50:38.446501Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.792301Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:a636454fc692381e8d5655c83ebd288b8849e83889eecdbbe38b6772fb24c4bc","observation_id":"ae003cce-039d-4a6a-aa1f-6631b5566e1d","resolution":{"observed_at":"2026-08-10T17:07:38.831974Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:37.796835Z","title":"Accel-sim: An extensible simulation framework for validated gpu modeling,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-14T05:50:38.446501Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.796835Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:5921ae9f0e84921981e161066915b85c25a4327d87757f8cf8a7363ced48ed53","observation_id":"c3281b42-77ec-45ea-bdbe-1c02dcc7cb58","resolution":{"observed_at":"2026-08-10T17:07:37.796835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:37.801418Z","title":"Sk hynix ai-specific computing memory solution: From aim device to heterogeneous aimx-xpu system for comprehensive llm inference,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-14T05:50:38.446501Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.801418Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:89b014271efb036538de87caf0fcdd3e9b2be41a1e4e9b8060dd6fb35776b893","observation_id":"7933b684-d142-41de-a549-86ffa7766c08","resolution":{"observed_at":"2026-08-10T17:07:37.801418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:38.792572Z","title":"Monde: Mixture of near-data experts for large-scale sparse models,","venue":null,"work_id":"d8c8451f-d417-4eef-8b97-69a54bc12ab1","year":2024},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-14T05:50:38.446501Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.806290Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:815e41d013e93fea1ee072cbd1a93f703d5b6b632718dff1d55af6014165d1dd","observation_id":"afacd144-eb5c-4f26-9bca-40082e3e05fc","resolution":{"observed_at":"2026-08-10T17:07:38.797868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:37.810685Z","title":"Efficient memory management for large language model serving with pagedattention,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-14T05:50:38.446501Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.810685Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:b648d55be70918ca5ed08ed9b99d650931a03980727a12b36de569983ae37557","observation_id":"afe5b5f9-c85c-48ec-ba8e-8fde1e61f319","resolution":{"observed_at":"2026-08-10T17:07:37.810685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:38.766345Z","title":"vllm: Easy, fast, and cheap llm serving for everyone","venue":null,"work_id":"b25571bb-b2e3-4239-ba28-ec004784df36","year":2023},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-14T05:50:38.446501Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.815171Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:abd2aa8b04b9a6abc9a7747ee7a94b388862959a871e5d472b16394ab41c7a3c","observation_id":"6b992dcc-1456-4ffe-9245-e8a383c00909","resolution":{"observed_at":"2026-08-10T17:07:38.771604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:37.819794Z","title":"A 1ynm 1.25 v 8gb, 16gb/s/pin gddr6-based accelerator-in-memory supporting 1tflops mac operation and various activation functions for deep-learning applications,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-14T05:50:38.446501Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.819794Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:67122fb7111032a112cda3d96ccc497e494cc7b480de9c967af40e26385638b8","observation_id":"1b98ec61-3a59-4a96-bfbc-b047e080cf63","resolution":{"observed_at":"2026-08-10T17:07:37.819794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:37.825298Z","title":"Hardware architecture and software stack for pim based on commercial dram technology: Industrial product,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-14T05:50:38.446501Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.825298Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:28ff5cabdcd3f7746b141b3c75fd32c00c4f14b1772ea27d11036d6c4fc46270","observation_id":"42c4c93d-eb61-4471-be5a-5da3eb13c67a","resolution":{"observed_at":"2026-08-10T17:07:37.825298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:38.731291Z","title":"H2-llm: Hardware-dataflow co-exploration for heterogeneous hybrid-bonding-based low-batch llm inference,","venue":null,"work_id":"ffaf0f55-2fad-4043-8a8d-5df3462b6e15","year":2025},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-14T05:50:38.446501Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.829870Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:97236493af65ccdd3d1e0a6927abf30cdba1ef10c2a4cf54f137b02298ae527b","observation_id":"e8f5c68a-4265-4551-9b81-93b293924ff5","resolution":{"observed_at":"2026-08-10T17:07:38.736234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:37.834220Z","title":"Ascend: a scalable and unified architecture for ubiquitous deep neural network computing: Industry track paper,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-14T05:50:38.446501Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.834220Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:b004f15808a214af6b2a92458810be1d6fba8c077774b3a5738965c10aab291f","observation_id":"bf29786f-762f-4bd4-adeb-e0dace7d7ac5","resolution":{"observed_at":"2026-08-10T17:07:37.834220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:37.838777Z","title":"Davinci: A scalable architecture for neural network computing,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-14T05:50:38.446501Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.838777Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:0fc73f3ab7d94e34e13e8518f2dca28f925b40281bc90c854132acc0548c99e4","observation_id":"d54ef2b4-5686-4447-8c92-cb43a559cf07","resolution":{"observed_at":"2026-08-10T17:07:37.838777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-11T01:48:59.557045Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-10T17:07:37.843266Z","title":"Deepseek-v3 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-14T05:50:38.446501Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.843266Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:6b511956d73fff96a6f0b0259918023403f8afb1fab9ba070c1756fbc3df6d63","observation_id":"883731a9-3936-4704-9b81-bae3e3063d8e","resolution":{"observed_at":"2026-08-10T17:07:37.843266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:37.848227Z","title":"Ramulator 2.0: A modern, modular, and extensible dram simulator,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-14T05:50:38.446501Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.848227Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:9fb41a1708bbad22428f18b66d157a16be50f5b746d314cd708f6a5d953ce3f3","observation_id":"04065920-91ef-4545-b53e-51ced19f61f5","resolution":{"observed_at":"2026-08-10T17:07:37.848227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:37.852810Z","title":"The design process for google’s training chips: Tpuv2 and tpuv3,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-14T05:50:38.446501Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.852810Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:c9608f4bc4b175efaab1b3a9674a9cea2ba33f0e1229b4204e4b4a66557a068e","observation_id":"3eeb1b74-e7fd-49a2-88cd-ca2bc0b4e623","resolution":{"observed_at":"2026-08-10T17:07:37.852810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:38.673847Z","title":"Nvidia a100 tensor core gpu architecc ture,","venue":null,"work_id":"663b2b79-bb24-48ca-9619-acfebd8b0595","year":2020},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-14T05:50:38.446501Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.857378Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:5e77d4c408521936335dc11cdfded3ff5457dcd572014609440e2a537f3d6d16","observation_id":"168726cf-77ee-4eea-8682-0b9035b2d1a5","resolution":{"observed_at":"2026-08-10T17:07:38.678996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:38.657915Z","title":"Introduction to the nvidia dgx a100 system,","venue":null,"work_id":"7ec91a82-9071-4b81-a565-a60769700f62","year":2021},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-14T05:50:38.446501Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.862209Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:4d31113fcabeabc56ea73abb78092793c7b316d000b2ccdb4155afb29732ceee","observation_id":"2cbc5a3e-9369-4398-9bdb-33fc15fed075","resolution":{"observed_at":"2026-08-10T17:07:38.663185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:38.642532Z","title":"Nvidia h100 tensor core gpu architecture,","venue":null,"work_id":"aeb25942-73e3-4c15-b27d-29299fd97fe6","year":2023},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-14T05:50:38.446501Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.867070Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:9aff6455189207a2ec8716b92e1c48a9c36e795e27c1812c51497ab1aae8557d","observation_id":"617a579e-4348-4adb-9dd0-e10c31e98954","resolution":{"observed_at":"2026-08-10T17:07:38.647557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:38.627060Z","title":"Chatgpt,","venue":null,"work_id":"9bbf0817-ecd3-42bf-9d0d-f552699113a1","year":2023},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-14T05:50:38.446501Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.871919Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:7a9276795a512f15501865a9eb5cd3b8fd7d98cca89a87a8f45f2d6f4143d249","observation_id":"acc7508a-f626-4fb4-bf34-0cabf49df959","resolution":{"observed_at":"2026-08-10T17:07:38.631915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:38.611879Z","title":"Gpt-oss-120b,","venue":null,"work_id":"799ad780-0424-49bc-b081-4f72ba6795cd","year":2025},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-14T05:50:38.446501Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.877248Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:57b01591c5b453da70e43d785c99bda806f1fa48e15c4f9bbd36b82c0cea507c","observation_id":"f63776a2-4a47-46c1-8ed1-6407f5661d28","resolution":{"observed_at":"2026-08-10T17:07:38.616441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1701.03499","last_updated":"2017-02-14T07:58:57Z","snapshot_observed_at":"2026-07-06T05:26:01.234030Z","submitted_at":"2017-01-12T20:31:53Z","title":"VESPA: VIPT Enhancements for Superpage Accesses","version":2},"cited_work":{"arxiv_id":"1701.03499","doi":null,"metadata_source":"pith","pith_arxiv_id":"1701.03499","snapshot_observed_at":"2026-08-10T17:07:38.119205Z","title":"VESPA: VIPT Enhancements for Superpage Accesses","venue":"cs.AR","work_id":"a519d08e-77a9-4ed2-8176-4ab29a067a56","year":2017},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-14T05:50:38.446501Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.882236Z"},"links":{"cited_paper":"/paper/1701.03499","citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:16b2e02d0b57afaf3c211c70b0d94b87790fcfaa80e2c86a4b2d592fe2550558","observation_id":"498eb86c-0d7a-4e71-95d6-6352ef7bec5f","resolution":{"observed_at":"2026-08-10T17:07:38.126461Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:37.887482Z","title":"Attacc! unleashing the power of pim for batched transformer- based generative model inference,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-14T05:50:38.446501Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.887482Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:d81af0e76acf3f452812ccca3c04f4df55b575623bc61cff46b5e965876115e4","observation_id":"c8ed4d31-0f97-4ba3-ac9b-152c07ca6a22","resolution":{"observed_at":"2026-08-10T17:07:37.887482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:37.892413Z","title":"Pytorch: An imperative style, high-performance deep learning library,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-14T05:50:38.446501Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.892413Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:1056a7f381d3c20188e0ba2445be3ca7f125407ebc51e5eea220497fb34894d1","observation_id":"c7f2f9ad-fd01-4eeb-b859-ee9cb25b790f","resolution":{"observed_at":"2026-08-10T17:07:37.892413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:37.896797Z","title":"Splitwise: Efficient generative llm inference using phase splitting,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-14T05:50:38.446501Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.896797Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:bf7efc3ff4a65ebbe8a466f56276f640c3f8a1adf6c368829abe37765c6a3a2c","observation_id":"adcbebf4-df7a-45c7-aab6-28ec5758aefd","resolution":{"observed_at":"2026-08-10T17:07:37.896797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:37.901598Z","title":"{DRAMA}: Exploiting{DRAM}addressing for{Cross-CPU}at- tacks,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-14T05:50:38.446501Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.901598Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:8f3e7639039e4394a2ad8544d1d1cb8bf10d245424834da954de58ff64cd0045","observation_id":"05ba398e-7adb-45ab-ba9c-aa9d5b2a9f79","resolution":{"observed_at":"2026-08-10T17:07:37.901598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12950","last_updated":"2024-01-31T19:47:26Z","snapshot_observed_at":"2026-08-13T04:25:38.282910Z","submitted_at":"2023-08-24T17:39:13Z","title":"Code Llama: Open Foundation Models for Code","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12950","snapshot_observed_at":"2026-08-10T17:07:37.906475Z","title":"Code llama: Open foundation models for code,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-14T05:50:38.446501Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.906475Z"},"links":{"cited_paper":"/paper/2308.12950","citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:50665291c9b1cf8f00cdb00517b4b4910735ab7f77bb7c6ff8fa0c5cfd8a8022","observation_id":"99cb3109-344e-4acf-91cc-a742c7736005","resolution":{"observed_at":"2026-08-10T17:07:37.906475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:38.557074Z","title":"Ramulator 2.0,","venue":null,"work_id":"a2d82db8-01b3-41c5-8b87-32ad1a30fc65","year":2023},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-14T05:50:38.446501Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.911242Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:7bcde79f5759021223eb5b18d81bc1f63ed1f29fe89bde48866c93ae0f8a7076","observation_id":"1ca98075-9a99-47dd-82d6-f1495de28c4a","resolution":{"observed_at":"2026-08-10T17:07:38.562417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:38.541724Z","title":"Khaa44801b-mc16: 8gb hbm2e flashbolt,","venue":null,"work_id":"542e19a1-a043-4b79-b59a-8606084d0199","year":null},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-14T05:50:38.446501Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.915869Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:1d2f50e52542cbde21207222db5e1751af13d9ad73b1356522bbb790253a2823","observation_id":"b8f15562-cb00-4ea5-b30e-e32804b6858b","resolution":{"observed_at":"2026-08-10T17:07:38.546657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:38.510031Z","title":"Ianus: Integrated accelerator based on npu-pim unified memory system,","venue":null,"work_id":"e39e7686-d7b4-4b81-a828-2b04369d35d3","year":2024},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-14T05:50:38.446501Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.925266Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:3fcbcdafbde1506b8a0ee845226701408153ed1567e621d5c68f7c5578b55ce9","observation_id":"3cd728a0-7f39-48ec-a0e5-4e529ffa946f","resolution":{"observed_at":"2026-08-10T17:07:38.515151Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:37.929827Z","title":"Facil: Flexible dram address mapping for soc-pim cooperative on-device llm inference,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-14T05:50:38.446501Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.929827Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:c5e1a5936eac0765597b1c8d727a6d4db135012952bc8e66eb3835a37c7a13ed","observation_id":"81964d28-58fe-4e09-9d97-aef75e69b67e","resolution":{"observed_at":"2026-08-10T17:07:37.929827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:38.484914Z","title":null,"venue":null,"work_id":"825f6fef-165e-43cd-840d-b96081c577c8","year":2024},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-14T05:50:38.446501Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.934297Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:c328817f92077237193087eaae988bb5f65923a8467329870a0e589866011735","observation_id":"b49f68be-cefb-4d46-b4dd-8d348a120514","resolution":{"observed_at":"2026-08-10T17:07:38.489538Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:38.470049Z","title":"Design compiler,","venue":null,"work_id":"22bf43c2-a419-4c6b-b96d-991aad3f59cc","year":null},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-14T05:50:38.446501Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.939466Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:2e7e3216d014420deba7cccb6f6eb9c53c85baaa332d49101b0997fa7748579b","observation_id":"b5b64ee8-ab0d-4c2a-9d06-970ec14438ff","resolution":{"observed_at":"2026-08-10T17:07:38.475000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:38.455342Z","title":"Qwen1.5-moe-a2.7b,","venue":null,"work_id":"8b8c97d6-3d0b-4d5a-ad6a-8efb84e16fa9","year":2024},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-14T05:50:38.446501Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.944163Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:d4331d711ddf254e6501b1b44a8c5e9779a7422d437a872d0b8e5c4be12e81bb","observation_id":"edce804e-4cf3-45d1-93c0-13f3a8e855f0","resolution":{"observed_at":"2026-08-10T17:07:38.460323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:38.438153Z","title":"Sglang: Efficient execution of structured language model programs,","venue":null,"work_id":"e96cf8b8-82a7-475d-9cb4-d7f232abb78b","year":2024},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-14T05:50:38.446501Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.948535Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:7b2e80fcdce38d9b156db9b8a79d11233e1d70725bb96fe2a203d8e5708e375c","observation_id":"96078f9c-7b54-41d4-b7ab-f80ab14f83f5","resolution":{"observed_at":"2026-08-10T17:07:38.443975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:38.421571Z","title":"Introducing the next generation of claude","venue":null,"work_id":"10b309e2-463a-4b03-9c55-384482d5d730","year":2024},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-14T05:50:38.446501Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.953117Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:d561aa873d743ec13e798cb0ead56017b1106ca8eaf653aa2842b88854f09851","observation_id":"910f8908-83a9-411e-8b17-1125c43caea1","resolution":{"observed_at":"2026-08-10T17:07:38.426565Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:38.405911Z","title":"Upmem software development kit (sdk),","venue":null,"work_id":"3324c3ea-cc24-495d-af64-8d522eac85a2","year":2025},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-14T05:50:38.446501Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.957755Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:e4af7ce7b483bfb4836bf8a3fb4bbe58ba2cf771cfc75b532ce67832cf3050dd","observation_id":"5a9f9032-2d6b-4cd1-a3fd-95e6b61f826e","resolution":{"observed_at":"2026-08-10T17:07:38.410712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.05100","last_updated":"2023-06-27T09:57:58Z","snapshot_observed_at":"2026-08-04T18:56:03.233715Z","submitted_at":"2022-11-09T18:48:09Z","title":"BLOOM: A 176B-Parameter Open-Access Multilingual Language Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.05100","snapshot_observed_at":"2026-08-10T17:07:37.962298Z","title":"Bloom: A 176b-parameter open-access multilingual language model,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-14T05:50:38.446501Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.962298Z"},"links":{"cited_paper":"/paper/2211.05100","citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:ca5a7ff5620a623def2127cf075e45cbc9f54c36072e93d11b7a10beb9ae7f23","observation_id":"ac10e1cc-307d-4650-b64f-292aa15c45a8","resolution":{"observed_at":"2026-08-10T17:07:37.962298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:38.390161Z","title":"Pim gpt a hybrid process in memory accelerator for autoregressive transformers,","venue":null,"work_id":"663d51bb-cdb9-4774-a0b5-505b3032fc63","year":2024},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-14T05:50:38.446501Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.967462Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:81e70fa5bfae1457301f4760b9b5452a052ec65215de8d076e4d14095c59733b","observation_id":"16927598-8583-4e6b-9871-b9556d42bcbb","resolution":{"observed_at":"2026-08-10T17:07:38.395249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:38.374918Z","title":"Waitgpt: Monitoring and steering conversational llm agent in data analysis with on-the-fly code visualization,","venue":null,"work_id":"8f4f1b4e-1b6e-4b18-b187-802a94824676","year":2024},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-14T05:50:38.446501Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.972628Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:69599f1463ea363092a83cbc267c6fac53878b2da393e46f5dc186eeb476cf3d","observation_id":"bb2bf72f-8ddb-4c6a-8ea8-7a31bf9af2e5","resolution":{"observed_at":"2026-08-10T17:07:38.379994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.05497","last_updated":"2026-05-12T10:04:18Z","snapshot_observed_at":"2026-07-06T22:31:53.944103Z","submitted_at":"2025-10-07T01:31:39Z","title":"Patterns behind Chaos: Forecasting Data Movement for Efficient Large-Scale MoE LLM Inference","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.05497","snapshot_observed_at":"2026-08-10T17:07:37.977874Z","title":"Orders in chaos: Enhancing large-scale moe llm serving with data movement forecasting,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-14T05:50:38.446501Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.977874Z"},"links":{"cited_paper":"/paper/2510.05497","citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:145b8ff5e527fcffa31a49e41551655ca87cd2d75a2b90597ab757004b9ad068","observation_id":"99b76cda-51fc-4b0d-99ae-85fb04ce4241","resolution":{"observed_at":"2026-08-10T17:07:37.977874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:38.359613Z","title":"Duplex: A device for large language models with mixture of experts, grouped query attention, and continuous batching,","venue":null,"work_id":"07724d05-c85f-42c7-ad05-1f8f978410a0","year":2024},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-14T05:50:38.446501Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.982655Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:76777cd1bcc58761658a9e53ff012986a70334cacfaed8b6f933bbe8bdc5af49","observation_id":"5f496768-78ad-464e-b06d-01e9d5510997","resolution":{"observed_at":"2026-08-10T17:07:38.364518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:37.987438Z","title":"Llmcompass: Enabling efficient hardware design for large language model inference,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-14T05:50:38.446501Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.987438Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:291406ffe54633d5b3ad66a825b59b4bca0781ebeb0cfbce1867b1b280e09052","observation_id":"1a943f7c-7f6a-461c-a0d9-e69183ee3b60","resolution":{"observed_at":"2026-08-10T17:07:37.987438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:38.334805Z","title":"Um-pim: Dram-based pim with uniform & shared memory space,","venue":null,"work_id":"4317cd13-2445-476d-9525-c6704e343ee3","year":2024},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-14T05:50:38.446501Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.992508Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:72989672f47cf237fe19e99d954dbe8464e60a3bc3352fbb03bd1f48bb1db843","observation_id":"561cccd9-80e0-41b3-b6fd-2de7b77a3ceb","resolution":{"observed_at":"2026-08-10T17:07:38.339889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:38.317345Z","title":"Lmsys-chat-1m: A large-scale real-world llm conversation dataset,","venue":null,"work_id":"fe4902b1-0b06-4bbd-8038-95ae66ef47ff","year":2023},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-14T05:50:38.446501Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.997008Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:02734f3a69411f233d6f6c6f74aec7f62e958d85f6fd6ccebb30c77f2da279a5","observation_id":"89f41714-2435-494d-a2d4-fbf1fe817cec","resolution":{"observed_at":"2026-08-10T17:07:38.324063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05897","last_updated":"2025-04-08T10:47:37Z","snapshot_observed_at":"2026-08-10T13:34:41.820599Z","submitted_at":"2025-04-08T10:47:37Z","title":"HybriMoE: Hybrid CPU-GPU Scheduling and Cache Management for Efficient MoE Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05897","snapshot_observed_at":"2026-08-10T17:07:38.001641Z","title":"Hybrimoe: Hybrid cpu-gpu scheduling and cache management for efficient moe inference,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-14T05:50:38.446501Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:38.001641Z"},"links":{"cited_paper":"/paper/2504.05897","citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:ad704f4e0ce58714179514e1fba34720fd22f7c8edee5c5427597e8b12bfd065","observation_id":"71c53d55-488d-4640-9f8b-b233e79affa2","resolution":{"observed_at":"2026-08-10T17:07:38.001641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:38.006403Z","title":"{DistServe}: Disaggregating prefill and decoding for goodput-optimized large language model serving,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-14T05:50:38.446501Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:38.006403Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:28a85f7473cc9d4c87fba5348f0fea351fd547b37a9cc7254862e47fa97cd8b8","observation_id":"e4237319-436f-4a50-9577-d0bae12978e3","resolution":{"observed_at":"2026-08-10T17:07:38.006403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:38.292435Z","title":"Mixture-of-experts with expert choice routing,","venue":null,"work_id":"f3482aef-0596-4f3d-afa3-27666d5875aa","year":2022},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-14T05:50:38.446501Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:38.011039Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:c7accceedecd40d119deb63c2fe7d440ce6b8bbc61267b426eddb01debff0e1c","observation_id":"62ce0ff7-c17c-4158-8e2c-e5372e6186df","resolution":{"observed_at":"2026-08-10T17:07:38.297303Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:38.277023Z","title":"A comprehensive analysis of superpage management mechanisms and policies,","venue":null,"work_id":"d9294960-9801-4789-91c1-2923be07041b","year":2020},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-14T05:50:38.446501Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:38.016961Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:748902144c10c36a313057bf67d5425f2a94844ea93974353be946051c374b8e","observation_id":"f3e9a925-87d8-4d46-b866-a74baf7971b1","resolution":{"observed_at":"2026-08-10T17:07:38.281956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:07:38.526061Z","title":"Available: https://semiconductor.samsung.com/dram/ hbm/hbm2e-flashbolt/khaa44801b-mc16/","venue":null,"work_id":"2c8b854a-3f4c-452c-a81e-9ea29eae94b4","year":null},"citing_paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","snapshot_observed_at":"2026-08-14T05:50:38.446501Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-10T17:07:37.920527Z"},"links":{"citing_paper":"/paper/2608.06989"},"observation_digest":"sha256:d90463bca4383f2959c37a4a812271bde498c4b9e8fe3c0ad2b34be95eae489e","observation_id":"93da23a9-244c-4f81-b22e-cd7f9d2d58e7","resolution":{"observed_at":"2026-08-10T17:07:38.531333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.06989","last_updated":"2026-08-07T09:07:59Z","latest_version":1,"primary_category":"cs.AR","snapshot_observed_at":"2026-08-14T05:50:38.446501Z","submitted_at":"2026-08-07T09:07:59Z","title":"Rethinking Unified Memory for NPU-PIM Systems: Dual-View Memory for Dynamic Inference of LLM"},"reference_resolution":{"displayed":68,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":2,"verified_fuzzy":35},"total_outbound_references":68},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 68 of 68 outbound references and 0 inbound Pith citation observations for arXiv:2608.06989."}