{"as_of":"2026-08-07T08:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:30e91a63e3ed181ef1a33601450575c50de3c81e32d44c6a1f698263f1246f6c","coverage":[{"denominator":76,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":76,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-13T01:10:03.032181Z","state":"measured"},{"denominator":76,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":76,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.08993/citation-record","integrity":"/paper/2607.08993/integrity","json":"/paper/2607.08993/citation-record.json","paper":"/paper/2607.08993"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:10:03.032181Z","title":"AWQ GitHub repository.https://github.com/mit-han-lab/llm- awq/","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.08993","last_updated":"2026-07-09T23:52:57Z","snapshot_observed_at":"2026-08-03T16:02:09.671176Z","submitted_at":"2026-07-09T23:52:57Z","title":"StreamDQ: Near-Memory Weight DeQuantization in Custom HBM for Scalable AI Inference Acceleration","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-13T01:10:03.032181Z"},"links":{"citing_paper":"/paper/2607.08993"},"observation_digest":"sha256:43e9b7c956d199618c78139f6934417469fff28bd3f89d20bbec97e6295c8e54","observation_id":"d0b5da88-3461-4e1b-ba7c-1c43d0b44aab","resolution":{"observed_at":"2026-07-13T01:10:03.032181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:10:03.032181Z","title":"NVIDIA H100 NVL GPU.https://www.nvidia.com/content/dam/ en-zz/Solutions/Data-Center/h100/PB-11773-001_v01.pdf","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.08993","last_updated":"2026-07-09T23:52:57Z","snapshot_observed_at":"2026-08-03T16:02:09.671176Z","submitted_at":"2026-07-09T23:52:57Z","title":"StreamDQ: Near-Memory Weight DeQuantization in Custom HBM for Scalable AI Inference Acceleration","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-13T01:10:03.032181Z"},"links":{"citing_paper":"/paper/2607.08993"},"observation_digest":"sha256:5f734390682f87125cfe5d1151ebf10510492afc3057aa4a82b1cf930abac678","observation_id":"75cb4bde-1478-4aa0-9a54-6541ff851bb5","resolution":{"observed_at":"2026-07-13T01:10:03.032181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:10:03.032181Z","title":"vLLM GitHub repository.https://github.com/vllm-project/vllm/","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.08993","last_updated":"2026-07-09T23:52:57Z","snapshot_observed_at":"2026-08-03T16:02:09.671176Z","submitted_at":"2026-07-09T23:52:57Z","title":"StreamDQ: Near-Memory Weight DeQuantization in Custom HBM for Scalable AI Inference Acceleration","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-13T01:10:03.032181Z"},"links":{"citing_paper":"/paper/2607.08993"},"observation_digest":"sha256:92669f5339f806c8ae18cee7bce686355679b4692084bbdc1fdc81520c8218b4","observation_id":"e32f8ed7-e5e3-4ce6-a0c8-eb02cfa8b192","resolution":{"observed_at":"2026-07-13T01:10:03.032181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:10:03.032181Z","title":"FloTHERM.https://plm.sw.siemens.com/","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08993","last_updated":"2026-07-09T23:52:57Z","snapshot_observed_at":"2026-08-03T16:02:09.671176Z","submitted_at":"2026-07-09T23:52:57Z","title":"StreamDQ: Near-Memory Weight DeQuantization in Custom HBM for Scalable AI Inference Acceleration","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-13T01:10:03.032181Z"},"links":{"citing_paper":"/paper/2607.08993"},"observation_digest":"sha256:b1884ab2b539abbac4dab17a3abf05b6b7544113e22ba61ec5c6d81c3ca981a3","observation_id":"9fe71c5b-fa21-4327-adf6-2c68779d7cc7","resolution":{"observed_at":"2026-07-13T01:10:03.032181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:10:03.032181Z","title":"NVIDIA Management Library (NVML).https://developer.nvidia","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08993","last_updated":"2026-07-09T23:52:57Z","snapshot_observed_at":"2026-08-03T16:02:09.671176Z","submitted_at":"2026-07-09T23:52:57Z","title":"StreamDQ: Near-Memory Weight DeQuantization in Custom HBM for Scalable AI Inference Acceleration","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-13T01:10:03.032181Z"},"links":{"citing_paper":"/paper/2607.08993"},"observation_digest":"sha256:b1cb9dd4a98ba0bd3f4a7ae264adeea547a2356e9049808b0862bf4f477db046","observation_id":"0834a8ef-37d7-4dc4-8520-bba7e97f0cf6","resolution":{"observed_at":"2026-07-13T01:10:03.032181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:10:03.032181Z","title":"NVIDIA NSight Compute.https://developer.nvidia.com/nsight- compute/","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08993","last_updated":"2026-07-09T23:52:57Z","snapshot_observed_at":"2026-08-03T16:02:09.671176Z","submitted_at":"2026-07-09T23:52:57Z","title":"StreamDQ: Near-Memory Weight DeQuantization in Custom HBM for Scalable AI Inference Acceleration","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-13T01:10:03.032181Z"},"links":{"citing_paper":"/paper/2607.08993"},"observation_digest":"sha256:70fd044f7c141d4d4aebf1f998bc66496454347d79835c4fe518a96b431ebc47","observation_id":"8a691a48-1048-4c3a-a072-e04c04d4baca","resolution":{"observed_at":"2026-07-13T01:10:03.032181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:10:03.032181Z","title":"NVIDIA NSight Systems.https://developer.nvidia.com/nsight- systems/","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08993","last_updated":"2026-07-09T23:52:57Z","snapshot_observed_at":"2026-08-03T16:02:09.671176Z","submitted_at":"2026-07-09T23:52:57Z","title":"StreamDQ: Near-Memory Weight DeQuantization in Custom HBM for Scalable AI Inference Acceleration","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-13T01:10:03.032181Z"},"links":{"citing_paper":"/paper/2607.08993"},"observation_digest":"sha256:89335fe2e76bb655c70b5c46b02464e6347842d7cede9894727d5d533b61b280","observation_id":"5732377d-1e4b-4b31-b50b-cfffbde9943c","resolution":{"observed_at":"2026-07-13T01:10:03.032181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:10:03.032181Z","title":"Synopsys Design Compiler.https://www.synopsys.com/","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08993","last_updated":"2026-07-09T23:52:57Z","snapshot_observed_at":"2026-08-03T16:02:09.671176Z","submitted_at":"2026-07-09T23:52:57Z","title":"StreamDQ: Near-Memory Weight DeQuantization in Custom HBM for Scalable AI Inference Acceleration","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-13T01:10:03.032181Z"},"links":{"citing_paper":"/paper/2607.08993"},"observation_digest":"sha256:08d34fbe1705b820db6bc6f61f0dfd9caa2d08390c14e07518d607d6631f4e1a","observation_id":"ad02d7b2-92de-47cd-953b-c9fb3f20ee56","resolution":{"observed_at":"2026-07-13T01:10:03.032181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:10:03.032181Z","title":"TensorRT-Weight-only-quantization.https://developer.nvidia","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08993","last_updated":"2026-07-09T23:52:57Z","snapshot_observed_at":"2026-08-03T16:02:09.671176Z","submitted_at":"2026-07-09T23:52:57Z","title":"StreamDQ: Near-Memory Weight DeQuantization in Custom HBM for Scalable AI Inference Acceleration","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-13T01:10:03.032181Z"},"links":{"citing_paper":"/paper/2607.08993"},"observation_digest":"sha256:a023294685a82497e497f32db37f38b417a8dda390d053ca7b1dea6d2ef8a94d","observation_id":"364ad72c-885f-4461-a02e-de699e9cd544","resolution":{"observed_at":"2026-07-13T01:10:03.032181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:10:03.032181Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.08993","last_updated":"2026-07-09T23:52:57Z","snapshot_observed_at":"2026-08-03T16:02:09.671176Z","submitted_at":"2026-07-09T23:52:57Z","title":"StreamDQ: Near-Memory Weight DeQuantization in Custom HBM for Scalable AI Inference Acceleration","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-13T01:10:03.032181Z"},"links":{"citing_paper":"/paper/2607.08993"},"observation_digest":"sha256:4bc7ef5b2ec55f1395c7b76c5b35a64590c5f589fea39baada573a6d8da30e3b","observation_id":"8eaf4db0-5bc8-4285-b113-eeaed3c7ea1a","resolution":{"observed_at":"2026-07-13T01:10:03.032181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:10:03.032181Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.08993","last_updated":"2026-07-09T23:52:57Z","snapshot_observed_at":"2026-08-03T16:02:09.671176Z","submitted_at":"2026-07-09T23:52:57Z","title":"StreamDQ: Near-Memory Weight DeQuantization in Custom HBM for Scalable AI Inference Acceleration","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-13T01:10:03.032181Z"},"links":{"citing_paper":"/paper/2607.08993"},"observation_digest":"sha256:23c5e60b073b156c1b7edfe9e5f47924247400aebb3a8072e65166a4a848d919","observation_id":"9e0fb216-1738-4ce7-ab87-26bbea732c5d","resolution":{"observed_at":"2026-07-13T01:10:03.032181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:10:03.032181Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.08993","last_updated":"2026-07-09T23:52:57Z","snapshot_observed_at":"2026-08-03T16:02:09.671176Z","submitted_at":"2026-07-09T23:52:57Z","title":"StreamDQ: Near-Memory Weight DeQuantization in Custom HBM for Scalable AI Inference Acceleration","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-13T01:10:03.032181Z"},"links":{"citing_paper":"/paper/2607.08993"},"observation_digest":"sha256:12cf67983a41f51b21b53467866ea5eb03dbbc342a46baa5b6a9ee2f3370974a","observation_id":"f4c52379-ea00-4419-92e4-8a20241bd9e4","resolution":{"observed_at":"2026-07-13T01:10:03.032181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:10:03.032181Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.08993","last_updated":"2026-07-09T23:52:57Z","snapshot_observed_at":"2026-08-03T16:02:09.671176Z","submitted_at":"2026-07-09T23:52:57Z","title":"StreamDQ: Near-Memory Weight DeQuantization in Custom HBM for Scalable AI Inference Acceleration","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-13T01:10:03.032181Z"},"links":{"citing_paper":"/paper/2607.08993"},"observation_digest":"sha256:f268e5e191b34367edffe55adf23f8c8943a4aa6ed846895443f27af8eaf63d0","observation_id":"b20419c8-df38-4b1f-96c6-757744719bf3","resolution":{"observed_at":"2026-07-13T01:10:03.032181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:10:03.032181Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08993","last_updated":"2026-07-09T23:52:57Z","snapshot_observed_at":"2026-08-03T16:02:09.671176Z","submitted_at":"2026-07-09T23:52:57Z","title":"StreamDQ: Near-Memory Weight DeQuantization in Custom HBM for Scalable AI Inference Acceleration","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-13T01:10:03.032181Z"},"links":{"citing_paper":"/paper/2607.08993"},"observation_digest":"sha256:2026ddb003b0463995c1402113c8f491bb6b5c78c0c0b8a20562e8181022d7d8","observation_id":"d73e7b3d-48ab-4e0b-8ac7-9010744c85f8","resolution":{"observed_at":"2026-07-13T01:10:03.032181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:10:03.032181Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.08993","last_updated":"2026-07-09T23:52:57Z","snapshot_observed_at":"2026-08-03T16:02:09.671176Z","submitted_at":"2026-07-09T23:52:57Z","title":"StreamDQ: Near-Memory Weight DeQuantization in Custom HBM for Scalable AI Inference Acceleration","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-13T01:10:03.032181Z"},"links":{"citing_paper":"/paper/2607.08993"},"observation_digest":"sha256:75e432bfc3dd1b667bf30d2dc3f9006350f93b17a02f9e6bacd716e8d45c858b","observation_id":"b4700904-5106-4134-923c-ade1f166edaf","resolution":{"observed_at":"2026-07-13T01:10:03.032181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:10:03.032181Z","title":null,"venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2607.08993","last_updated":"2026-07-09T23:52:57Z","snapshot_observed_at":"2026-08-03T16:02:09.671176Z","submitted_at":"2026-07-09T23:52:57Z","title":"StreamDQ: Near-Memory Weight DeQuantization in Custom HBM for Scalable AI Inference Acceleration","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-13T01:10:03.032181Z"},"links":{"citing_paper":"/paper/2607.08993"},"observation_digest":"sha256:ef68e9b1b5d8591ea92d797459f61a32d75f34a70b756350b23dd28779b2159b","observation_id":"a615ed01-ab18-4a72-9243-85f86be8cb49","resolution":{"observed_at":"2026-07-13T01:10:03.032181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:10:03.032181Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.08993","last_updated":"2026-07-09T23:52:57Z","snapshot_observed_at":"2026-08-03T16:02:09.671176Z","submitted_at":"2026-07-09T23:52:57Z","title":"StreamDQ: Near-Memory Weight DeQuantization in Custom HBM for Scalable AI Inference Acceleration","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-13T01:10:03.032181Z"},"links":{"citing_paper":"/paper/2607.08993"},"observation_digest":"sha256:17aeb4b448491fcb54530996656042ae7eb298d2add6ac4b3c38498456cb0af7","observation_id":"06d0d6f4-93c2-4097-bc99-994db77fcc43","resolution":{"observed_at":"2026-07-13T01:10:03.032181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:10:03.032181Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.08993","last_updated":"2026-07-09T23:52:57Z","snapshot_observed_at":"2026-08-03T16:02:09.671176Z","submitted_at":"2026-07-09T23:52:57Z","title":"StreamDQ: Near-Memory Weight DeQuantization in Custom HBM for Scalable AI Inference Acceleration","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-13T01:10:03.032181Z"},"links":{"citing_paper":"/paper/2607.08993"},"observation_digest":"sha256:d19f77fdf31165367f30407b327ffcca90b031addf78292612f0ecfa5f54c336","observation_id":"aa7457c3-a334-4755-bcba-67cf9bc0e0bc","resolution":{"observed_at":"2026-07-13T01:10:03.032181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:10:03.032181Z","title":"int8 (): 8-bit matrix multiplication for transformers at scale.Advances in neural information processing systems35 (2022), 30318–30332","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.08993","last_updated":"2026-07-09T23:52:57Z","snapshot_observed_at":"2026-08-03T16:02:09.671176Z","submitted_at":"2026-07-09T23:52:57Z","title":"StreamDQ: Near-Memory Weight DeQuantization in Custom HBM for Scalable AI Inference Acceleration","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-13T01:10:03.032181Z"},"links":{"citing_paper":"/paper/2607.08993"},"observation_digest":"sha256:05e38f099533db8073439c8cf5189a07041342065bca22b86b654ec196d46da5","observation_id":"62199408-a4ae-4a31-bc47-668e1b04ea85","resolution":{"observed_at":"2026-07-13T01:10:03.032181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:10:03.032181Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08993","last_updated":"2026-07-09T23:52:57Z","snapshot_observed_at":"2026-08-03T16:02:09.671176Z","submitted_at":"2026-07-09T23:52:57Z","title":"StreamDQ: Near-Memory Weight DeQuantization in Custom HBM for Scalable AI Inference Acceleration","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-13T01:10:03.032181Z"},"links":{"citing_paper":"/paper/2607.08993"},"observation_digest":"sha256:49ff79af1a8effb76500538bcd5178148ee770e13375ec15de18457bf99e86ac","observation_id":"eae854f0-15a1-4525-89a3-866236a892c1","resolution":{"observed_at":"2026-07-13T01:10:03.032181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.17323","last_updated":"2023-03-22T13:10:47Z","snapshot_observed_at":"2026-08-07T08:38:54.025062Z","submitted_at":"2022-10-31T13:42:40Z","title":"GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.17323","snapshot_observed_at":"2026-07-13T01:10:03.032181Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.08993","last_updated":"2026-07-09T23:52:57Z","snapshot_observed_at":"2026-08-03T16:02:09.671176Z","submitted_at":"2026-07-09T23:52:57Z","title":"StreamDQ: Near-Memory Weight DeQuantization in Custom HBM for Scalable AI Inference Acceleration","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-13T01:10:03.032181Z"},"links":{"cited_paper":"/paper/2210.17323","citing_paper":"/paper/2607.08993"},"observation_digest":"sha256:414a0370d60f7bc822133d4b64208de2b11c398e29edd7a575a3617038f18b41","observation_id":"e3f26909-a5f9-4f0f-b0b8-05684a9315eb","resolution":{"observed_at":"2026-07-13T01:10:03.032181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:10:03.032181Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.08993","last_updated":"2026-07-09T23:52:57Z","snapshot_observed_at":"2026-08-03T16:02:09.671176Z","submitted_at":"2026-07-09T23:52:57Z","title":"StreamDQ: Near-Memory Weight DeQuantization in Custom HBM for Scalable AI Inference Acceleration","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-13T01:10:03.032181Z"},"links":{"citing_paper":"/paper/2607.08993"},"observation_digest":"sha256:824ffbd627d96bfa88261e41caad101af5345d6fb88a0c32a7248a31bc16a8c7","observation_id":"b59f9414-ac4d-458b-a75a-2a4c0cd259ea","resolution":{"observed_at":"2026-07-13T01:10:03.032181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:10:03.032181Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.08993","last_updated":"2026-07-09T23:52:57Z","snapshot_observed_at":"2026-08-03T16:02:09.671176Z","submitted_at":"2026-07-09T23:52:57Z","title":"StreamDQ: Near-Memory Weight DeQuantization in Custom HBM for Scalable AI Inference Acceleration","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-13T01:10:03.032181Z"},"links":{"citing_paper":"/paper/2607.08993"},"observation_digest":"sha256:120633b10841118309d4ee61a16ce3bf0b7ca4fb3894881f433d0c5784c7d4df","observation_id":"c5470fe1-aa42-468c-9014-771ae014542c","resolution":{"observed_at":"2026-07-13T01:10:03.032181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:10:03.032181Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.08993","last_updated":"2026-07-09T23:52:57Z","snapshot_observed_at":"2026-08-03T16:02:09.671176Z","submitted_at":"2026-07-09T23:52:57Z","title":"StreamDQ: Near-Memory Weight DeQuantization in Custom HBM for Scalable AI Inference Acceleration","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-13T01:10:03.032181Z"},"links":{"citing_paper":"/paper/2607.08993"},"observation_digest":"sha256:000f4a42eb2115754167f5424d6e1be0c55a1f9196ea32ec026c261fcc9bee8a","observation_id":"e8cad5e9-a754-4629-a443-ddae322c182e","resolution":{"observed_at":"2026-07-13T01:10:03.032181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:10:03.032181Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.08993","last_updated":"2026-07-09T23:52:57Z","snapshot_observed_at":"2026-08-03T16:02:09.671176Z","submitted_at":"2026-07-09T23:52:57Z","title":"StreamDQ: Near-Memory Weight DeQuantization in Custom HBM for Scalable AI Inference Acceleration","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-13T01:10:03.032181Z"},"links":{"citing_paper":"/paper/2607.08993"},"observation_digest":"sha256:d9bfde0ae3074743b4127b089cff97cd8f0aded5329419ec1bf6401773058593","observation_id":"39c9cb58-7ea9-4cb6-a102-43e231dbd6b2","resolution":{"observed_at":"2026-07-13T01:10:03.032181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:10:03.032181Z","title":"InProceedings of the IEEE conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.08993","last_updated":"2026-07-09T23:52:57Z","snapshot_observed_at":"2026-08-03T16:02:09.671176Z","submitted_at":"2026-07-09T23:52:57Z","title":"StreamDQ: Near-Memory Weight DeQuantization in Custom HBM for Scalable AI Inference Acceleration","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-13T01:10:03.032181Z"},"links":{"citing_paper":"/paper/2607.08993"},"observation_digest":"sha256:1dd3fe4b84ca762ab9558c4f6fad09a56dd4f7a592f7caa4b652ee3f296b81fa","observation_id":"2d05d036-7c23-4829-8711-39ea3c512b63","resolution":{"observed_at":"2026-07-13T01:10:03.032181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:10:03.032181Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.08993","last_updated":"2026-07-09T23:52:57Z","snapshot_observed_at":"2026-08-03T16:02:09.671176Z","submitted_at":"2026-07-09T23:52:57Z","title":"StreamDQ: Near-Memory Weight DeQuantization in Custom HBM for Scalable AI Inference Acceleration","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-13T01:10:03.032181Z"},"links":{"citing_paper":"/paper/2607.08993"},"observation_digest":"sha256:13ca011d905d71950d2b7c4975ff5be09d036f21d223425d090f6c48a556b447","observation_id":"4d7daa7a-264a-4b8e-8ed7-4f36d87f3f69","resolution":{"observed_at":"2026-07-13T01:10:03.032181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:10:03.032181Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.08993","last_updated":"2026-07-09T23:52:57Z","snapshot_observed_at":"2026-08-03T16:02:09.671176Z","submitted_at":"2026-07-09T23:52:57Z","title":"StreamDQ: Near-Memory Weight DeQuantization in Custom HBM for Scalable AI Inference Acceleration","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-13T01:10:03.032181Z"},"links":{"citing_paper":"/paper/2607.08993"},"observation_digest":"sha256:051270761538ce6eaec177237ac226bd8ee280e84dba99bb4b738fc8329f6ddc","observation_id":"54c32933-5f26-4daf-add0-51d2c0ed6151","resolution":{"observed_at":"2026-07-13T01:10:03.032181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:10:03.032181Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.08993","last_updated":"2026-07-09T23:52:57Z","snapshot_observed_at":"2026-08-03T16:02:09.671176Z","submitted_at":"2026-07-09T23:52:57Z","title":"StreamDQ: Near-Memory Weight DeQuantization in Custom HBM for Scalable AI Inference Acceleration","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-13T01:10:03.032181Z"},"links":{"citing_paper":"/paper/2607.08993"},"observation_digest":"sha256:3281dc6234b264c2fa7035102d31bcb575cf47f57e8b66a8e8f572eb6878e26f","observation_id":"39bb0f80-d69c-4e7a-99c3-571c7bd01733","resolution":{"observed_at":"2026-07-13T01:10:03.032181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-07-13T01:10:03.032181Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.08993","last_updated":"2026-07-09T23:52:57Z","snapshot_observed_at":"2026-08-03T16:02:09.671176Z","submitted_at":"2026-07-09T23:52:57Z","title":"StreamDQ: Near-Memory Weight DeQuantization in Custom HBM for Scalable AI Inference Acceleration","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-13T01:10:03.032181Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2607.08993"},"observation_digest":"sha256:75b9da3516a73182fa668258cf54b1bf5447818bd3819777f60988f83a3b64d6","observation_id":"ad10a104-3c2b-42cf-b3ae-8e9a5289b9b0","resolution":{"observed_at":"2026-07-13T01:10:03.032181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:10:03.032181Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.08993","last_updated":"2026-07-09T23:52:57Z","snapshot_observed_at":"2026-08-03T16:02:09.671176Z","submitted_at":"2026-07-09T23:52:57Z","title":"StreamDQ: Near-Memory Weight DeQuantization in Custom HBM for Scalable AI Inference Acceleration","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-13T01:10:03.032181Z"},"links":{"citing_paper":"/paper/2607.08993"},"observation_digest":"sha256:5c4c6338cd9c1da355c8668375f73c91e889648b92ed1794b120b9e38c4e8d6d","observation_id":"ab16eb30-2ff8-40ca-a949-64208d19e93a","resolution":{"observed_at":"2026-07-13T01:10:03.032181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:10:03.032181Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.08993","last_updated":"2026-07-09T23:52:57Z","snapshot_observed_at":"2026-08-03T16:02:09.671176Z","submitted_at":"2026-07-09T23:52:57Z","title":"StreamDQ: Near-Memory Weight DeQuantization in Custom HBM for Scalable AI Inference Acceleration","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-13T01:10:03.032181Z"},"links":{"citing_paper":"/paper/2607.08993"},"observation_digest":"sha256:ae3b08fd51939d3ed04369d441685fb8c0405326e2e39074c3d15733a2cea76b","observation_id":"b60fbefa-2b07-40bd-94a2-baa13222deaa","resolution":{"observed_at":"2026-07-13T01:10:03.032181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-07-13T01:10:03.032181Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.08993","last_updated":"2026-07-09T23:52:57Z","snapshot_observed_at":"2026-08-03T16:02:09.671176Z","submitted_at":"2026-07-09T23:52:57Z","title":"StreamDQ: Near-Memory Weight DeQuantization in Custom HBM for Scalable AI Inference Acceleration","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-13T01:10:03.032181Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2607.08993"},"observation_digest":"sha256:4348bc47bc68e868ed9af2f92b0d9da7e569d4a201b3ef36206f0db5c6857301","observation_id":"30e63d77-7751-4ebf-8c4f-0973aa7fe04f","resolution":{"observed_at":"2026-07-13T01:10:03.032181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:10:03.032181Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.08993","last_updated":"2026-07-09T23:52:57Z","snapshot_observed_at":"2026-08-03T16:02:09.671176Z","submitted_at":"2026-07-09T23:52:57Z","title":"StreamDQ: Near-Memory Weight DeQuantization in Custom HBM for Scalable AI Inference Acceleration","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-13T01:10:03.032181Z"},"links":{"citing_paper":"/paper/2607.08993"},"observation_digest":"sha256:85b9adb9b0293e8d4121fec90e384174abc300d09ee34b4478c2ed3a0ee6d049","observation_id":"da63b521-8e3f-4dfa-ac1e-9c2115f95ec7","resolution":{"observed_at":"2026-07-13T01:10:03.032181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:10:03.032181Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.08993","last_updated":"2026-07-09T23:52:57Z","snapshot_observed_at":"2026-08-03T16:02:09.671176Z","submitted_at":"2026-07-09T23:52:57Z","title":"StreamDQ: Near-Memory Weight DeQuantization in Custom HBM for Scalable AI Inference Acceleration","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-13T01:10:03.032181Z"},"links":{"citing_paper":"/paper/2607.08993"},"observation_digest":"sha256:b1c6ebf6a75244b6e3cf49e4595092939418d5dfb76f3a0b3263bcf3e479bbe8","observation_id":"99b8a849-93a2-4da8-8cea-84f48c3cd097","resolution":{"observed_at":"2026-07-13T01:10:03.032181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:10:03.032181Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.08993","last_updated":"2026-07-09T23:52:57Z","snapshot_observed_at":"2026-08-03T16:02:09.671176Z","submitted_at":"2026-07-09T23:52:57Z","title":"StreamDQ: Near-Memory Weight DeQuantization in Custom HBM for Scalable AI Inference Acceleration","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-13T01:10:03.032181Z"},"links":{"citing_paper":"/paper/2607.08993"},"observation_digest":"sha256:6c94aee61a1dad05b23df827c259e98734b1d31c77ec067ec96f24b2deda5cf4","observation_id":"cac02070-cbb8-444d-a001-f36861d197c5","resolution":{"observed_at":"2026-07-13T01:10:03.032181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:10:03.032181Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.08993","last_updated":"2026-07-09T23:52:57Z","snapshot_observed_at":"2026-08-03T16:02:09.671176Z","submitted_at":"2026-07-09T23:52:57Z","title":"StreamDQ: Near-Memory Weight DeQuantization in Custom HBM for Scalable AI Inference Acceleration","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-13T01:10:03.032181Z"},"links":{"citing_paper":"/paper/2607.08993"},"observation_digest":"sha256:8e7e19f4f122c5ef20112e63984699dc67c8bc9a6b6134be3fbdc80173d3ccfe","observation_id":"8f8ecf25-754e-4290-a1a0-249cdffe1e21","resolution":{"observed_at":"2026-07-13T01:10:03.032181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:10:03.032181Z","title":"InProceedings of the International Conference for High Performance Computing, Networking, Storage and Analysis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.08993","last_updated":"2026-07-09T23:52:57Z","snapshot_observed_at":"2026-08-03T16:02:09.671176Z","submitted_at":"2026-07-09T23:52:57Z","title":"StreamDQ: Near-Memory Weight DeQuantization in Custom HBM for Scalable AI Inference Acceleration","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-13T01:10:03.032181Z"},"links":{"citing_paper":"/paper/2607.08993"},"observation_digest":"sha256:d6c96e34af9eb3bed495465aa15c55a244bb331cc99bbeb930d19ffdce295f02","observation_id":"eda5d5ed-c6f7-473f-83d0-bae92b3b2c37","resolution":{"observed_at":"2026-07-13T01:10:03.032181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:10:03.032181Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08993","last_updated":"2026-07-09T23:52:57Z","snapshot_observed_at":"2026-08-03T16:02:09.671176Z","submitted_at":"2026-07-09T23:52:57Z","title":"StreamDQ: Near-Memory Weight DeQuantization in Custom HBM for Scalable AI Inference Acceleration","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-13T01:10:03.032181Z"},"links":{"citing_paper":"/paper/2607.08993"},"observation_digest":"sha256:69cd7ba4a1aa8020fb305d15a03bfe4d0f2d946a0785a09f99fb4285508a8b4d","observation_id":"d1a0d435-c214-4a66-9637-94f85c195e8f","resolution":{"observed_at":"2026-07-13T01:10:03.032181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07629","last_updated":"2024-06-05T03:57:41Z","snapshot_observed_at":"2026-08-05T21:17:46.828705Z","submitted_at":"2023-06-13T08:57:54Z","title":"SqueezeLLM: Dense-and-Sparse Quantization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07629","snapshot_observed_at":"2026-07-13T01:10:03.032181Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.08993","last_updated":"2026-07-09T23:52:57Z","snapshot_observed_at":"2026-08-03T16:02:09.671176Z","submitted_at":"2026-07-09T23:52:57Z","title":"StreamDQ: Near-Memory Weight DeQuantization in Custom HBM for Scalable AI Inference Acceleration","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-13T01:10:03.032181Z"},"links":{"cited_paper":"/paper/2306.07629","citing_paper":"/paper/2607.08993"},"observation_digest":"sha256:b1808e1e35b2fe26e21f7eec65d0cd8a7fb0830fc81aff8f9a88e9d19e94c7f4","observation_id":"91ab3514-5ab9-417b-bd6b-a58cc4aea220","resolution":{"observed_at":"2026-07-13T01:10:03.032181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10076","last_updated":"2024-02-15T16:38:41Z","snapshot_observed_at":"2026-08-01T13:17:34.602575Z","submitted_at":"2024-02-15T16:38:41Z","title":"QUICK: Quantization-aware Interleaving and Conflict-free Kernel for efficient LLM inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10076","snapshot_observed_at":"2026-07-13T01:10:03.032181Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.08993","last_updated":"2026-07-09T23:52:57Z","snapshot_observed_at":"2026-08-03T16:02:09.671176Z","submitted_at":"2026-07-09T23:52:57Z","title":"StreamDQ: Near-Memory Weight DeQuantization in Custom HBM for Scalable AI Inference Acceleration","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-13T01:10:03.032181Z"},"links":{"cited_paper":"/paper/2402.10076","citing_paper":"/paper/2607.08993"},"observation_digest":"sha256:bf2aab4977dd7aa594f4ccd49cdea65209be6e28ba84ae54664ca7748c6a3040","observation_id":"f490cb86-8e3d-4172-bceb-09c3baccc34d","resolution":{"observed_at":"2026-07-13T01:10:03.032181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:10:03.032181Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.08993","last_updated":"2026-07-09T23:52:57Z","snapshot_observed_at":"2026-08-03T16:02:09.671176Z","submitted_at":"2026-07-09T23:52:57Z","title":"StreamDQ: Near-Memory Weight DeQuantization in Custom HBM for Scalable AI Inference Acceleration","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-13T01:10:03.032181Z"},"links":{"citing_paper":"/paper/2607.08993"},"observation_digest":"sha256:4dac974c3197d2a73dbd95e0ff8182a1b13fda2711a206718b20c2b170cced6f","observation_id":"f7dec1dd-1d58-4a1b-9ef3-6ad2c3e1e001","resolution":{"observed_at":"2026-07-13T01:10:03.032181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:10:03.032181Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.08993","last_updated":"2026-07-09T23:52:57Z","snapshot_observed_at":"2026-08-03T16:02:09.671176Z","submitted_at":"2026-07-09T23:52:57Z","title":"StreamDQ: Near-Memory Weight DeQuantization in Custom HBM for Scalable AI Inference Acceleration","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-13T01:10:03.032181Z"},"links":{"citing_paper":"/paper/2607.08993"},"observation_digest":"sha256:32e3df80c1be48e24f8ccd8b245b57fe4585de69faef2d0e85f801565646c58a","observation_id":"e816ef1b-7fdb-4471-861d-9691d04c1a61","resolution":{"observed_at":"2026-07-13T01:10:03.032181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:10:03.032181Z","title":"InProceedings of the 29th symposium on operating systems principles","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.08993","last_updated":"2026-07-09T23:52:57Z","snapshot_observed_at":"2026-08-03T16:02:09.671176Z","submitted_at":"2026-07-09T23:52:57Z","title":"StreamDQ: Near-Memory Weight DeQuantization in Custom HBM for Scalable AI Inference Acceleration","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-13T01:10:03.032181Z"},"links":{"citing_paper":"/paper/2607.08993"},"observation_digest":"sha256:f48f62652dc32baae71fa284bbfb9b45ce282a147776e719faf72efa00d1f588","observation_id":"8b64c419-c8a0-42e5-8637-620c9d6d7203","resolution":{"observed_at":"2026-07-13T01:10:03.032181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:10:03.032181Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.08993","last_updated":"2026-07-09T23:52:57Z","snapshot_observed_at":"2026-08-03T16:02:09.671176Z","submitted_at":"2026-07-09T23:52:57Z","title":"StreamDQ: Near-Memory Weight DeQuantization in Custom HBM for Scalable AI Inference Acceleration","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-13T01:10:03.032181Z"},"links":{"citing_paper":"/paper/2607.08993"},"observation_digest":"sha256:ae309ca7e4d237c19654b9a0f1b7d00b702172b5edba9a042f3c34a5c8634472","observation_id":"41acf1b4-ec0f-42d2-b850-c3d67c808778","resolution":{"observed_at":"2026-07-13T01:10:03.032181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:10:03.032181Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.08993","last_updated":"2026-07-09T23:52:57Z","snapshot_observed_at":"2026-08-03T16:02:09.671176Z","submitted_at":"2026-07-09T23:52:57Z","title":"StreamDQ: Near-Memory Weight DeQuantization in Custom HBM for Scalable AI Inference Acceleration","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-13T01:10:03.032181Z"},"links":{"citing_paper":"/paper/2607.08993"},"observation_digest":"sha256:aa98e6e986b6ef90e9e7d2d21502ff6b868265bb988913abab64cdb75913d2ac","observation_id":"3ae34834-5a8e-4042-aa34-1384379d097a","resolution":{"observed_at":"2026-07-13T01:10:03.032181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:10:03.032181Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.08993","last_updated":"2026-07-09T23:52:57Z","snapshot_observed_at":"2026-08-03T16:02:09.671176Z","submitted_at":"2026-07-09T23:52:57Z","title":"StreamDQ: Near-Memory Weight DeQuantization in Custom HBM for Scalable AI Inference Acceleration","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-13T01:10:03.032181Z"},"links":{"citing_paper":"/paper/2607.08993"},"observation_digest":"sha256:470af24e1a2af915068a7c334d4fec74abace5d58e76aeae4d2675aae1afb295","observation_id":"7541a11a-411f-469e-9d96-8e7e278cc77f","resolution":{"observed_at":"2026-07-13T01:10:03.032181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04532","last_updated":"2025-05-01T02:14:05Z","snapshot_observed_at":"2026-07-06T18:11:09.767624Z","submitted_at":"2024-05-07T17:59:30Z","title":"QServe: W4A8KV4 Quantization and System Co-design for Efficient LLM Serving","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04532","snapshot_observed_at":"2026-07-13T01:10:03.032181Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.08993","last_updated":"2026-07-09T23:52:57Z","snapshot_observed_at":"2026-08-03T16:02:09.671176Z","submitted_at":"2026-07-09T23:52:57Z","title":"StreamDQ: Near-Memory Weight DeQuantization in Custom HBM for Scalable AI Inference Acceleration","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-13T01:10:03.032181Z"},"links":{"cited_paper":"/paper/2405.04532","citing_paper":"/paper/2607.08993"},"observation_digest":"sha256:8d3321ddc2f01ff120f468f1249f8ead987b987622f6daab6709eeb7b35f5763","observation_id":"b1cd48d4-d862-4eae-9072-1bc8fd4d00ee","resolution":{"observed_at":"2026-07-13T01:10:03.032181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:10:03.032181Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.08993","last_updated":"2026-07-09T23:52:57Z","snapshot_observed_at":"2026-08-03T16:02:09.671176Z","submitted_at":"2026-07-09T23:52:57Z","title":"StreamDQ: Near-Memory Weight DeQuantization in Custom HBM for Scalable AI Inference Acceleration","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-13T01:10:03.032181Z"},"links":{"citing_paper":"/paper/2607.08993"},"observation_digest":"sha256:cb4e1ea8a765574c2e877dcc090a31f3cc78101c7988312a5366f1d453bc70e7","observation_id":"669e74c3-96c1-4e65-a054-3d87dc1fc759","resolution":{"observed_at":"2026-07-13T01:10:03.032181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:10:03.032181Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08993","last_updated":"2026-07-09T23:52:57Z","snapshot_observed_at":"2026-08-03T16:02:09.671176Z","submitted_at":"2026-07-09T23:52:57Z","title":"StreamDQ: Near-Memory Weight DeQuantization in Custom HBM for Scalable AI Inference Acceleration","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-13T01:10:03.032181Z"},"links":{"citing_paper":"/paper/2607.08993"},"observation_digest":"sha256:102c0f2365dbcb744a614d44bce581ec55f4a6a56e1559f6cf6181b1afb56234","observation_id":"1754fb07-c4dc-4794-a7a4-574e7ca1d8c2","resolution":{"observed_at":"2026-07-13T01:10:03.032181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.06672","last_updated":"2023-01-17T02:56:08Z","snapshot_observed_at":"2026-07-06T14:41:52.219225Z","submitted_at":"2023-01-17T02:56:08Z","title":"Custom 8-bit floating point value format for reducing shared memory bank conflict in approximate nearest neighbor search","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.06672","snapshot_observed_at":"2026-07-13T01:10:03.032181Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.08993","last_updated":"2026-07-09T23:52:57Z","snapshot_observed_at":"2026-08-03T16:02:09.671176Z","submitted_at":"2026-07-09T23:52:57Z","title":"StreamDQ: Near-Memory Weight DeQuantization in Custom HBM for Scalable AI Inference Acceleration","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-13T01:10:03.032181Z"},"links":{"cited_paper":"/paper/2301.06672","citing_paper":"/paper/2607.08993"},"observation_digest":"sha256:d4c809b58a60fccb046b64cb9951287c2fd0f98483c629db3f3cf83a5644338c","observation_id":"109cca2d-fb6e-4581-b0ea-04d9c188e1fe","resolution":{"observed_at":"2026-07-13T01:10:03.032181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.16099","last_updated":"2025-07-21T22:50:12Z","snapshot_observed_at":"2026-08-06T15:16:06.787418Z","submitted_at":"2025-07-21T22:50:12Z","title":"TorchAO: PyTorch-Native Training-to-Serving Model Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.16099","snapshot_observed_at":"2026-07-13T01:10:03.032181Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08993","last_updated":"2026-07-09T23:52:57Z","snapshot_observed_at":"2026-08-03T16:02:09.671176Z","submitted_at":"2026-07-09T23:52:57Z","title":"StreamDQ: Near-Memory Weight DeQuantization in Custom HBM for Scalable AI Inference Acceleration","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-13T01:10:03.032181Z"},"links":{"cited_paper":"/paper/2507.16099","citing_paper":"/paper/2607.08993"},"observation_digest":"sha256:63d5986920290da993137c4afd0d31d62d2587351a13c9328322f0da4c980b21","observation_id":"136220bb-1fef-44b7-9aba-4e218fb10ad2","resolution":{"observed_at":"2026-07-13T01:10:03.032181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:10:03.032181Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08993","last_updated":"2026-07-09T23:52:57Z","snapshot_observed_at":"2026-08-03T16:02:09.671176Z","submitted_at":"2026-07-09T23:52:57Z","title":"StreamDQ: Near-Memory Weight DeQuantization in Custom HBM for Scalable AI Inference Acceleration","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-13T01:10:03.032181Z"},"links":{"citing_paper":"/paper/2607.08993"},"observation_digest":"sha256:3c0d28ed9a937af3fa1cfc100b2a0b1e0ee5f3bb06339211c3373ed9e303f80d","observation_id":"20ce84db-bde6-4c76-8ab3-534611cca6c7","resolution":{"observed_at":"2026-07-13T01:10:03.032181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.09557","last_updated":"2024-04-01T06:09:41Z","snapshot_observed_at":"2026-07-06T13:22:35.494601Z","submitted_at":"2022-06-20T03:48:17Z","title":"LUT-GEMM: Quantized Matrix Multiplication based on LUTs for Efficient Inference in Large-Scale Generative Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.09557","snapshot_observed_at":"2026-07-13T01:10:03.032181Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.08993","last_updated":"2026-07-09T23:52:57Z","snapshot_observed_at":"2026-08-03T16:02:09.671176Z","submitted_at":"2026-07-09T23:52:57Z","title":"StreamDQ: Near-Memory Weight DeQuantization in Custom HBM for Scalable AI Inference Acceleration","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-13T01:10:03.032181Z"},"links":{"cited_paper":"/paper/2206.09557","citing_paper":"/paper/2607.08993"},"observation_digest":"sha256:45b2244acd559756cb2d14e54af48fa4b5f9f0a9535dce34830ea7ce29bcd024","observation_id":"08d576a2-5722-4cce-9b40-07d1df0ff7e7","resolution":{"observed_at":"2026-07-13T01:10:03.032181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:10:03.032181Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.08993","last_updated":"2026-07-09T23:52:57Z","snapshot_observed_at":"2026-08-03T16:02:09.671176Z","submitted_at":"2026-07-09T23:52:57Z","title":"StreamDQ: Near-Memory Weight DeQuantization in Custom HBM for Scalable AI Inference Acceleration","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-13T01:10:03.032181Z"},"links":{"citing_paper":"/paper/2607.08993"},"observation_digest":"sha256:01664e9f0c7e19d9db2bca63c9c8fd73a9537ad9c859b7ea0f323641f8ead970","observation_id":"7c84cb65-d0f1-4084-9d7f-a044577e5025","resolution":{"observed_at":"2026-07-13T01:10:03.032181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:10:03.032181Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.08993","last_updated":"2026-07-09T23:52:57Z","snapshot_observed_at":"2026-08-03T16:02:09.671176Z","submitted_at":"2026-07-09T23:52:57Z","title":"StreamDQ: Near-Memory Weight DeQuantization in Custom HBM for Scalable AI Inference Acceleration","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-13T01:10:03.032181Z"},"links":{"citing_paper":"/paper/2607.08993"},"observation_digest":"sha256:fcfa113967ee556b94832bd99aba46d44b7a4de968cc903bd968a2b5d830a1c0","observation_id":"d31f3997-2717-4fba-9eb4-d29a815ff4bb","resolution":{"observed_at":"2026-07-13T01:10:03.032181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:10:03.032181Z","title":null,"venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2607.08993","last_updated":"2026-07-09T23:52:57Z","snapshot_observed_at":"2026-08-03T16:02:09.671176Z","submitted_at":"2026-07-09T23:52:57Z","title":"StreamDQ: Near-Memory Weight DeQuantization in Custom HBM for Scalable AI Inference Acceleration","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-13T01:10:03.032181Z"},"links":{"citing_paper":"/paper/2607.08993"},"observation_digest":"sha256:a117a78a9faef2571ad7e2c3e27a7087125661be828490c066b332d7dc51a145","observation_id":"be9634d8-71ee-496e-95e2-4bc3d0cc10b6","resolution":{"observed_at":"2026-07-13T01:10:03.032181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.13137","last_updated":"2024-03-18T05:33:22Z","snapshot_observed_at":"2026-07-06T16:10:15.694898Z","submitted_at":"2023-08-25T02:28:35Z","title":"OmniQuant: Omnidirectionally Calibrated Quantization for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.13137","snapshot_observed_at":"2026-07-13T01:10:03.032181Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.08993","last_updated":"2026-07-09T23:52:57Z","snapshot_observed_at":"2026-08-03T16:02:09.671176Z","submitted_at":"2026-07-09T23:52:57Z","title":"StreamDQ: Near-Memory Weight DeQuantization in Custom HBM for Scalable AI Inference Acceleration","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-13T01:10:03.032181Z"},"links":{"cited_paper":"/paper/2308.13137","citing_paper":"/paper/2607.08993"},"observation_digest":"sha256:400d95edb75e60cd2824d563d7444c3acc4b414b6766320f348b49ce68010583","observation_id":"ecb37a61-e90a-48eb-828e-db65c7bc8149","resolution":{"observed_at":"2026-07-13T01:10:03.032181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:10:03.032181Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.08993","last_updated":"2026-07-09T23:52:57Z","snapshot_observed_at":"2026-08-03T16:02:09.671176Z","submitted_at":"2026-07-09T23:52:57Z","title":"StreamDQ: Near-Memory Weight DeQuantization in Custom HBM for Scalable AI Inference Acceleration","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-13T01:10:03.032181Z"},"links":{"citing_paper":"/paper/2607.08993"},"observation_digest":"sha256:63ae26d2abe94ff230e13dfaf4740ccd7ca31fea6f8d6cf798568eb664c8acdc","observation_id":"a3852807-a9ec-4c5a-b593-97bf3d9065fc","resolution":{"observed_at":"2026-07-13T01:10:03.032181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:10:03.032181Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08993","last_updated":"2026-07-09T23:52:57Z","snapshot_observed_at":"2026-08-03T16:02:09.671176Z","submitted_at":"2026-07-09T23:52:57Z","title":"StreamDQ: Near-Memory Weight DeQuantization in Custom HBM for Scalable AI Inference Acceleration","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-13T01:10:03.032181Z"},"links":{"citing_paper":"/paper/2607.08993"},"observation_digest":"sha256:4edfea8c48e5f1685432377fa3d12bf10908958d53c6f5624b26ad08bbca1c2a","observation_id":"d018821f-a67e-46a5-83fc-3b18162893b6","resolution":{"observed_at":"2026-07-13T01:10:03.032181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-07-13T01:10:03.032181Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.08993","last_updated":"2026-07-09T23:52:57Z","snapshot_observed_at":"2026-08-03T16:02:09.671176Z","submitted_at":"2026-07-09T23:52:57Z","title":"StreamDQ: Near-Memory Weight DeQuantization in Custom HBM for Scalable AI Inference Acceleration","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-07-13T01:10:03.032181Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2607.08993"},"observation_digest":"sha256:5d67b245bb2476951d55d2f5c28bff7a18bc8b3a8c98030ca401a0a72152a238","observation_id":"b7c99f50-5133-4152-96cb-0d1c4fb7d7a2","resolution":{"observed_at":"2026-07-13T01:10:03.032181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:10:03.032181Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.08993","last_updated":"2026-07-09T23:52:57Z","snapshot_observed_at":"2026-08-03T16:02:09.671176Z","submitted_at":"2026-07-09T23:52:57Z","title":"StreamDQ: Near-Memory Weight DeQuantization in Custom HBM for Scalable AI Inference Acceleration","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-13T01:10:03.032181Z"},"links":{"citing_paper":"/paper/2607.08993"},"observation_digest":"sha256:6f12f3d4801fa74251552c521df4114bb3c9815a367eebb15ca44dddc40c9ce4","observation_id":"9a4b6702-558f-42fe-bc96-ad54b479efb5","resolution":{"observed_at":"2026-07-13T01:10:03.032181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:10:03.032181Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.08993","last_updated":"2026-07-09T23:52:57Z","snapshot_observed_at":"2026-08-03T16:02:09.671176Z","submitted_at":"2026-07-09T23:52:57Z","title":"StreamDQ: Near-Memory Weight DeQuantization in Custom HBM for Scalable AI Inference Acceleration","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-07-13T01:10:03.032181Z"},"links":{"citing_paper":"/paper/2607.08993"},"observation_digest":"sha256:b7f7a295c9d33ba34d5dd1031e4738cf92dfc9ca6546e822bd4a6460f0bd54b7","observation_id":"be6d6557-35cd-46b2-9265-59c83c760d20","resolution":{"observed_at":"2026-07-13T01:10:03.032181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:10:03.032181Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08993","last_updated":"2026-07-09T23:52:57Z","snapshot_observed_at":"2026-08-03T16:02:09.671176Z","submitted_at":"2026-07-09T23:52:57Z","title":"StreamDQ: Near-Memory Weight DeQuantization in Custom HBM for Scalable AI Inference Acceleration","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-07-13T01:10:03.032181Z"},"links":{"citing_paper":"/paper/2607.08993"},"observation_digest":"sha256:accbc68a24948ce869a74efec369b0c7d8b6744b9b75fe2bc996807d505f7c5f","observation_id":"9de50d70-9815-49b2-b999-dacac0297846","resolution":{"observed_at":"2026-07-13T01:10:03.032181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:10:03.032181Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.08993","last_updated":"2026-07-09T23:52:57Z","snapshot_observed_at":"2026-08-03T16:02:09.671176Z","submitted_at":"2026-07-09T23:52:57Z","title":"StreamDQ: Near-Memory Weight DeQuantization in Custom HBM for Scalable AI Inference Acceleration","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-07-13T01:10:03.032181Z"},"links":{"citing_paper":"/paper/2607.08993"},"observation_digest":"sha256:96b77dfe4912d35246923e7c37cfe9c09a48aa2b3ac5063bb4590181441324d9","observation_id":"3c86b8dc-6499-472a-9169-a1acafae269b","resolution":{"observed_at":"2026-07-13T01:10:03.032181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:10:03.032181Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.08993","last_updated":"2026-07-09T23:52:57Z","snapshot_observed_at":"2026-08-03T16:02:09.671176Z","submitted_at":"2026-07-09T23:52:57Z","title":"StreamDQ: Near-Memory Weight DeQuantization in Custom HBM for Scalable AI Inference Acceleration","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-07-13T01:10:03.032181Z"},"links":{"citing_paper":"/paper/2607.08993"},"observation_digest":"sha256:47b786b8867a37b83bd135b7c7c55dd2905b5688055673d691f322c110f3246d","observation_id":"bd387cc3-d292-46f2-99a4-6da9b54f602f","resolution":{"observed_at":"2026-07-13T01:10:03.032181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:10:03.032181Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.08993","last_updated":"2026-07-09T23:52:57Z","snapshot_observed_at":"2026-08-03T16:02:09.671176Z","submitted_at":"2026-07-09T23:52:57Z","title":"StreamDQ: Near-Memory Weight DeQuantization in Custom HBM for Scalable AI Inference Acceleration","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-07-13T01:10:03.032181Z"},"links":{"citing_paper":"/paper/2607.08993"},"observation_digest":"sha256:3e6b597e8b149920f8a971b87796a0a24226fe0e2e0718cc3b7a3361acdce5a3","observation_id":"3cbed698-3d63-4a38-9eee-f8d4d27f6faa","resolution":{"observed_at":"2026-07-13T01:10:03.032181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:10:03.032181Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.08993","last_updated":"2026-07-09T23:52:57Z","snapshot_observed_at":"2026-08-03T16:02:09.671176Z","submitted_at":"2026-07-09T23:52:57Z","title":"StreamDQ: Near-Memory Weight DeQuantization in Custom HBM for Scalable AI Inference Acceleration","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-07-13T01:10:03.032181Z"},"links":{"citing_paper":"/paper/2607.08993"},"observation_digest":"sha256:135e2d9c80d85a2d830ad4132d2e1872095caa236c1a7269b26643a0707a1a1a","observation_id":"427d0969-7cae-4a4c-823b-c7d78a072d25","resolution":{"observed_at":"2026-07-13T01:10:03.032181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-13T01:10:03.032181Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08993","last_updated":"2026-07-09T23:52:57Z","snapshot_observed_at":"2026-08-03T16:02:09.671176Z","submitted_at":"2026-07-09T23:52:57Z","title":"StreamDQ: Near-Memory Weight DeQuantization in Custom HBM for Scalable AI Inference Acceleration","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-07-13T01:10:03.032181Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.08993"},"observation_digest":"sha256:be65bb64583c7c0b5026be51eca3f6b9bff25c54425da20f9fc62aedd19fe331","observation_id":"92a29df8-67f2-4c9d-8ecf-74a21687d03e","resolution":{"observed_at":"2026-07-13T01:10:03.032181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:10:03.032181Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.08993","last_updated":"2026-07-09T23:52:57Z","snapshot_observed_at":"2026-08-03T16:02:09.671176Z","submitted_at":"2026-07-09T23:52:57Z","title":"StreamDQ: Near-Memory Weight DeQuantization in Custom HBM for Scalable AI Inference Acceleration","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-07-13T01:10:03.032181Z"},"links":{"citing_paper":"/paper/2607.08993"},"observation_digest":"sha256:22ba5e481b5ed9f18f19333d3afe9e1395d01e6cae463c2bcd4af9a6a9c53426","observation_id":"e651f12e-b2dd-48c8-b6ce-42bf956a1d32","resolution":{"observed_at":"2026-07-13T01:10:03.032181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-13T01:10:03.032181Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.08993","last_updated":"2026-07-09T23:52:57Z","snapshot_observed_at":"2026-08-03T16:02:09.671176Z","submitted_at":"2026-07-09T23:52:57Z","title":"StreamDQ: Near-Memory Weight DeQuantization in Custom HBM for Scalable AI Inference Acceleration","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-07-13T01:10:03.032181Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2607.08993"},"observation_digest":"sha256:069a6c1598bb2b96872b9fe234d6cacad903f88da4d4404d1c9e2e31d7ea39ea","observation_id":"b486abc4-7a29-4502-8f1f-6183d49cd646","resolution":{"observed_at":"2026-07-13T01:10:03.032181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16158","last_updated":"2024-11-25T07:34:53Z","snapshot_observed_at":"2026-07-06T19:56:21.333277Z","submitted_at":"2024-11-25T07:34:53Z","title":"MixPE: Quantization and Hardware Co-design for Efficient LLM Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.16158","snapshot_observed_at":"2026-07-13T01:10:03.032181Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.08993","last_updated":"2026-07-09T23:52:57Z","snapshot_observed_at":"2026-08-03T16:02:09.671176Z","submitted_at":"2026-07-09T23:52:57Z","title":"StreamDQ: Near-Memory Weight DeQuantization in Custom HBM for Scalable AI Inference Acceleration","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-07-13T01:10:03.032181Z"},"links":{"cited_paper":"/paper/2411.16158","citing_paper":"/paper/2607.08993"},"observation_digest":"sha256:580ce91e4e658cc16adeda5dea29189782b0feb73b0a9d256c51ac36317edbc8","observation_id":"176971e1-129e-44fe-9653-e42be1804a59","resolution":{"observed_at":"2026-07-13T01:10:03.032181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:10:03.032181Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.08993","last_updated":"2026-07-09T23:52:57Z","snapshot_observed_at":"2026-08-03T16:02:09.671176Z","submitted_at":"2026-07-09T23:52:57Z","title":"StreamDQ: Near-Memory Weight DeQuantization in Custom HBM for Scalable AI Inference Acceleration","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-07-13T01:10:03.032181Z"},"links":{"citing_paper":"/paper/2607.08993"},"observation_digest":"sha256:bacead99557a7b9d4ace651f13001733b3ba530f0cb11f7e3cd1f43f5460a2e6","observation_id":"36fb5bac-05d9-43d0-a6a8-cc62a15caf02","resolution":{"observed_at":"2026-07-13T01:10:03.032181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:10:03.032181Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.08993","last_updated":"2026-07-09T23:52:57Z","snapshot_observed_at":"2026-08-03T16:02:09.671176Z","submitted_at":"2026-07-09T23:52:57Z","title":"StreamDQ: Near-Memory Weight DeQuantization in Custom HBM for Scalable AI Inference Acceleration","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-07-13T01:10:03.032181Z"},"links":{"citing_paper":"/paper/2607.08993"},"observation_digest":"sha256:98009255fbe76972aab270db147924faef2be4ffe8e11af51b0034d4cc772ec6","observation_id":"a3946790-ddaa-4c53-8f9c-2b36cf80babe","resolution":{"observed_at":"2026-07-13T01:10:03.032181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:10:03.032181Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08993","last_updated":"2026-07-09T23:52:57Z","snapshot_observed_at":"2026-08-03T16:02:09.671176Z","submitted_at":"2026-07-09T23:52:57Z","title":"StreamDQ: Near-Memory Weight DeQuantization in Custom HBM for Scalable AI Inference Acceleration","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-07-13T01:10:03.032181Z"},"links":{"citing_paper":"/paper/2607.08993"},"observation_digest":"sha256:9153582e80ef0106f05794487d4f385f9c0dd078e8eb0c251f849baf4df8e213","observation_id":"737934a7-5e78-4e67-84bd-4936196c692b","resolution":{"observed_at":"2026-07-13T01:10:03.032181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:10:03.032181Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08993","last_updated":"2026-07-09T23:52:57Z","snapshot_observed_at":"2026-08-03T16:02:09.671176Z","submitted_at":"2026-07-09T23:52:57Z","title":"StreamDQ: Near-Memory Weight DeQuantization in Custom HBM for Scalable AI Inference Acceleration","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-07-13T01:10:03.032181Z"},"links":{"citing_paper":"/paper/2607.08993"},"observation_digest":"sha256:9d2077fbfa7b475f6240d4abb69079f31e87b7a56e78c839e5c5c9980d30a9ac","observation_id":"765e83b0-8928-4bf3-a551-1317f99b9402","resolution":{"observed_at":"2026-07-13T01:10:03.032181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.08993","last_updated":"2026-07-09T23:52:57Z","latest_version":1,"primary_category":"cs.AR","snapshot_observed_at":"2026-08-03T16:02:09.671176Z","submitted_at":"2026-07-09T23:52:57Z","title":"StreamDQ: Near-Memory Weight DeQuantization in Custom HBM for Scalable AI Inference Acceleration"},"reference_resolution":{"displayed":76,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":76,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":76},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 76 of 76 outbound references and 0 inbound Pith citation observations for arXiv:2607.08993."}