{"as_of":"2026-08-19T14:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9a9331ec903ea9db96f8680445986b9202d954b2d3c4b8ee64103264d4df1be6","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T11:55:39.939185Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2504.14365/citation-record","integrity":"/paper/2504.14365/integrity","json":"/paper/2504.14365/citation-record.json","paper":"/paper/2504.14365"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2407.07000","last_updated":"2024-08-30T01:19:42Z","snapshot_observed_at":"2026-08-16T13:35:42.983044Z","submitted_at":"2024-07-09T16:13:26Z","title":"Etalon: Holistic Performance Evaluation Framework for LLM Inference Systems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07000","snapshot_observed_at":"2026-08-16T11:55:39.720185Z","title":"Metron: Holistic performance evaluation framework for llm inference systems,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14365","last_updated":"2025-04-19T17:47:01Z","snapshot_observed_at":"2026-08-19T09:06:04.163791Z","submitted_at":"2025-04-19T17:47:01Z","title":"Accelerating LLM Inference with Flexible N:M Sparsity via A Fully Digital Compute-in-Memory Accelerator","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:39.720185Z"},"links":{"cited_paper":"/paper/2407.07000","citing_paper":"/paper/2504.14365"},"observation_digest":"sha256:dcd413290a5b0b2096261b6dc80bb86746736c75be894a555bacb479ccd95364","observation_id":"feff1650-5512-4333-bc7f-d613e2abc38b","resolution":{"observed_at":"2026-08-16T11:55:39.720185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01390","last_updated":"2023-08-07T17:53:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-02T19:10:23Z","title":"OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01390","snapshot_observed_at":"2026-08-16T11:55:39.726020Z","title":"Openflamingo: An open-source framework for training large autoregressive vision-language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14365","last_updated":"2025-04-19T17:47:01Z","snapshot_observed_at":"2026-08-19T09:06:04.163791Z","submitted_at":"2025-04-19T17:47:01Z","title":"Accelerating LLM Inference with Flexible N:M Sparsity via A Fully Digital Compute-in-Memory Accelerator","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:39.726020Z"},"links":{"cited_paper":"/paper/2308.01390","citing_paper":"/paper/2504.14365"},"observation_digest":"sha256:246ae2af2a3d84bf48f5f7a05a765d06020c0fdc254990b14d043675ea58059d","observation_id":"fb08ee07-d818-4ab1-b3c2-7509d7755767","resolution":{"observed_at":"2026-08-16T11:55:39.726020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:55:39.731716Z","title":"Piqa: Reasoning about physical commonsense in natural language,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.14365","last_updated":"2025-04-19T17:47:01Z","snapshot_observed_at":"2026-08-19T09:06:04.163791Z","submitted_at":"2025-04-19T17:47:01Z","title":"Accelerating LLM Inference with Flexible N:M Sparsity via A Fully Digital Compute-in-Memory Accelerator","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:39.731716Z"},"links":{"citing_paper":"/paper/2504.14365"},"observation_digest":"sha256:44107b96f7371b92e0b3ecad86eea014855d90391210e74fa7e7020f5e79da03","observation_id":"f01a62a1-c212-41c3-b459-786b31024d0b","resolution":{"observed_at":"2026-08-16T11:55:39.731716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-16T01:18:27.067382Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-16T11:55:39.736357Z","title":"Microsoft coco captions: Data collection and evaluation server,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2504.14365","last_updated":"2025-04-19T17:47:01Z","snapshot_observed_at":"2026-08-19T09:06:04.163791Z","submitted_at":"2025-04-19T17:47:01Z","title":"Accelerating LLM Inference with Flexible N:M Sparsity via A Fully Digital Compute-in-Memory Accelerator","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:39.736357Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2504.14365"},"observation_digest":"sha256:e328666a736d1697bab3db8f428f94eef673a2dd9fc888b433a4212d049d687a","observation_id":"c7ba9cf5-9096-4800-9b53-67fa94a1226b","resolution":{"observed_at":"2026-08-16T11:55:39.736357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:55:40.506301Z","title":"15.3 a 65nm 3t dynamic analog ram- based computing-in-memory macro and cnn accelerator with retention enhancement, adaptive analog sparsity and 44tops/w system energy efficiency,","venue":null,"work_id":"7c813d1b-56e9-4563-8052-dbe9007229b0","year":2021},"citing_paper":{"arxiv_id":"2504.14365","last_updated":"2025-04-19T17:47:01Z","snapshot_observed_at":"2026-08-19T09:06:04.163791Z","submitted_at":"2025-04-19T17:47:01Z","title":"Accelerating LLM Inference with Flexible N:M Sparsity via A Fully Digital Compute-in-Memory Accelerator","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:39.741431Z"},"links":{"citing_paper":"/paper/2504.14365"},"observation_digest":"sha256:8b2591f1dd6719576fdc29e4736dde52ebe9ebeab413de12269376554185ad83","observation_id":"28f049cc-0091-4420-bcbf-285874938aea","resolution":{"observed_at":"2026-08-16T11:55:40.510595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.10044","last_updated":"2019-05-24T05:48:49Z","snapshot_observed_at":"2026-08-17T14:44:42.060038Z","submitted_at":"2019-05-24T05:48:49Z","title":"BoolQ: Exploring the Surprising Difficulty of Natural Yes/No Questions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.10044","snapshot_observed_at":"2026-08-16T11:55:39.745841Z","title":"Boolq: Exploring the surprising difficulty of natural yes/no questions,","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2504.14365","last_updated":"2025-04-19T17:47:01Z","snapshot_observed_at":"2026-08-19T09:06:04.163791Z","submitted_at":"2025-04-19T17:47:01Z","title":"Accelerating LLM Inference with Flexible N:M Sparsity via A Fully Digital Compute-in-Memory Accelerator","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:39.745841Z"},"links":{"cited_paper":"/paper/1905.10044","citing_paper":"/paper/2504.14365"},"observation_digest":"sha256:85be27d5dea0080bfbedd45eb7ea183ce1a543ceac441341fc7f56499e03d8af","observation_id":"8409119a-f975-465b-92e1-2547f0b4589c","resolution":{"observed_at":"2026-08-16T11:55:39.745841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09497","last_updated":"2024-04-15T06:34:17Z","snapshot_observed_at":"2026-08-19T09:06:15.205315Z","submitted_at":"2024-04-15T06:34:17Z","title":"Towards Efficient SRAM-PIM Architecture Design by Exploiting Unstructured Bit-Level Sparsity","version":1},"cited_work":{"arxiv_id":"2404.09497","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.09497","snapshot_observed_at":"2026-08-16T11:55:40.115932Z","title":"Towards Efficient SRAM-PIM Architecture Design by Exploiting Unstructured Bit-Level Sparsity","venue":"cs.AR","work_id":"f7f32741-bffe-4f5b-bdf8-7426b12046a4","year":2024},"citing_paper":{"arxiv_id":"2504.14365","last_updated":"2025-04-19T17:47:01Z","snapshot_observed_at":"2026-08-19T09:06:04.163791Z","submitted_at":"2025-04-19T17:47:01Z","title":"Accelerating LLM Inference with Flexible N:M Sparsity via A Fully Digital Compute-in-Memory Accelerator","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:39.751705Z"},"links":{"cited_paper":"/paper/2404.09497","citing_paper":"/paper/2504.14365"},"observation_digest":"sha256:624f568b5688dfb190c6ccac85dab2c9c8282341ccb10fbfb3e28b2fd659f315","observation_id":"be94c62b-0908-4d96-8646-dc9d7216ef70","resolution":{"observed_at":"2026-08-16T11:55:40.122741Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:55:40.491541Z","title":"Integrating nvidia deep learning accelerator (nvdla) with risc-v soc on firesim,","venue":null,"work_id":"2cf5c19e-6146-4951-aa1a-7cb81eba8849","year":2019},"citing_paper":{"arxiv_id":"2504.14365","last_updated":"2025-04-19T17:47:01Z","snapshot_observed_at":"2026-08-19T09:06:04.163791Z","submitted_at":"2025-04-19T17:47:01Z","title":"Accelerating LLM Inference with Flexible N:M Sparsity via A Fully Digital Compute-in-Memory Accelerator","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:39.756137Z"},"links":{"citing_paper":"/paper/2504.14365"},"observation_digest":"sha256:07382149cd4722dcdb3992d231e04688fdca329230f91745fd1781562bba92ee","observation_id":"7c3575eb-77e7-44bf-9365-960f9e3a1da8","resolution":{"observed_at":"2026-08-16T11:55:40.496947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:55:40.473793Z","title":"SparseGPT: Massive language models can be accurately pruned in one-shot,","venue":null,"work_id":"a17a01dc-3f5d-4dec-87cb-5280aedf0523","year":2023},"citing_paper":{"arxiv_id":"2504.14365","last_updated":"2025-04-19T17:47:01Z","snapshot_observed_at":"2026-08-19T09:06:04.163791Z","submitted_at":"2025-04-19T17:47:01Z","title":"Accelerating LLM Inference with Flexible N:M Sparsity via A Fully Digital Compute-in-Memory Accelerator","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:39.760266Z"},"links":{"citing_paper":"/paper/2504.14365"},"observation_digest":"sha256:0b71849e43ac58346882cb7e907f4972089ac4fa1119f416fc62fbdecfabbd43","observation_id":"816f2d6a-c339-4941-aac0-aa102802f77c","resolution":{"observed_at":"2026-08-16T11:55:40.479748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:55:40.457931Z","title":"A 5-nm 254-tops/w 221-tops/mm 2 fully-digital computing-in-memory macro supporting wide-range dynamic-voltage- frequency scaling and simultaneous mac and write operations,","venue":null,"work_id":"55f02804-6504-42b6-b89a-9f213a327673","year":2022},"citing_paper":{"arxiv_id":"2504.14365","last_updated":"2025-04-19T17:47:01Z","snapshot_observed_at":"2026-08-19T09:06:04.163791Z","submitted_at":"2025-04-19T17:47:01Z","title":"Accelerating LLM Inference with Flexible N:M Sparsity via A Fully Digital Compute-in-Memory Accelerator","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:39.764168Z"},"links":{"citing_paper":"/paper/2504.14365"},"observation_digest":"sha256:fd8cf67aa975ad3c2c6f99dd52a4b4afd63d76adb7a16bc8c757bc2ddd9ca61d","observation_id":"b50e1cca-8265-4adf-8ac7-9c6fd2389271","resolution":{"observed_at":"2026-08-16T11:55:40.463964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00027","last_updated":"2020-12-31T19:00:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-12-31T19:00:10Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00027","snapshot_observed_at":"2026-08-16T11:55:39.769632Z","title":"The pile: An 800gb dataset of diverse text for language modeling,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.14365","last_updated":"2025-04-19T17:47:01Z","snapshot_observed_at":"2026-08-19T09:06:04.163791Z","submitted_at":"2025-04-19T17:47:01Z","title":"Accelerating LLM Inference with Flexible N:M Sparsity via A Fully Digital Compute-in-Memory Accelerator","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:39.769632Z"},"links":{"cited_paper":"/paper/2101.00027","citing_paper":"/paper/2504.14365"},"observation_digest":"sha256:5a726732599dcf955d11537e20ed4c7d8ac2a66bba50024ca0a710b6e13ccfab","observation_id":"3ae0549c-5f48-418f-a0ee-4e3340d4174c","resolution":{"observed_at":"2026-08-16T11:55:39.769632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-08-17T20:47:46.242385Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00752","snapshot_observed_at":"2026-08-16T11:55:39.776256Z","title":"Mamba: Linear-time sequence modeling with selective state spaces,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14365","last_updated":"2025-04-19T17:47:01Z","snapshot_observed_at":"2026-08-19T09:06:04.163791Z","submitted_at":"2025-04-19T17:47:01Z","title":"Accelerating LLM Inference with Flexible N:M Sparsity via A Fully Digital Compute-in-Memory Accelerator","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:39.776256Z"},"links":{"cited_paper":"/paper/2312.00752","citing_paper":"/paper/2504.14365"},"observation_digest":"sha256:6ac02a41df43927d60da5d7cf851faf7bf92ec18d2745dbfe53305294b7235b6","observation_id":"e8a8ebf6-d390-4981-8c03-809a8c1ac92f","resolution":{"observed_at":"2026-08-16T11:55:39.776256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:55:40.440386Z","title":"Sparsity-aware and re-configurable npu architecture for samsung flagship mobile soc,","venue":null,"work_id":"9dfd28d5-7527-4756-b19f-ea0fdb9a6544","year":2021},"citing_paper":{"arxiv_id":"2504.14365","last_updated":"2025-04-19T17:47:01Z","snapshot_observed_at":"2026-08-19T09:06:04.163791Z","submitted_at":"2025-04-19T17:47:01Z","title":"Accelerating LLM Inference with Flexible N:M Sparsity via A Fully Digital Compute-in-Memory Accelerator","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:39.782007Z"},"links":{"citing_paper":"/paper/2504.14365"},"observation_digest":"sha256:18cebd408303d97d774119dc2c76d117708d40c645d38c0926fed20f5ecb3772","observation_id":"f8dfdcf7-c4c0-4172-b270-c6554b6ac0a7","resolution":{"observed_at":"2026-08-16T11:55:40.445608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:55:40.425420Z","title":"Vegeta: Vertically-integrated extensions for sparse/dense gemm tile acceleration on cpus,","venue":null,"work_id":"65e5fa95-f549-4089-bb60-7cae3dfb6b08","year":2023},"citing_paper":{"arxiv_id":"2504.14365","last_updated":"2025-04-19T17:47:01Z","snapshot_observed_at":"2026-08-19T09:06:04.163791Z","submitted_at":"2025-04-19T17:47:01Z","title":"Accelerating LLM Inference with Flexible N:M Sparsity via A Fully Digital Compute-in-Memory Accelerator","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:39.786250Z"},"links":{"citing_paper":"/paper/2504.14365"},"observation_digest":"sha256:4040b18893ba4e9b6c30b51f7264813de21dd927b2722e78f2d6ab36f94cb715","observation_id":"22bda09e-5628-4bf7-b578-9f922554373a","resolution":{"observed_at":"2026-08-16T11:55:40.429527Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-13T19:43:49.936776Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-16T11:55:39.790833Z","title":"Mixtral of experts,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14365","last_updated":"2025-04-19T17:47:01Z","snapshot_observed_at":"2026-08-19T09:06:04.163791Z","submitted_at":"2025-04-19T17:47:01Z","title":"Accelerating LLM Inference with Flexible N:M Sparsity via A Fully Digital Compute-in-Memory Accelerator","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:39.790833Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2504.14365"},"observation_digest":"sha256:691e654494120fac6b3f736e8a8b31fde39ef6c53dd040eadfa1b5c44542dc94","observation_id":"40dc742b-5d3b-4b12-b8e4-8ba803f9102a","resolution":{"observed_at":"2026-08-16T11:55:39.790833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:55:40.408505Z","title":"Colonnade: A reconfigurable sram-based digital bit- serial compute-in-memory macro for processing neural networks,","venue":null,"work_id":"94f06d95-59c9-4e6c-a553-5033e905061e","year":2021},"citing_paper":{"arxiv_id":"2504.14365","last_updated":"2025-04-19T17:47:01Z","snapshot_observed_at":"2026-08-19T09:06:04.163791Z","submitted_at":"2025-04-19T17:47:01Z","title":"Accelerating LLM Inference with Flexible N:M Sparsity via A Fully Digital Compute-in-Memory Accelerator","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:39.797376Z"},"links":{"citing_paper":"/paper/2504.14365"},"observation_digest":"sha256:18cdebf59e287ce645845c96bcc952cca956a534a81c009282f07f500bbd3d03","observation_id":"29b20204-95bd-4824-bfdb-ebdf3ac01d1f","resolution":{"observed_at":"2026-08-16T11:55:40.416050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:55:40.389059Z","title":"Laxor: A bit-accurate bnn accelerator with latch-xor logic for local computing,","venue":null,"work_id":"b0dd61a3-666e-4251-8a98-285462ba487e","year":2023},"citing_paper":{"arxiv_id":"2504.14365","last_updated":"2025-04-19T17:47:01Z","snapshot_observed_at":"2026-08-19T09:06:04.163791Z","submitted_at":"2025-04-19T17:47:01Z","title":"Accelerating LLM Inference with Flexible N:M Sparsity via A Fully Digital Compute-in-Memory Accelerator","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:39.801646Z"},"links":{"citing_paper":"/paper/2504.14365"},"observation_digest":"sha256:d1ffb093b2e768e85c3b64d7063cb5ff97948c688f5ae8702d2ddbd1a5b81652","observation_id":"a7f4da27-88c5-4cdb-8141-86dfb17bd647","resolution":{"observed_at":"2026-08-16T11:55:40.394018Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:55:39.807957Z","title":"Awq: Activation-aware weight quanti- zation for on-device llm compression and acceleration,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14365","last_updated":"2025-04-19T17:47:01Z","snapshot_observed_at":"2026-08-19T09:06:04.163791Z","submitted_at":"2025-04-19T17:47:01Z","title":"Accelerating LLM Inference with Flexible N:M Sparsity via A Fully Digital Compute-in-Memory Accelerator","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:39.807957Z"},"links":{"citing_paper":"/paper/2504.14365"},"observation_digest":"sha256:6c7f1f9e6de996d21446fc12a6c8404bca20a831c9cf1c5fec4cca179cb0f1ea","observation_id":"c664d95e-6800-4dfa-be1a-f0650edc5944","resolution":{"observed_at":"2026-08-16T11:55:39.807957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:55:40.364312Z","title":"33.2 a fully integrated analog reram based 78.4 tops/w compute-in-memory chip with fully parallel mac computing,","venue":null,"work_id":"8fa5b92f-2c40-4360-a4cb-8070a08cd071","year":2020},"citing_paper":{"arxiv_id":"2504.14365","last_updated":"2025-04-19T17:47:01Z","snapshot_observed_at":"2026-08-19T09:06:04.163791Z","submitted_at":"2025-04-19T17:47:01Z","title":"Accelerating LLM Inference with Flexible N:M Sparsity via A Fully Digital Compute-in-Memory Accelerator","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:39.814513Z"},"links":{"citing_paper":"/paper/2504.14365"},"observation_digest":"sha256:2174b24c6c2b70ecb1ecc299297eff24408e25c44141531938db8bea9830d3ea","observation_id":"ef034e36-283e-4d01-8115-93165073cefc","resolution":{"observed_at":"2026-08-16T11:55:40.368998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:55:39.825661Z","title":"S2ta: Exploiting structured sparsity for energy-efficient mobile cnn acceleration,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.14365","last_updated":"2025-04-19T17:47:01Z","snapshot_observed_at":"2026-08-19T09:06:04.163791Z","submitted_at":"2025-04-19T17:47:01Z","title":"Accelerating LLM Inference with Flexible N:M Sparsity via A Fully Digital Compute-in-Memory Accelerator","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:39.825661Z"},"links":{"citing_paper":"/paper/2504.14365"},"observation_digest":"sha256:ab4ec9902796541312bac5685ab12f7d3cc25fc15fcdfb03b878ad906317ac15","observation_id":"fec4ce2b-e162-4afd-a23a-e209b548fb74","resolution":{"observed_at":"2026-08-16T11:55:39.825661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.08240","last_updated":"2018-03-22T06:25:47Z","snapshot_observed_at":"2026-08-19T00:54:49.973439Z","submitted_at":"2018-03-22T06:25:47Z","title":"An Analysis of Neural Language Modeling at Multiple Scales","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.08240","snapshot_observed_at":"2026-08-16T11:55:39.830657Z","title":"An analysis of neural language modeling at multiple scales,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.14365","last_updated":"2025-04-19T17:47:01Z","snapshot_observed_at":"2026-08-19T09:06:04.163791Z","submitted_at":"2025-04-19T17:47:01Z","title":"Accelerating LLM Inference with Flexible N:M Sparsity via A Fully Digital Compute-in-Memory Accelerator","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:39.830657Z"},"links":{"cited_paper":"/paper/1803.08240","citing_paper":"/paper/2504.14365"},"observation_digest":"sha256:3ca867f5f9b17a135a3d958db90d4a5b1b0974b482f5744638ce270744ef3f2d","observation_id":"cebbceff-bbea-4cc7-86c4-0f8533207d63","resolution":{"observed_at":"2026-08-16T11:55:39.830657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:55:39.835343Z","title":"Introducing meta llama 3: The most capable openly available llm to date,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14365","last_updated":"2025-04-19T17:47:01Z","snapshot_observed_at":"2026-08-19T09:06:04.163791Z","submitted_at":"2025-04-19T17:47:01Z","title":"Accelerating LLM Inference with Flexible N:M Sparsity via A Fully Digital Compute-in-Memory Accelerator","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:39.835343Z"},"links":{"citing_paper":"/paper/2504.14365"},"observation_digest":"sha256:7ecd3eb4beec58fb8c91485b9859b8695fd0be5836f308c0cbeceb4bcc7763f5","observation_id":"7740e6a5-7649-41cc-85b7-70e94a6de7eb","resolution":{"observed_at":"2026-08-16T11:55:39.835343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08378","last_updated":"2021-04-16T21:27:32Z","snapshot_observed_at":"2026-08-16T18:30:58.242028Z","submitted_at":"2021-04-16T21:27:32Z","title":"Accelerating Sparse Deep Neural Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08378","snapshot_observed_at":"2026-08-16T11:55:39.839688Z","title":"Accelerating sparse deep neural networks,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.14365","last_updated":"2025-04-19T17:47:01Z","snapshot_observed_at":"2026-08-19T09:06:04.163791Z","submitted_at":"2025-04-19T17:47:01Z","title":"Accelerating LLM Inference with Flexible N:M Sparsity via A Fully Digital Compute-in-Memory Accelerator","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:39.839688Z"},"links":{"cited_paper":"/paper/2104.08378","citing_paper":"/paper/2504.14365"},"observation_digest":"sha256:646f3cabf6bcef89567fa38f257859cc1e446fbf35fa60f31a8db7b97323af02","observation_id":"741c9a68-bb6f-446f-894f-8d427b1382f5","resolution":{"observed_at":"2026-08-16T11:55:39.839688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:55:40.334299Z","title":"Scnn: An accelerator for compressed-sparse convolutional neural networks,","venue":null,"work_id":"b5337558-d89b-44a4-b2c3-0e11a5af7228","year":2017},"citing_paper":{"arxiv_id":"2504.14365","last_updated":"2025-04-19T17:47:01Z","snapshot_observed_at":"2026-08-19T09:06:04.163791Z","submitted_at":"2025-04-19T17:47:01Z","title":"Accelerating LLM Inference with Flexible N:M Sparsity via A Fully Digital Compute-in-Memory Accelerator","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:39.844740Z"},"links":{"citing_paper":"/paper/2504.14365"},"observation_digest":"sha256:f341f0f44de35997553f0cdd412cbb2ac20d80de0990bc799965d6448e36f51d","observation_id":"ea9a6263-ec33-4302-81e1-78e97098e5bf","resolution":{"observed_at":"2026-08-16T11:55:40.338531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09026","last_updated":"2024-04-11T23:26:33Z","snapshot_observed_at":"2026-08-16T14:09:59.351673Z","submitted_at":"2024-03-14T01:39:12Z","title":"FlexNN: A Dataflow-aware Flexible Deep Learning Accelerator for Energy-Efficient Edge Devices","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09026","snapshot_observed_at":"2026-08-16T11:55:39.849507Z","title":"FlexNN: A dataflow-aware flexible deep learning accelerator for energy-efficient edge devices,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14365","last_updated":"2025-04-19T17:47:01Z","snapshot_observed_at":"2026-08-19T09:06:04.163791Z","submitted_at":"2025-04-19T17:47:01Z","title":"Accelerating LLM Inference with Flexible N:M Sparsity via A Fully Digital Compute-in-Memory Accelerator","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:39.849507Z"},"links":{"cited_paper":"/paper/2403.09026","citing_paper":"/paper/2504.14365"},"observation_digest":"sha256:bfa510cceff654b846f2a8ab394a60a02296cc0afa55de80098eacd34bff06e1","observation_id":"3d9673d9-00f4-47d6-8dc6-4566fa98def2","resolution":{"observed_at":"2026-08-16T11:55:39.849507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.05282","last_updated":"2025-04-29T18:38:03Z","snapshot_observed_at":"2026-08-19T09:06:41.194869Z","submitted_at":"2024-11-08T02:25:45Z","title":"MicroScopiQ: Accelerating Foundational Models through Outlier-Aware Microscaling Quantization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.05282","snapshot_observed_at":"2026-08-16T11:55:39.854178Z","title":"MicroScopiQ: Acceler- ating foundational models through outlier-aware microscaling quantiza- tion,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14365","last_updated":"2025-04-19T17:47:01Z","snapshot_observed_at":"2026-08-19T09:06:04.163791Z","submitted_at":"2025-04-19T17:47:01Z","title":"Accelerating LLM Inference with Flexible N:M Sparsity via A Fully Digital Compute-in-Memory Accelerator","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:39.854178Z"},"links":{"cited_paper":"/paper/2411.05282","citing_paper":"/paper/2504.14365"},"observation_digest":"sha256:5d1d313300c230566463ecc622f27f7d8bc269eeb23eee280609d5aeed53735f","observation_id":"e2250370-b668-487f-bbe1-dd0c694b9875","resolution":{"observed_at":"2026-08-16T11:55:39.854178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05465","last_updated":"2024-03-26T18:43:35Z","snapshot_observed_at":"2026-08-19T09:06:40.369835Z","submitted_at":"2024-03-08T17:28:49Z","title":"Algorithm-Hardware Co-Design of Distribution-Aware Logarithmic-Posit Encodings for Efficient DNN Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05465","snapshot_observed_at":"2026-08-16T11:55:39.859331Z","title":"Algorithm-hardware co-design of distribution-aware logarithmic-posit encodings for efficient dnn inference,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14365","last_updated":"2025-04-19T17:47:01Z","snapshot_observed_at":"2026-08-19T09:06:04.163791Z","submitted_at":"2025-04-19T17:47:01Z","title":"Accelerating LLM Inference with Flexible N:M Sparsity via A Fully Digital Compute-in-Memory Accelerator","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:39.859331Z"},"links":{"cited_paper":"/paper/2403.05465","citing_paper":"/paper/2504.14365"},"observation_digest":"sha256:64ac6d55ca6b7bcdf8a0f43636b917eef4328ab1c4ddb1cf2f26181c29f2fbe0","observation_id":"19b1bd7b-ebd7-4b34-b300-c6fb91a465ae","resolution":{"observed_at":"2026-08-16T11:55:39.859331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:55:40.320838Z","title":"Deepscaletool: A tool for the accurate esti- mation of technology scaling in the deep-submicron era,","venue":null,"work_id":"3a4eaa4b-abb8-4662-a310-6a3e9e9c33df","year":2021},"citing_paper":{"arxiv_id":"2504.14365","last_updated":"2025-04-19T17:47:01Z","snapshot_observed_at":"2026-08-19T09:06:04.163791Z","submitted_at":"2025-04-19T17:47:01Z","title":"Accelerating LLM Inference with Flexible N:M Sparsity via A Fully Digital Compute-in-Memory Accelerator","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:39.863524Z"},"links":{"citing_paper":"/paper/2504.14365"},"observation_digest":"sha256:1c915e16a2eb814366b207c8fb56a793e3ccb67dbe7c99b42baf95724d85e080","observation_id":"27eab695-f837-4151-9afc-9d683e024110","resolution":{"observed_at":"2026-08-16T11:55:40.324944Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:55:39.868416Z","title":"Dnnweaver: From high-level deep network models to fpga acceleration,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2504.14365","last_updated":"2025-04-19T17:47:01Z","snapshot_observed_at":"2026-08-19T09:06:04.163791Z","submitted_at":"2025-04-19T17:47:01Z","title":"Accelerating LLM Inference with Flexible N:M Sparsity via A Fully Digital Compute-in-Memory Accelerator","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:39.868416Z"},"links":{"citing_paper":"/paper/2504.14365"},"observation_digest":"sha256:4250dc7bcc30562092be11886cff7adbf2c8f1445e66d52694e3bea6ab613a05","observation_id":"b805c6e2-3702-4750-a9e2-3bda45d77c94","resolution":{"observed_at":"2026-08-16T11:55:39.868416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:55:39.874234Z","title":"Towards vqa models that can read,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.14365","last_updated":"2025-04-19T17:47:01Z","snapshot_observed_at":"2026-08-19T09:06:04.163791Z","submitted_at":"2025-04-19T17:47:01Z","title":"Accelerating LLM Inference with Flexible N:M Sparsity via A Fully Digital Compute-in-Memory Accelerator","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:39.874234Z"},"links":{"citing_paper":"/paper/2504.14365"},"observation_digest":"sha256:743c4f5722635db855454e5d6357c5efd8aefd276566b08259b751906534871d","observation_id":"01979481-af26-4f28-a4b9-bc31527625f4","resolution":{"observed_at":"2026-08-16T11:55:39.874234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:55:40.294209Z","title":"Sp-imc: A sparsity aware in-memory-computing macro in 28nm cmos with configurable sparse representation for highly sparse dnn workloads,","venue":null,"work_id":"549475ba-c167-403e-a3fd-f6cbccdf1429","year":2024},"citing_paper":{"arxiv_id":"2504.14365","last_updated":"2025-04-19T17:47:01Z","snapshot_observed_at":"2026-08-19T09:06:04.163791Z","submitted_at":"2025-04-19T17:47:01Z","title":"Accelerating LLM Inference with Flexible N:M Sparsity via A Fully Digital Compute-in-Memory Accelerator","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:39.879190Z"},"links":{"citing_paper":"/paper/2504.14365"},"observation_digest":"sha256:efa1f0f4eac521027ba15399eae4365cff1642a2ed11ee6e632b94f5ffa2c4ec","observation_id":"922dc18b-f23d-47dc-9312-f5e1d34ba640","resolution":{"observed_at":"2026-08-16T11:55:40.298516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:55:39.883551Z","title":"A fully-digital and row-pipelined compute-in-memory neural network accelerator with soc-level benchmarking for ar/vr applications,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14365","last_updated":"2025-04-19T17:47:01Z","snapshot_observed_at":"2026-08-19T09:06:04.163791Z","submitted_at":"2025-04-19T17:47:01Z","title":"Accelerating LLM Inference with Flexible N:M Sparsity via A Fully Digital Compute-in-Memory Accelerator","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:39.883551Z"},"links":{"citing_paper":"/paper/2504.14365"},"observation_digest":"sha256:2343487f860ed904d4ec9ec4d810584f021c22abac944ffa0525fcbbb3e0708a","observation_id":"2c59a99b-55cc-4004-81b3-792439f849a2","resolution":{"observed_at":"2026-08-16T11:55:39.883551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:55:39.887458Z","title":"A simple and effective pruning approach for large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14365","last_updated":"2025-04-19T17:47:01Z","snapshot_observed_at":"2026-08-19T09:06:04.163791Z","submitted_at":"2025-04-19T17:47:01Z","title":"Accelerating LLM Inference with Flexible N:M Sparsity via A Fully Digital Compute-in-Memory Accelerator","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:39.887458Z"},"links":{"citing_paper":"/paper/2504.14365"},"observation_digest":"sha256:d206463ffd08c6fcc3ad4b35beb9749790a05c4f45490b22ad5f7ca481e7d0f2","observation_id":"0f9baaa9-8a58-42b3-b106-8c9f5798265a","resolution":{"observed_at":"2026-08-16T11:55:39.887458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-16T11:55:39.891688Z","title":"Llama 2: Open foundation and fine-tuned chat models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14365","last_updated":"2025-04-19T17:47:01Z","snapshot_observed_at":"2026-08-19T09:06:04.163791Z","submitted_at":"2025-04-19T17:47:01Z","title":"Accelerating LLM Inference with Flexible N:M Sparsity via A Fully Digital Compute-in-Memory Accelerator","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:39.891688Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2504.14365"},"observation_digest":"sha256:df7253a3dbc8cb57daee6cc40f2c264053d9876ee7269e97b367824e1c258f46","observation_id":"90a266c4-d203-4ace-891a-bf43674befb2","resolution":{"observed_at":"2026-08-16T11:55:39.891688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:55:40.262826Z","title":"Sdp: Co-designing algorithm, dataflow, and architecture for in-sram sparse nn acceleration,","venue":null,"work_id":"40c4096b-2843-4c0a-bfba-eab93e0bbb1e","year":2022},"citing_paper":{"arxiv_id":"2504.14365","last_updated":"2025-04-19T17:47:01Z","snapshot_observed_at":"2026-08-19T09:06:04.163791Z","submitted_at":"2025-04-19T17:47:01Z","title":"Accelerating LLM Inference with Flexible N:M Sparsity via A Fully Digital Compute-in-Memory Accelerator","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:39.896547Z"},"links":{"citing_paper":"/paper/2504.14365"},"observation_digest":"sha256:d3400c292a940039cf743edc99559441b785aee8fbbc9ea2ef5ec940d9671d33","observation_id":"79b6dd9d-a4d4-471b-ba1c-a5fa3e2f6be5","resolution":{"observed_at":"2026-08-16T11:55:40.268520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:55:40.250254Z","title":"Highlight: Efficient and flexible dnn acceleration with hierarchical structured sparsity,","venue":null,"work_id":"e106d4a8-c29f-4c76-9a35-63353d880d86","year":2023},"citing_paper":{"arxiv_id":"2504.14365","last_updated":"2025-04-19T17:47:01Z","snapshot_observed_at":"2026-08-19T09:06:04.163791Z","submitted_at":"2025-04-19T17:47:01Z","title":"Accelerating LLM Inference with Flexible N:M Sparsity via A Fully Digital Compute-in-Memory Accelerator","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:39.900849Z"},"links":{"citing_paper":"/paper/2504.14365"},"observation_digest":"sha256:33adfce9ef6509658e3552c65bf2dd59e0f908501a6ca1aa04286ab7a494f898","observation_id":"6e68ec14-afeb-4b99-89cf-52cb180c80c8","resolution":{"observed_at":"2026-08-16T11:55:40.254592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:55:40.236798Z","title":"A task-centric angle of llm pre-trained weights through sparsity,","venue":null,"work_id":"857d0579-9e11-414d-a20c-ecd054a46fde","year":2024},"citing_paper":{"arxiv_id":"2504.14365","last_updated":"2025-04-19T17:47:01Z","snapshot_observed_at":"2026-08-19T09:06:04.163791Z","submitted_at":"2025-04-19T17:47:01Z","title":"Accelerating LLM Inference with Flexible N:M Sparsity via A Fully Digital Compute-in-Memory Accelerator","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:39.904752Z"},"links":{"citing_paper":"/paper/2504.14365"},"observation_digest":"sha256:457f7e04d5e7bc6ad8478cb9dbdfdc591b5aa4a6d71a0fc09f1d05651a1ceaca","observation_id":"1c7ab78a-537e-42c3-8244-0f2ba667a316","resolution":{"observed_at":"2026-08-16T11:55:40.241471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:55:40.223976Z","title":"Outlier weighed layerwise sparsity: A missing secret sauce for pruning llms to high sparsity,","venue":null,"work_id":"e4adbb08-2e1d-4152-8c52-8ec8acecd67f","year":2024},"citing_paper":{"arxiv_id":"2504.14365","last_updated":"2025-04-19T17:47:01Z","snapshot_observed_at":"2026-08-19T09:06:04.163791Z","submitted_at":"2025-04-19T17:47:01Z","title":"Accelerating LLM Inference with Flexible N:M Sparsity via A Fully Digital Compute-in-Memory Accelerator","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:39.908929Z"},"links":{"citing_paper":"/paper/2504.14365"},"observation_digest":"sha256:8b84ec3d9d4f3c6b47a5ce8e7bef5534bacccc8dbc823383f74c15dcf08d8e76","observation_id":"331331cc-b9bd-4f5b-ad0d-bbc9a4105c54","resolution":{"observed_at":"2026-08-16T11:55:40.227953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:55:39.913686Z","title":"Compute-in-memory chips for deep learning: Recent trends and prospects,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.14365","last_updated":"2025-04-19T17:47:01Z","snapshot_observed_at":"2026-08-19T09:06:04.163791Z","submitted_at":"2025-04-19T17:47:01Z","title":"Accelerating LLM Inference with Flexible N:M Sparsity via A Fully Digital Compute-in-Memory Accelerator","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:39.913686Z"},"links":{"citing_paper":"/paper/2504.14365"},"observation_digest":"sha256:ef5ba820e9d07e0ca3b1862a049aa218048a288646811866bc94aad8174b993b","observation_id":"a168e307-4eb4-429e-a4a5-50c6103df820","resolution":{"observed_at":"2026-08-16T11:55:39.913686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:55:40.204520Z","title":"15.2 a 2.75-to-75.9 tops/w computing-in-memory nn processor supporting set-associate block-wise zero skipping and ping- pong cim with simultaneous computation and weight updating,","venue":null,"work_id":"a0e0c65f-06da-4b81-b658-5b2d8e0dfab5","year":2021},"citing_paper":{"arxiv_id":"2504.14365","last_updated":"2025-04-19T17:47:01Z","snapshot_observed_at":"2026-08-19T09:06:04.163791Z","submitted_at":"2025-04-19T17:47:01Z","title":"Accelerating LLM Inference with Flexible N:M Sparsity via A Fully Digital Compute-in-Memory Accelerator","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:39.920416Z"},"links":{"citing_paper":"/paper/2504.14365"},"observation_digest":"sha256:a3287c1a4b7e84aeb440c7dd85f9c9fb4f3e89724539e1ae6e5774a5c1d882e8","observation_id":"080ca778-31e3-4487-8262-2b95ec81283d","resolution":{"observed_at":"2026-08-16T11:55:40.208706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.07830","last_updated":"2019-05-19T23:57:23Z","snapshot_observed_at":"2026-08-15T09:37:44.321271Z","submitted_at":"2019-05-19T23:57:23Z","title":"HellaSwag: Can a Machine Really Finish Your Sentence?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.07830","snapshot_observed_at":"2026-08-16T11:55:39.925019Z","title":"Hel- laswag: Can a machine really finish your sentence?","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2504.14365","last_updated":"2025-04-19T17:47:01Z","snapshot_observed_at":"2026-08-19T09:06:04.163791Z","submitted_at":"2025-04-19T17:47:01Z","title":"Accelerating LLM Inference with Flexible N:M Sparsity via A Fully Digital Compute-in-Memory Accelerator","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:39.925019Z"},"links":{"cited_paper":"/paper/1905.07830","citing_paper":"/paper/2504.14365"},"observation_digest":"sha256:d9e49fcbc47419dba69526d81f42b25a48e8917ded75d411b1911d7857c40c23","observation_id":"9b9bce9e-a36b-402e-98a8-026e8992f655","resolution":{"observed_at":"2026-08-16T11:55:39.925019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:55:40.192015Z","title":"A 28-nm 18.7 tops/mm2 89.4-to-234.6 tops/w 8b single-finger edram compute- in-memory macro with bit-wise sparsity aware and kernel-wise weight update/refresh,","venue":null,"work_id":"aca638fc-4411-4de1-be9b-86c7b79e491d","year":2024},"citing_paper":{"arxiv_id":"2504.14365","last_updated":"2025-04-19T17:47:01Z","snapshot_observed_at":"2026-08-19T09:06:04.163791Z","submitted_at":"2025-04-19T17:47:01Z","title":"Accelerating LLM Inference with Flexible N:M Sparsity via A Fully Digital Compute-in-Memory Accelerator","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:39.929262Z"},"links":{"citing_paper":"/paper/2504.14365"},"observation_digest":"sha256:4fef57c1abcccab207d14155f048d034388b9e7d0249e052a67ad69a4143334c","observation_id":"d96b563b-51a0-4dbc-a7bc-9693216e49b0","resolution":{"observed_at":"2026-08-16T11:55:40.196376Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08915","last_updated":"2024-02-26T02:51:30Z","snapshot_observed_at":"2026-08-19T09:05:44.751441Z","submitted_at":"2023-10-13T07:38:52Z","title":"Dynamic Sparse No Training: Training-Free Fine-tuning for Sparse LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08915","snapshot_observed_at":"2026-08-16T11:55:39.934771Z","title":"Dynamic sparse no training: Training-free fine-tuning for sparse llms,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14365","last_updated":"2025-04-19T17:47:01Z","snapshot_observed_at":"2026-08-19T09:06:04.163791Z","submitted_at":"2025-04-19T17:47:01Z","title":"Accelerating LLM Inference with Flexible N:M Sparsity via A Fully Digital Compute-in-Memory Accelerator","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:39.934771Z"},"links":{"cited_paper":"/paper/2310.08915","citing_paper":"/paper/2504.14365"},"observation_digest":"sha256:198db1542f8da73256bbef29050d9b2e72fa98b7820ea5f533a59b507b8e0d87","observation_id":"feb2bccb-3a17-4750-8c1c-da429d3217f3","resolution":{"observed_at":"2026-08-16T11:55:39.934771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:55:40.179379Z","title":"A digital sram computing-in-memory design utilizing activation unstructured sparsity for high-efficient dnn inference,","venue":null,"work_id":"4fa5d947-fcc1-473b-962e-f76e9decb41e","year":2023},"citing_paper":{"arxiv_id":"2504.14365","last_updated":"2025-04-19T17:47:01Z","snapshot_observed_at":"2026-08-19T09:06:04.163791Z","submitted_at":"2025-04-19T17:47:01Z","title":"Accelerating LLM Inference with Flexible N:M Sparsity via A Fully Digital Compute-in-Memory Accelerator","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:39.939185Z"},"links":{"citing_paper":"/paper/2504.14365"},"observation_digest":"sha256:0500b9588f3194967375dd167f8b1e08c0d970db19041005885a02da74e817d8","observation_id":"3139199b-6603-4da6-be46-fcbe77bdd443","resolution":{"observed_at":"2026-08-16T11:55:40.183762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2504.14365","last_updated":"2025-04-19T17:47:01Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-19T09:06:04.163791Z","submitted_at":"2025-04-19T17:47:01Z","title":"Accelerating LLM Inference with Flexible N:M Sparsity via A Fully Digital Compute-in-Memory Accelerator"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":24,"verified_exact":1,"verified_fuzzy":19},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 0 inbound Pith citation observations for arXiv:2504.14365."}