{"as_of":"2026-08-10T10:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ed2b0bc5016b74f61da20fe538116571b27a52cfcc2ca9b25e41a18bfe767d99","coverage":[{"denominator":52,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T05:11:11.706409Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T19:40:42.033793Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-29T19:43:54.702984Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.02128","last_updated":"2025-08-04T07:22:36Z","snapshot_observed_at":"2026-08-08T06:49:38.643278Z","submitted_at":"2025-08-04T07:22:36Z","title":"Amber Pruner: Leveraging N:M Activation Sparsity for Efficient Prefill in Large Language Models","version":1},"cited_work":{"arxiv_id":"2508.02128","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.02128","snapshot_observed_at":"2026-06-29T19:43:54.702984Z","title":"Amber pruner: Leveraging n: M activation sparsity for efficient prefill in large language models.arXiv preprint arXiv:2508.02128, 2025a","venue":null,"work_id":"50d7ce39-f04d-4deb-b55c-490086b84b7b","year":2025},"citing_paper":{"arxiv_id":"2509.22166","last_updated":"2026-04-24T11:44:43Z","snapshot_observed_at":"2026-07-06T22:30:50.642382Z","submitted_at":"2025-09-26T10:27:55Z","title":"Motivating Next-Gen Accelerators with Flexible (N:M) Activation Sparsity via Benchmarking Lightweight Post-Training Sparsification Approaches","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-18T13:36:55.938673Z"},"links":{"cited_paper":"/paper/2508.02128","citing_paper":"/paper/2509.22166"},"observation_digest":"sha256:b5fc1a32ef2080e581f437817bccedd836991566c8013a48ccbf2b5851821dd2","observation_id":"e816b420-7e09-4425-98d7-ba16d22ca3e6","resolution":{"observed_at":"2026-05-18T13:41:25.922214Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.02128","last_updated":"2025-08-04T07:22:36Z","snapshot_observed_at":"2026-08-08T06:49:38.643278Z","submitted_at":"2025-08-04T07:22:36Z","title":"Amber Pruner: Leveraging N:M Activation Sparsity for Efficient Prefill in Large Language Models","version":1},"cited_work":{"arxiv_id":"2508.02128","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.02128","snapshot_observed_at":"2026-06-29T19:43:54.702984Z","title":"Amber pruner: Leveraging n: M activation sparsity for efficient prefill in large language models.arXiv preprint arXiv:2508.02128, 2025a","venue":null,"work_id":"50d7ce39-f04d-4deb-b55c-490086b84b7b","year":2025},"citing_paper":{"arxiv_id":"2605.26632","last_updated":"2026-06-01T03:03:29Z","snapshot_observed_at":"2026-07-06T23:36:29.930024Z","submitted_at":"2026-05-26T07:09:49Z","title":"RT-Lynx: Putting the GEMM Sparsity In a Right Way for Diffusion Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-29T19:40:42.033793Z"},"links":{"cited_paper":"/paper/2508.02128","citing_paper":"/paper/2605.26632"},"observation_digest":"sha256:d37da0f5cb4dc01918356c2a938121d245e4514a2f1f10b3d6edd552b44833ab","observation_id":"f9e08ccf-b2b7-4364-8716-02e6955b4c0e","resolution":{"observed_at":"2026-06-29T19:43:54.704636Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2508.02128/citation-record","integrity":"/paper/2508.02128/integrity","json":"/paper/2508.02128/citation-record.json","paper":"/paper/2508.02128"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:10:19.153810Z","title":", \" * write output.state after.block = add.period write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.02128","last_updated":"2025-08-04T07:22:36Z","snapshot_observed_at":"2026-08-08T06:49:38.643278Z","submitted_at":"2025-08-04T07:22:36Z","title":"Amber Pruner: Leveraging N:M Activation Sparsity for Efficient Prefill in Large Language Models","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T05:10:19.153810Z"},"links":{"citing_paper":"/paper/2508.02128"},"observation_digest":"sha256:5542c4cde86996bdd56498d198a7e51d2a2ff4e35fd0e0a63503bde0bf15c6ee","observation_id":"6cf075a2-4ae9-42b8-9f4e-7aa3b8ce7c01","resolution":{"observed_at":"2026-08-06T05:10:19.153810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:11:10.995985Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.02128","last_updated":"2025-08-04T07:22:36Z","snapshot_observed_at":"2026-08-08T06:49:38.643278Z","submitted_at":"2025-08-04T07:22:36Z","title":"Amber Pruner: Leveraging N:M Activation Sparsity for Efficient Prefill in Large Language Models","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T05:11:10.995985Z"},"links":{"citing_paper":"/paper/2508.02128"},"observation_digest":"sha256:86aa3da61a658b52578fb8b132d2a0de888f20ebc3d648bad2c13662545cdb67","observation_id":"02d4495d-3ed8-42f4-841d-ea9a3004499d","resolution":{"observed_at":"2026-08-06T05:11:10.995985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.14508","last_updated":"2024-06-19T04:00:32Z","snapshot_observed_at":"2026-08-08T03:49:18.086396Z","submitted_at":"2023-08-28T11:53:40Z","title":"LongBench: A Bilingual, Multitask Benchmark for Long Context Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.14508","snapshot_observed_at":"2026-08-06T05:11:11.011704Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.02128","last_updated":"2025-08-04T07:22:36Z","snapshot_observed_at":"2026-08-08T06:49:38.643278Z","submitted_at":"2025-08-04T07:22:36Z","title":"Amber Pruner: Leveraging N:M Activation Sparsity for Efficient Prefill in Large Language Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T05:11:11.011704Z"},"links":{"cited_paper":"/paper/2308.14508","citing_paper":"/paper/2508.02128"},"observation_digest":"sha256:808668b51c98dae9cdc7bfad4f4960af5770fcb26773e12a5b7e9b122c6875a8","observation_id":"17f7246f-6056-46fb-8ba4-7f746eb906ec","resolution":{"observed_at":"2026-08-06T05:11:11.011704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:11:12.391019Z","title":"L.; Gao, J.; and Choi, Y","venue":null,"work_id":"0178ba43-0c94-45df-979b-d22b13d1d3b9","year":2020},"citing_paper":{"arxiv_id":"2508.02128","last_updated":"2025-08-04T07:22:36Z","snapshot_observed_at":"2026-08-08T06:49:38.643278Z","submitted_at":"2025-08-04T07:22:36Z","title":"Amber Pruner: Leveraging N:M Activation Sparsity for Efficient Prefill in Large Language Models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T05:11:11.078584Z"},"links":{"citing_paper":"/paper/2508.02128"},"observation_digest":"sha256:22a818cdaa7f838c8a41069df74af8eddde5a4cc1e67228e2c8770a8426db344","observation_id":"94b7c277-5380-4e0a-8e2f-29a8e9072ae9","resolution":{"observed_at":"2026-08-06T05:11:12.394989Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.10044","last_updated":"2019-05-24T05:48:49Z","snapshot_observed_at":"2026-07-06T07:55:12.121264Z","submitted_at":"2019-05-24T05:48:49Z","title":"BoolQ: Exploring the Surprising Difficulty of Natural Yes/No Questions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.10044","snapshot_observed_at":"2026-08-06T05:11:11.147206Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.02128","last_updated":"2025-08-04T07:22:36Z","snapshot_observed_at":"2026-08-08T06:49:38.643278Z","submitted_at":"2025-08-04T07:22:36Z","title":"Amber Pruner: Leveraging N:M Activation Sparsity for Efficient Prefill in Large Language Models","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T05:11:11.147206Z"},"links":{"cited_paper":"/paper/1905.10044","citing_paper":"/paper/2508.02128"},"observation_digest":"sha256:15d15674f31b21b40f67ae324833d8ff9aec9589f20bde393fc05f50e3374940","observation_id":"d22fda09-5907-4d84-8b35-8435bf4048c4","resolution":{"observed_at":"2026-08-06T05:11:11.147206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-06T05:11:11.222099Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.02128","last_updated":"2025-08-04T07:22:36Z","snapshot_observed_at":"2026-08-08T06:49:38.643278Z","submitted_at":"2025-08-04T07:22:36Z","title":"Amber Pruner: Leveraging N:M Activation Sparsity for Efficient Prefill in Large Language Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T05:11:11.222099Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2508.02128"},"observation_digest":"sha256:846ec88ec58d625083f06ee110587354f81129ff749eb7f4e26b0e067ea7a54b","observation_id":"e0d8fa5f-545a-4ddd-a499-e02ec634198f","resolution":{"observed_at":"2026-08-06T05:11:11.222099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-06T05:11:11.293076Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.02128","last_updated":"2025-08-04T07:22:36Z","snapshot_observed_at":"2026-08-08T06:49:38.643278Z","submitted_at":"2025-08-04T07:22:36Z","title":"Amber Pruner: Leveraging N:M Activation Sparsity for Efficient Prefill in Large Language Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T05:11:11.293076Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2508.02128"},"observation_digest":"sha256:6879a03a59392789daf2e536c5f9c03fce48f4a78762aae35c69f63d408e11c1","observation_id":"9b951e0b-a25e-4363-a852-0d24a4aeb331","resolution":{"observed_at":"2026-08-06T05:11:11.293076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04902","last_updated":"2024-04-08T22:42:49Z","snapshot_observed_at":"2026-07-30T16:56:04.978117Z","submitted_at":"2023-11-08T18:59:54Z","title":"Beyond Size: How Gradients Shape Pruning Decisions in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04902","snapshot_observed_at":"2026-08-06T05:11:11.426493Z","title":"J.; Sun, M.; Ma, L.; and Shen, Z","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.02128","last_updated":"2025-08-04T07:22:36Z","snapshot_observed_at":"2026-08-08T06:49:38.643278Z","submitted_at":"2025-08-04T07:22:36Z","title":"Amber Pruner: Leveraging N:M Activation Sparsity for Efficient Prefill in Large Language Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T05:11:11.426493Z"},"links":{"cited_paper":"/paper/2311.04902","citing_paper":"/paper/2508.02128"},"observation_digest":"sha256:f5767b21851b63aecc8b55812ed9c8bf97d224923e604cd762ac404ac91605c3","observation_id":"ceda6952-9fef-47d2-993d-2a9f3c0085fa","resolution":{"observed_at":"2026-08-06T05:11:11.426493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.07339","last_updated":"2022-11-10T18:14:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-08-15T17:08:50Z","title":"LLM.int8(): 8-bit Matrix Multiplication for Transformers at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.07339","snapshot_observed_at":"2026-08-06T05:11:11.500179Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.02128","last_updated":"2025-08-04T07:22:36Z","snapshot_observed_at":"2026-08-08T06:49:38.643278Z","submitted_at":"2025-08-04T07:22:36Z","title":"Amber Pruner: Leveraging N:M Activation Sparsity for Efficient Prefill in Large Language Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T05:11:11.500179Z"},"links":{"cited_paper":"/paper/2208.07339","citing_paper":"/paper/2508.02128"},"observation_digest":"sha256:7624bd053ce26294049e384589fa5c94ae97c03b3c45e15b3b4dfab663f22151","observation_id":"b457c3f9-2abc-4177-81d1-555cf75d7bf9","resolution":{"observed_at":"2026-08-06T05:11:11.500179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:11:12.378996Z","title":null,"venue":null,"work_id":"aebc3075-e234-48a2-bf0a-ea886e3f5bed","year":2023},"citing_paper":{"arxiv_id":"2508.02128","last_updated":"2025-08-04T07:22:36Z","snapshot_observed_at":"2026-08-08T06:49:38.643278Z","submitted_at":"2025-08-04T07:22:36Z","title":"Amber Pruner: Leveraging N:M Activation Sparsity for Efficient Prefill in Large Language Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T05:11:11.504417Z"},"links":{"citing_paper":"/paper/2508.02128"},"observation_digest":"sha256:363040dabb1abc67235784132c2cc5ea00805e43010f90adaea3096eba970203","observation_id":"eaa00f33-b502-47b9-be16-0702e325d5ce","resolution":{"observed_at":"2026-08-06T05:11:12.383184Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17481","last_updated":"2024-12-07T12:01:28Z","snapshot_observed_at":"2026-08-04T12:55:07.134932Z","submitted_at":"2024-09-26T02:37:41Z","title":"MaskLLM: Learnable Semi-Structured Sparsity for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17481","snapshot_observed_at":"2026-08-06T05:11:11.510462Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.02128","last_updated":"2025-08-04T07:22:36Z","snapshot_observed_at":"2026-08-08T06:49:38.643278Z","submitted_at":"2025-08-04T07:22:36Z","title":"Amber Pruner: Leveraging N:M Activation Sparsity for Efficient Prefill in Large Language Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T05:11:11.510462Z"},"links":{"cited_paper":"/paper/2409.17481","citing_paper":"/paper/2508.02128"},"observation_digest":"sha256:1db2746a57bfb8903dae46dc09cc194a2bc4cb2b5e38d75e1c768db47ce84585","observation_id":"523da929-dc69-4c5a-a267-792382ca1c2a","resolution":{"observed_at":"2026-08-06T05:11:11.510462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:11:11.515162Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.02128","last_updated":"2025-08-04T07:22:36Z","snapshot_observed_at":"2026-08-08T06:49:38.643278Z","submitted_at":"2025-08-04T07:22:36Z","title":"Amber Pruner: Leveraging N:M Activation Sparsity for Efficient Prefill in Large Language Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T05:11:11.515162Z"},"links":{"citing_paper":"/paper/2508.02128"},"observation_digest":"sha256:3007615bea7c31083986c2e5ca80938d758da384f198f422aba3e0e1dd74d0d4","observation_id":"146c1388-7cbc-4238-adbc-2f9f7feb242a","resolution":{"observed_at":"2026-08-06T05:11:11.515162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T05:11:11.520813Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.02128","last_updated":"2025-08-04T07:22:36Z","snapshot_observed_at":"2026-08-08T06:49:38.643278Z","submitted_at":"2025-08-04T07:22:36Z","title":"Amber Pruner: Leveraging N:M Activation Sparsity for Efficient Prefill in Large Language Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T05:11:11.520813Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2508.02128"},"observation_digest":"sha256:644a5eb0f3b7f44d4a783680552ed3a27feae5ffc757d70bebbb08959a61623f","observation_id":"1478865e-500d-43a6-9930-000d799c9224","resolution":{"observed_at":"2026-08-06T05:11:11.520813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17887","last_updated":"2025-03-03T17:02:05Z","snapshot_observed_at":"2026-08-03T06:33:46.668360Z","submitted_at":"2024-03-26T17:20:04Z","title":"The Unreasonable Ineffectiveness of the Deeper Layers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17887","snapshot_observed_at":"2026-08-06T05:11:11.524583Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.02128","last_updated":"2025-08-04T07:22:36Z","snapshot_observed_at":"2026-08-08T06:49:38.643278Z","submitted_at":"2025-08-04T07:22:36Z","title":"Amber Pruner: Leveraging N:M Activation Sparsity for Efficient Prefill in Large Language Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T05:11:11.524583Z"},"links":{"cited_paper":"/paper/2403.17887","citing_paper":"/paper/2508.02128"},"observation_digest":"sha256:e1a772c907039da2f49b2b76c81d678f3281a3a4fc8fa2888121e8c9930f1e1a","observation_id":"428b471c-e54d-40c7-bb57-69bac7a49e01","resolution":{"observed_at":"2026-08-06T05:11:11.524583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:11:12.359207Z","title":null,"venue":null,"work_id":"f89e3e79-e447-4000-b5ab-9910c3182a07","year":2024},"citing_paper":{"arxiv_id":"2508.02128","last_updated":"2025-08-04T07:22:36Z","snapshot_observed_at":"2026-08-08T06:49:38.643278Z","submitted_at":"2025-08-04T07:22:36Z","title":"Amber Pruner: Leveraging N:M Activation Sparsity for Efficient Prefill in Large Language Models","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T05:11:11.534626Z"},"links":{"citing_paper":"/paper/2508.02128"},"observation_digest":"sha256:afc2518aaecc473a240589064738be941ce6a7b78dad7dd5b754f410f32f59e4","observation_id":"58a9cd1f-f14c-4961-8596-33921d7bcd6d","resolution":{"observed_at":"2026-08-06T05:11:12.363775Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:11:11.539165Z","title":"G.; and Wolff, G","venue":null,"work_id":null,"year":1993},"citing_paper":{"arxiv_id":"2508.02128","last_updated":"2025-08-04T07:22:36Z","snapshot_observed_at":"2026-08-08T06:49:38.643278Z","submitted_at":"2025-08-04T07:22:36Z","title":"Amber Pruner: Leveraging N:M Activation Sparsity for Efficient Prefill in Large Language Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T05:11:11.539165Z"},"links":{"citing_paper":"/paper/2508.02128"},"observation_digest":"sha256:15e2c48fc63e3a29d78310bc4f0e054fc8732ae7df62af25fd9d4f27ec845f0c","observation_id":"553d8925-7d8a-4586-a599-fd05558c6ecb","resolution":{"observed_at":"2026-08-06T05:11:11.539165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.16672","last_updated":"2025-03-20T19:37:12Z","snapshot_observed_at":"2026-08-07T16:48:06.552922Z","submitted_at":"2025-03-20T19:37:12Z","title":"Accelerating Transformer Inference and Training with 2:4 Activation Sparsity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.16672","snapshot_observed_at":"2026-08-06T05:11:11.542793Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.02128","last_updated":"2025-08-04T07:22:36Z","snapshot_observed_at":"2026-08-08T06:49:38.643278Z","submitted_at":"2025-08-04T07:22:36Z","title":"Amber Pruner: Leveraging N:M Activation Sparsity for Efficient Prefill in Large Language Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T05:11:11.542793Z"},"links":{"cited_paper":"/paper/2503.16672","citing_paper":"/paper/2508.02128"},"observation_digest":"sha256:c721a460c0d17dc46984461c1049e2262aa5770ef0e3af73303255626e76d9b6","observation_id":"78e5d969-af4f-4489-a24d-382810b76b13","resolution":{"observed_at":"2026-08-06T05:11:11.542793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:11:12.333850Z","title":null,"venue":null,"work_id":"573d7332-534a-4f0d-91be-f30157a068e3","year":2021},"citing_paper":{"arxiv_id":"2508.02128","last_updated":"2025-08-04T07:22:36Z","snapshot_observed_at":"2026-08-08T06:49:38.643278Z","submitted_at":"2025-08-04T07:22:36Z","title":"Amber Pruner: Leveraging N:M Activation Sparsity for Efficient Prefill in Large Language Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T05:11:11.547176Z"},"links":{"citing_paper":"/paper/2508.02128"},"observation_digest":"sha256:3e22cb4721b157c25c981aa3b6d6c29c97a530b345c41b47f4d23ae23c08141a","observation_id":"41e5d15d-812d-4fd9-92b1-a4882a56973f","resolution":{"observed_at":"2026-08-06T05:11:12.338397Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01847","last_updated":"2024-10-27T14:40:08Z","snapshot_observed_at":"2026-08-10T10:01:00.431320Z","submitted_at":"2024-04-02T11:12:42Z","title":"Accelerating Transformer Pre-training with 2:4 Sparsity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01847","snapshot_observed_at":"2026-08-06T05:11:11.551392Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.02128","last_updated":"2025-08-04T07:22:36Z","snapshot_observed_at":"2026-08-08T06:49:38.643278Z","submitted_at":"2025-08-04T07:22:36Z","title":"Amber Pruner: Leveraging N:M Activation Sparsity for Efficient Prefill in Large Language Models","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T05:11:11.551392Z"},"links":{"cited_paper":"/paper/2404.01847","citing_paper":"/paper/2508.02128"},"observation_digest":"sha256:c1bd5aaa00685e08b67619e61f04f973756d5d2c20220bdf9762db36d694675b","observation_id":"437085c9-cba2-4efc-b961-a88467b033b6","resolution":{"observed_at":"2026-08-06T05:11:11.551392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.09099","last_updated":"2024-12-27T09:30:18Z","snapshot_observed_at":"2026-08-10T05:13:08.134729Z","submitted_at":"2024-09-13T08:29:36Z","title":"S-STE: Continuous Pruning Function for Efficient 2:4 Sparse Pre-training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.09099","snapshot_observed_at":"2026-08-06T05:11:11.555199Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.02128","last_updated":"2025-08-04T07:22:36Z","snapshot_observed_at":"2026-08-08T06:49:38.643278Z","submitted_at":"2025-08-04T07:22:36Z","title":"Amber Pruner: Leveraging N:M Activation Sparsity for Efficient Prefill in Large Language Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T05:11:11.555199Z"},"links":{"cited_paper":"/paper/2409.09099","citing_paper":"/paper/2508.02128"},"observation_digest":"sha256:f4cad91e1e5acea45447126a7d3bde9f3fe3260694cc6984851c1a008d828f69","observation_id":"638394ea-e553-4992-984f-ebbfa37df50e","resolution":{"observed_at":"2026-08-06T05:11:11.555199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:11:12.320044Z","title":null,"venue":null,"work_id":"2a9ad604-a8a5-498b-b4a7-91033238065b","year":2025},"citing_paper":{"arxiv_id":"2508.02128","last_updated":"2025-08-04T07:22:36Z","snapshot_observed_at":"2026-08-08T06:49:38.643278Z","submitted_at":"2025-08-04T07:22:36Z","title":"Amber Pruner: Leveraging N:M Activation Sparsity for Efficient Prefill in Large Language Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T05:11:11.559200Z"},"links":{"citing_paper":"/paper/2508.02128"},"observation_digest":"sha256:1de54b43ab46b568f8eb0886668fdb618aeb1be97c150747eee12ef68a4c4c8e","observation_id":"cf2f87d0-69fc-4258-b3d6-353efe663b34","resolution":{"observed_at":"2026-08-06T05:11:12.324874Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.08322","last_updated":"2023-11-06T13:24:16Z","snapshot_observed_at":"2026-08-08T19:03:09.038168Z","submitted_at":"2023-05-15T03:20:19Z","title":"C-Eval: A Multi-Level Multi-Discipline Chinese Evaluation Suite for Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.08322","snapshot_observed_at":"2026-08-06T05:11:11.565436Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.02128","last_updated":"2025-08-04T07:22:36Z","snapshot_observed_at":"2026-08-08T06:49:38.643278Z","submitted_at":"2025-08-04T07:22:36Z","title":"Amber Pruner: Leveraging N:M Activation Sparsity for Efficient Prefill in Large Language Models","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T05:11:11.565436Z"},"links":{"cited_paper":"/paper/2305.08322","citing_paper":"/paper/2508.02128"},"observation_digest":"sha256:cbf8c5e57b8a791629200dc68c0798f1df4d259b635708746bb959685eda6bfd","observation_id":"714064f6-28d7-4856-a294-da645a826660","resolution":{"observed_at":"2026-08-06T05:11:11.565436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.13868","last_updated":"2024-06-19T22:12:51Z","snapshot_observed_at":"2026-08-05T04:08:05.984919Z","submitted_at":"2024-06-19T22:12:51Z","title":"SDQ: Sparse Decomposed Quantization for LLM Inference","version":1},"cited_work":{"arxiv_id":"2406.13868","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.13868","snapshot_observed_at":"2026-08-06T05:11:12.089860Z","title":"SDQ: Sparse Decomposed Quantization for LLM Inference","venue":"cs.LG","work_id":"a277cb9f-5fe4-4d6e-ae09-c5f6a127dbfc","year":2024},"citing_paper":{"arxiv_id":"2508.02128","last_updated":"2025-08-04T07:22:36Z","snapshot_observed_at":"2026-08-08T06:49:38.643278Z","submitted_at":"2025-08-04T07:22:36Z","title":"Amber Pruner: Leveraging N:M Activation Sparsity for Efficient Prefill in Large Language Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T05:11:11.569727Z"},"links":{"cited_paper":"/paper/2406.13868","citing_paper":"/paper/2508.02128"},"observation_digest":"sha256:6e580fba9c2238a6f0c60743a446422d50cb110b0eb8796df62661532351aef6","observation_id":"d65ff20b-b622-4cfa-be88-2d8371f85c71","resolution":{"observed_at":"2026-08-06T05:11:12.094990Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07289","last_updated":"2025-05-12T07:23:19Z","snapshot_observed_at":"2026-08-07T15:47:58.899809Z","submitted_at":"2025-05-12T07:23:19Z","title":"Semantic Retention and Extreme Compression in LLMs: Can We Have Both?","version":1},"cited_work":{"arxiv_id":"2505.07289","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.07289","snapshot_observed_at":"2026-08-06T05:11:12.070710Z","title":"Semantic Retention and Extreme Compression in LLMs: Can We Have Both?","venue":"cs.CL","work_id":"27d8e7ed-2679-4d05-ac4c-ad4168cb0bef","year":2025},"citing_paper":{"arxiv_id":"2508.02128","last_updated":"2025-08-04T07:22:36Z","snapshot_observed_at":"2026-08-08T06:49:38.643278Z","submitted_at":"2025-08-04T07:22:36Z","title":"Amber Pruner: Leveraging N:M Activation Sparsity for Efficient Prefill in Large Language Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T05:11:11.572964Z"},"links":{"cited_paper":"/paper/2505.07289","citing_paper":"/paper/2508.02128"},"observation_digest":"sha256:3315ca97ad4d1f22de769701adff3ea2e225fda498b11976c7273613c3f2d3c7","observation_id":"6157d236-73a5-4c0e-8828-2c7859393a4d","resolution":{"observed_at":"2026-08-06T05:11:12.076276Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09212","last_updated":"2024-01-17T19:09:57Z","snapshot_observed_at":"2026-08-04T18:52:19.083847Z","submitted_at":"2023-06-15T15:49:51Z","title":"CMMLU: Measuring massive multitask language understanding in Chinese","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09212","snapshot_observed_at":"2026-08-06T05:11:11.576316Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.02128","last_updated":"2025-08-04T07:22:36Z","snapshot_observed_at":"2026-08-08T06:49:38.643278Z","submitted_at":"2025-08-04T07:22:36Z","title":"Amber Pruner: Leveraging N:M Activation Sparsity for Efficient Prefill in Large Language Models","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T05:11:11.576316Z"},"links":{"cited_paper":"/paper/2306.09212","citing_paper":"/paper/2508.02128"},"observation_digest":"sha256:12463a947c77e6c955ea00e81dbe8e5b24ee6f0ef0ef0a68367c2502943d2fff","observation_id":"857a773c-4cfb-4069-b06e-5f69e239ab81","resolution":{"observed_at":"2026-08-06T05:11:11.576316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.15929","last_updated":"2024-03-22T09:18:24Z","snapshot_observed_at":"2026-07-06T16:37:54.347934Z","submitted_at":"2023-10-24T15:27:15Z","title":"E-Sparse: Boosting the Large Language Model Inference through Entropy-based N:M Sparsity","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.15929","snapshot_observed_at":"2026-08-06T05:11:11.579620Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.02128","last_updated":"2025-08-04T07:22:36Z","snapshot_observed_at":"2026-08-08T06:49:38.643278Z","submitted_at":"2025-08-04T07:22:36Z","title":"Amber Pruner: Leveraging N:M Activation Sparsity for Efficient Prefill in Large Language Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T05:11:11.579620Z"},"links":{"cited_paper":"/paper/2310.15929","citing_paper":"/paper/2508.02128"},"observation_digest":"sha256:ff9fa021900540af4e942fe8868fd3865230e4d65468fffbe37c596aeffbdd1d","observation_id":"009f3c21-158a-422f-9d8b-0ea7d05a7886","resolution":{"observed_at":"2026-08-06T05:11:11.579620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.06313","last_updated":"2023-06-09T21:53:43Z","snapshot_observed_at":"2026-08-09T19:21:20.628465Z","submitted_at":"2022-10-12T15:25:19Z","title":"The Lazy Neuron Phenomenon: On Emergence of Activation Sparsity in Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.06313","snapshot_observed_at":"2026-08-06T05:11:11.595425Z","title":"S.; Reddi, S","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.02128","last_updated":"2025-08-04T07:22:36Z","snapshot_observed_at":"2026-08-08T06:49:38.643278Z","submitted_at":"2025-08-04T07:22:36Z","title":"Amber Pruner: Leveraging N:M Activation Sparsity for Efficient Prefill in Large Language Models","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T05:11:11.595425Z"},"links":{"cited_paper":"/paper/2210.06313","citing_paper":"/paper/2508.02128"},"observation_digest":"sha256:60908e3245a11814bb67a3e90dc87f27d5544b69d07e8698f7bd5c1484f53c4b","observation_id":"6388bbb7-dceb-4a14-9ec8-611602308aa8","resolution":{"observed_at":"2026-08-06T05:11:11.595425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07605","last_updated":"2025-03-10T17:59:03Z","snapshot_observed_at":"2026-08-07T17:15:54.003090Z","submitted_at":"2025-03-10T17:59:03Z","title":"SEAP: Training-free Sparse Expert Activation Pruning Unlock the Brainpower of Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07605","snapshot_observed_at":"2026-08-06T05:11:11.599541Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.02128","last_updated":"2025-08-04T07:22:36Z","snapshot_observed_at":"2026-08-08T06:49:38.643278Z","submitted_at":"2025-08-04T07:22:36Z","title":"Amber Pruner: Leveraging N:M Activation Sparsity for Efficient Prefill in Large Language Models","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T05:11:11.599541Z"},"links":{"cited_paper":"/paper/2503.07605","citing_paper":"/paper/2508.02128"},"observation_digest":"sha256:b479c9a4a34a87c2d132ce2543eac0b44154d45e320eafd16526fcf3af94b133","observation_id":"4445f581-03eb-4892-a940-594eccb46c8e","resolution":{"observed_at":"2026-08-06T05:11:11.599541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-06T05:11:11.604627Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.02128","last_updated":"2025-08-04T07:22:36Z","snapshot_observed_at":"2026-08-08T06:49:38.643278Z","submitted_at":"2025-08-04T07:22:36Z","title":"Amber Pruner: Leveraging N:M Activation Sparsity for Efficient Prefill in Large Language Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T05:11:11.604627Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2508.02128"},"observation_digest":"sha256:6bd1a3b7fb97598c3175a7a6945c5e46990764f825704777b2f01c25161d7abc","observation_id":"e6783b33-6e59-4be3-8b78-907de6900b1c","resolution":{"observed_at":"2026-08-06T05:11:11.604627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.00258","last_updated":"2025-06-23T21:39:56Z","snapshot_observed_at":"2026-08-09T19:35:24.422342Z","submitted_at":"2025-02-01T01:35:23Z","title":"ProxSparse: Regularized Learning of Semi-Structured Sparsity Masks for Pretrained LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.00258","snapshot_observed_at":"2026-08-06T05:11:11.608849Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.02128","last_updated":"2025-08-04T07:22:36Z","snapshot_observed_at":"2026-08-08T06:49:38.643278Z","submitted_at":"2025-08-04T07:22:36Z","title":"Amber Pruner: Leveraging N:M Activation Sparsity for Efficient Prefill in Large Language Models","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T05:11:11.608849Z"},"links":{"cited_paper":"/paper/2502.00258","citing_paper":"/paper/2508.02128"},"observation_digest":"sha256:1a733d286b71a5037e442dd992a1a1b935b062b17329768b9b98b3bf8fb9e331","observation_id":"0be974c8-6aeb-439d-91d4-c5c3dc03f558","resolution":{"observed_at":"2026-08-06T05:11:11.608849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.14690","last_updated":"2025-02-25T21:00:50Z","snapshot_observed_at":"2026-07-06T19:06:19.400102Z","submitted_at":"2024-08-26T23:30:15Z","title":"Training-Free Activation Sparsity in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.14690","snapshot_observed_at":"2026-08-06T05:11:11.612043Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.02128","last_updated":"2025-08-04T07:22:36Z","snapshot_observed_at":"2026-08-08T06:49:38.643278Z","submitted_at":"2025-08-04T07:22:36Z","title":"Amber Pruner: Leveraging N:M Activation Sparsity for Efficient Prefill in Large Language Models","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T05:11:11.612043Z"},"links":{"cited_paper":"/paper/2408.14690","citing_paper":"/paper/2508.02128"},"observation_digest":"sha256:9f62755c4b609b5c63b611df106916634b6702fa04ba92783d11f8d30c3620bb","observation_id":"d2bee87a-4886-4f4a-9731-77cef304fd5d","resolution":{"observed_at":"2026-08-06T05:11:11.612043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:11:12.304912Z","title":null,"venue":null,"work_id":"e0bb02a3-32ea-4755-9425-29552d1634ed","year":2023},"citing_paper":{"arxiv_id":"2508.02128","last_updated":"2025-08-04T07:22:36Z","snapshot_observed_at":"2026-08-08T06:49:38.643278Z","submitted_at":"2025-08-04T07:22:36Z","title":"Amber Pruner: Leveraging N:M Activation Sparsity for Efficient Prefill in Large Language Models","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T05:11:11.616189Z"},"links":{"citing_paper":"/paper/2508.02128"},"observation_digest":"sha256:24b267a4e4e4c21ff9179452633231bde857b512bc0c1c2de83ec6755c9b0117","observation_id":"6132b3e9-6441-4e00-96ca-c0229775df50","resolution":{"observed_at":"2026-08-06T05:11:12.309744Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09274","last_updated":"2024-05-15T11:42:42Z","snapshot_observed_at":"2026-08-10T05:18:05.127394Z","submitted_at":"2024-05-15T11:42:42Z","title":"Dynamic Activation Pitfalls in LLaMA Models: An Empirical Study","version":1},"cited_work":{"arxiv_id":"2405.09274","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.09274","snapshot_observed_at":"2026-08-06T05:11:11.968721Z","title":"Dynamic Activation Pitfalls in LLaMA Models: An Empirical Study","venue":"cs.LG","work_id":"b2a8bb42-79e8-4e67-b7cf-c53cb7ad1485","year":2024},"citing_paper":{"arxiv_id":"2508.02128","last_updated":"2025-08-04T07:22:36Z","snapshot_observed_at":"2026-08-08T06:49:38.643278Z","submitted_at":"2025-08-04T07:22:36Z","title":"Amber Pruner: Leveraging N:M Activation Sparsity for Efficient Prefill in Large Language Models","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T05:11:11.619429Z"},"links":{"cited_paper":"/paper/2405.09274","citing_paper":"/paper/2508.02128"},"observation_digest":"sha256:f1fe439d019a810a9c7971d3e90fbb4ad6c5ab366aa94ee9a5b22aa872b29e6e","observation_id":"a147d658-17b5-4e36-a758-48fb36746110","resolution":{"observed_at":"2026-08-06T05:11:11.975564Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03853","last_updated":"2024-10-11T09:43:32Z","snapshot_observed_at":"2026-08-03T01:48:18.654934Z","submitted_at":"2024-03-06T17:04:18Z","title":"ShortGPT: Layers in Large Language Models are More Redundant Than You Expect","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03853","snapshot_observed_at":"2026-08-06T05:11:11.622935Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.02128","last_updated":"2025-08-04T07:22:36Z","snapshot_observed_at":"2026-08-08T06:49:38.643278Z","submitted_at":"2025-08-04T07:22:36Z","title":"Amber Pruner: Leveraging N:M Activation Sparsity for Efficient Prefill in Large Language Models","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T05:11:11.622935Z"},"links":{"cited_paper":"/paper/2403.03853","citing_paper":"/paper/2508.02128"},"observation_digest":"sha256:023aaf3fb609430dbc502fad2d55c1f3c0cfcef7af063922c319822c852f3fad","observation_id":"8a9528ad-6715-4758-be84-bbe6fa421587","resolution":{"observed_at":"2026-08-06T05:11:11.622935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:11:12.285843Z","title":null,"venue":null,"work_id":"bf5ea14d-ab2f-4a40-8897-35cc3e8a24e8","year":2018},"citing_paper":{"arxiv_id":"2508.02128","last_updated":"2025-08-04T07:22:36Z","snapshot_observed_at":"2026-08-08T06:49:38.643278Z","submitted_at":"2025-08-04T07:22:36Z","title":"Amber Pruner: Leveraging N:M Activation Sparsity for Efficient Prefill in Large Language Models","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T05:11:11.626950Z"},"links":{"citing_paper":"/paper/2508.02128"},"observation_digest":"sha256:a78ec209b0039099262ce0b36653d1604cc55cb7decaac42607e4afdb68a9e29","observation_id":"7b39e5be-f133-454c-8fe0-503d604e97eb","resolution":{"observed_at":"2026-08-06T05:11:12.291007Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04564","last_updated":"2023-10-06T20:01:33Z","snapshot_observed_at":"2026-08-05T22:58:03.938093Z","submitted_at":"2023-10-06T20:01:33Z","title":"ReLU Strikes Back: Exploiting Activation Sparsity in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04564","snapshot_observed_at":"2026-08-06T05:11:11.632490Z","title":"C.; Tuzel, O.; Samei, G.; Rastegari, M.; and Farajtabar, M","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.02128","last_updated":"2025-08-04T07:22:36Z","snapshot_observed_at":"2026-08-08T06:49:38.643278Z","submitted_at":"2025-08-04T07:22:36Z","title":"Amber Pruner: Leveraging N:M Activation Sparsity for Efficient Prefill in Large Language Models","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T05:11:11.632490Z"},"links":{"cited_paper":"/paper/2310.04564","citing_paper":"/paper/2508.02128"},"observation_digest":"sha256:aa5b203f3e00b8d49db0a699a20dd27aae05dd70fb704d365e2e131b5134a759","observation_id":"bff4c606-33e3-4f43-8258-bc8ccc9cd123","resolution":{"observed_at":"2026-08-06T05:11:11.632490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08378","last_updated":"2021-04-16T21:27:32Z","snapshot_observed_at":"2026-08-09T17:51:25.854845Z","submitted_at":"2021-04-16T21:27:32Z","title":"Accelerating Sparse Deep Neural Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08378","snapshot_observed_at":"2026-08-06T05:11:11.642729Z","title":"A.; Pool, J.; Stosic, D.; Stosic, D.; Venkatesh, G.; Yu, C.; and Micikevicius, P","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.02128","last_updated":"2025-08-04T07:22:36Z","snapshot_observed_at":"2026-08-08T06:49:38.643278Z","submitted_at":"2025-08-04T07:22:36Z","title":"Amber Pruner: Leveraging N:M Activation Sparsity for Efficient Prefill in Large Language Models","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T05:11:11.642729Z"},"links":{"cited_paper":"/paper/2104.08378","citing_paper":"/paper/2508.02128"},"observation_digest":"sha256:17583452e993b9320ccbbcb48b25d07b2798c684b8edbe23a1d22aef82f0fb40","observation_id":"58187fdc-6144-4711-8372-67817960edb3","resolution":{"observed_at":"2026-08-06T05:11:11.642729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16325","last_updated":"2025-01-25T22:24:04Z","snapshot_observed_at":"2026-08-01T16:02:13.326628Z","submitted_at":"2024-05-25T18:43:05Z","title":"SLoPe: Double-Pruned Sparse Plus Lazy Low-Rank Adapter Pretraining of LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16325","snapshot_observed_at":"2026-08-06T05:11:11.646741Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.02128","last_updated":"2025-08-04T07:22:36Z","snapshot_observed_at":"2026-08-08T06:49:38.643278Z","submitted_at":"2025-08-04T07:22:36Z","title":"Amber Pruner: Leveraging N:M Activation Sparsity for Efficient Prefill in Large Language Models","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T05:11:11.646741Z"},"links":{"cited_paper":"/paper/2405.16325","citing_paper":"/paper/2508.02128"},"observation_digest":"sha256:97db7acb7b72abdb3c1b72315c3bccb6e1174a56b416176c08002ef297d4cc75","observation_id":"dd92140d-b171-44ce-8c9d-0eb824125b5c","resolution":{"observed_at":"2026-08-06T05:11:11.646741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13516","last_updated":"2025-01-07T05:26:54Z","snapshot_observed_at":"2026-08-08T23:26:21.642047Z","submitted_at":"2024-02-21T03:58:49Z","title":"ProSparse: Introducing and Enhancing Intrinsic Activation Sparsity within Large Language Models","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13516","snapshot_observed_at":"2026-08-06T05:11:11.650290Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.02128","last_updated":"2025-08-04T07:22:36Z","snapshot_observed_at":"2026-08-08T06:49:38.643278Z","submitted_at":"2025-08-04T07:22:36Z","title":"Amber Pruner: Leveraging N:M Activation Sparsity for Efficient Prefill in Large Language Models","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T05:11:11.650290Z"},"links":{"cited_paper":"/paper/2402.13516","citing_paper":"/paper/2508.02128"},"observation_digest":"sha256:0a0efafde012c1af8bc3b04f6bf60b93a91a6b8b18878ff8d02210e2467af3a6","observation_id":"9f3f8849-7fbc-4139-a566-a8e02e33c21a","resolution":{"observed_at":"2026-08-06T05:11:11.650290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05955","last_updated":"2024-06-11T02:15:47Z","snapshot_observed_at":"2026-07-06T18:27:54.379381Z","submitted_at":"2024-06-10T01:21:59Z","title":"Turbo Sparse: Achieving LLM SOTA Performance with Minimal Activated Parameters","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05955","snapshot_observed_at":"2026-08-06T05:11:11.654254Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.02128","last_updated":"2025-08-04T07:22:36Z","snapshot_observed_at":"2026-08-08T06:49:38.643278Z","submitted_at":"2025-08-04T07:22:36Z","title":"Amber Pruner: Leveraging N:M Activation Sparsity for Efficient Prefill in Large Language Models","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T05:11:11.654254Z"},"links":{"cited_paper":"/paper/2406.05955","citing_paper":"/paper/2508.02128"},"observation_digest":"sha256:d5c020b4fa43c61aa204b8937c9ad59b053c2d3ae2aaad20a653fb0fcc09a54e","observation_id":"8cd80fb8-f662-4335-b9b1-3b3e636e1bb1","resolution":{"observed_at":"2026-08-06T05:11:11.654254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11695","last_updated":"2024-05-06T17:47:01Z","snapshot_observed_at":"2026-07-06T15:44:42.776459Z","submitted_at":"2023-06-20T17:18:20Z","title":"A Simple and Effective Pruning Approach for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.11695","snapshot_observed_at":"2026-08-06T05:11:11.657689Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.02128","last_updated":"2025-08-04T07:22:36Z","snapshot_observed_at":"2026-08-08T06:49:38.643278Z","submitted_at":"2025-08-04T07:22:36Z","title":"Amber Pruner: Leveraging N:M Activation Sparsity for Efficient Prefill in Large Language Models","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T05:11:11.657689Z"},"links":{"cited_paper":"/paper/2306.11695","citing_paper":"/paper/2508.02128"},"observation_digest":"sha256:45dd68da981165d4c5c27d9a490fd846ca80efb6f8dd14354930853a18958e52","observation_id":"69fb98c4-1057-417c-a0fe-6cf340a82895","resolution":{"observed_at":"2026-08-06T05:11:11.657689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-06T05:11:11.661204Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.02128","last_updated":"2025-08-04T07:22:36Z","snapshot_observed_at":"2026-08-08T06:49:38.643278Z","submitted_at":"2025-08-04T07:22:36Z","title":"Amber Pruner: Leveraging N:M Activation Sparsity for Efficient Prefill in Large Language Models","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T05:11:11.661204Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2508.02128"},"observation_digest":"sha256:b7142bbef347b5e339fb78ffb2df70401df2b3767afcb6cb761ca21e1a2eae25","observation_id":"81fc2f42-d6fc-47ee-a1d4-fe7949f56de9","resolution":{"observed_at":"2026-08-06T05:11:11.661204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1804.07461","last_updated":"2019-02-22T23:53:34Z","snapshot_observed_at":"2026-07-06T06:34:26.609892Z","submitted_at":"2018-04-20T06:35:04Z","title":"GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.07461","snapshot_observed_at":"2026-08-06T05:11:11.666076Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.02128","last_updated":"2025-08-04T07:22:36Z","snapshot_observed_at":"2026-08-08T06:49:38.643278Z","submitted_at":"2025-08-04T07:22:36Z","title":"Amber Pruner: Leveraging N:M Activation Sparsity for Efficient Prefill in Large Language Models","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T05:11:11.666076Z"},"links":{"cited_paper":"/paper/1804.07461","citing_paper":"/paper/2508.02128"},"observation_digest":"sha256:deac04ea92e087c2afe276de8a50cb8f79cd42d40be28d3124ef4b6680438f7e","observation_id":"f38ab2ba-39de-47f2-8465-208aee8fec83","resolution":{"observed_at":"2026-08-06T05:11:11.666076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10969","last_updated":"2024-07-24T14:57:48Z","snapshot_observed_at":"2026-08-06T20:50:27.431298Z","submitted_at":"2024-07-15T17:59:29Z","title":"Q-Sparse: All Large Language Models can be Fully Sparsely-Activated","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10969","snapshot_observed_at":"2026-08-06T05:11:11.670107Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.02128","last_updated":"2025-08-04T07:22:36Z","snapshot_observed_at":"2026-08-08T06:49:38.643278Z","submitted_at":"2025-08-04T07:22:36Z","title":"Amber Pruner: Leveraging N:M Activation Sparsity for Efficient Prefill in Large Language Models","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T05:11:11.670107Z"},"links":{"cited_paper":"/paper/2407.10969","citing_paper":"/paper/2508.02128"},"observation_digest":"sha256:fc094aaeda980204c9e11367b19af585e7c051ad4a7719aac0710653a6b1988b","observation_id":"d50ee72f-5857-4cc9-a87f-a04627505cc0","resolution":{"observed_at":"2026-08-06T05:11:11.670107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:11:12.272878Z","title":null,"venue":null,"work_id":"9bd906f3-93a9-4647-93d9-12d00614faa4","year":2023},"citing_paper":{"arxiv_id":"2508.02128","last_updated":"2025-08-04T07:22:36Z","snapshot_observed_at":"2026-08-08T06:49:38.643278Z","submitted_at":"2025-08-04T07:22:36Z","title":"Amber Pruner: Leveraging N:M Activation Sparsity for Efficient Prefill in Large Language Models","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T05:11:11.674294Z"},"links":{"citing_paper":"/paper/2508.02128"},"observation_digest":"sha256:c5dfecd4fb90eb84a441829e046b99c303b4c598adc6222126202118656211aa","observation_id":"df70ea74-766c-445c-9155-18b38a8cfb14","resolution":{"observed_at":"2026-08-06T05:11:12.277317Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-06T05:11:11.677626Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.02128","last_updated":"2025-08-04T07:22:36Z","snapshot_observed_at":"2026-08-08T06:49:38.643278Z","submitted_at":"2025-08-04T07:22:36Z","title":"Amber Pruner: Leveraging N:M Activation Sparsity for Efficient Prefill in Large Language Models","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T05:11:11.677626Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2508.02128"},"observation_digest":"sha256:e6a484defedd1f24b73a2c8bdc01252c5afff5cfdc8d19614822aa5fa7f138ec","observation_id":"29bb3fc5-a47b-46dc-8cdf-ad3fcbbaa66a","resolution":{"observed_at":"2026-08-06T05:11:11.677626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.17560","last_updated":"2025-07-27T12:52:56Z","snapshot_observed_at":"2026-07-06T20:12:09.120832Z","submitted_at":"2024-12-23T13:28:15Z","title":"GQSA: Group Quantization and Sparsity for Accelerating Large Language Model Inference","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.17560","snapshot_observed_at":"2026-08-06T05:11:11.681322Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.02128","last_updated":"2025-08-04T07:22:36Z","snapshot_observed_at":"2026-08-08T06:49:38.643278Z","submitted_at":"2025-08-04T07:22:36Z","title":"Amber Pruner: Leveraging N:M Activation Sparsity for Efficient Prefill in Large Language Models","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-06T05:11:11.681322Z"},"links":{"cited_paper":"/paper/2412.17560","citing_paper":"/paper/2508.02128"},"observation_digest":"sha256:c27ab4d53883662218be2f52b6339517486defa547ee5be04f527b6d5fd3c1f9","observation_id":"5b210f18-6502-4ac0-82dd-6dcb8119751f","resolution":{"observed_at":"2026-08-06T05:11:11.681322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.13652","last_updated":"2025-05-20T13:06:00Z","snapshot_observed_at":"2026-07-31T17:31:30.624645Z","submitted_at":"2024-09-20T17:02:00Z","title":"OATS: Outlier-Aware Pruning Through Sparse and Low Rank Decomposition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.13652","snapshot_observed_at":"2026-08-06T05:11:11.685207Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.02128","last_updated":"2025-08-04T07:22:36Z","snapshot_observed_at":"2026-08-08T06:49:38.643278Z","submitted_at":"2025-08-04T07:22:36Z","title":"Amber Pruner: Leveraging N:M Activation Sparsity for Efficient Prefill in Large Language Models","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T05:11:11.685207Z"},"links":{"cited_paper":"/paper/2409.13652","citing_paper":"/paper/2508.02128"},"observation_digest":"sha256:ec3609e9f10038f45084eb0f345d52df57b276735e8e2d5a5d20f031b11d050f","observation_id":"c4466d57-885c-4e17-b2e8-adf3d8d70b50","resolution":{"observed_at":"2026-08-06T05:11:11.685207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18218","last_updated":"2024-10-20T09:10:25Z","snapshot_observed_at":"2026-08-06T18:43:32.229808Z","submitted_at":"2024-05-28T14:21:15Z","title":"FinerCut: Finer-grained Interpretable Layer Pruning for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18218","snapshot_observed_at":"2026-08-06T05:11:11.688996Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.02128","last_updated":"2025-08-04T07:22:36Z","snapshot_observed_at":"2026-08-08T06:49:38.643278Z","submitted_at":"2025-08-04T07:22:36Z","title":"Amber Pruner: Leveraging N:M Activation Sparsity for Efficient Prefill in Large Language Models","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-06T05:11:11.688996Z"},"links":{"cited_paper":"/paper/2405.18218","citing_paper":"/paper/2508.02128"},"observation_digest":"sha256:6c4a931a72a7893f722dc1bdde1a73366abd2109231441342bed392a284cd80c","observation_id":"f1fa5052-8aea-446a-8b79-fc94fb105c97","resolution":{"observed_at":"2026-08-06T05:11:11.688996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08915","last_updated":"2024-02-26T02:51:30Z","snapshot_observed_at":"2026-07-06T16:32:23.448967Z","submitted_at":"2023-10-13T07:38:52Z","title":"Dynamic Sparse No Training: Training-Free Fine-tuning for Sparse LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08915","snapshot_observed_at":"2026-08-06T05:11:11.693310Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.02128","last_updated":"2025-08-04T07:22:36Z","snapshot_observed_at":"2026-08-08T06:49:38.643278Z","submitted_at":"2025-08-04T07:22:36Z","title":"Amber Pruner: Leveraging N:M Activation Sparsity for Efficient Prefill in Large Language Models","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-06T05:11:11.693310Z"},"links":{"cited_paper":"/paper/2310.08915","citing_paper":"/paper/2508.02128"},"observation_digest":"sha256:6cd3ae344f39e300b12249ef11a8ab15590a75da9cb73660705e644ed3d53de7","observation_id":"8a5aad82-a7e2-47bc-8c2b-4632188e5680","resolution":{"observed_at":"2026-08-06T05:11:11.693310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:11:12.259933Z","title":null,"venue":null,"work_id":"6f283181-2a9c-465f-b56d-04b66d52b77c","year":2025},"citing_paper":{"arxiv_id":"2508.02128","last_updated":"2025-08-04T07:22:36Z","snapshot_observed_at":"2026-08-08T06:49:38.643278Z","submitted_at":"2025-08-04T07:22:36Z","title":"Amber Pruner: Leveraging N:M Activation Sparsity for Efficient Prefill in Large Language Models","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-06T05:11:11.698820Z"},"links":{"citing_paper":"/paper/2508.02128"},"observation_digest":"sha256:43f7e7957394a97f08519540a2b026e84acdbbe57ed00b8a4ff4c1f781cf9525","observation_id":"916898f9-f702-4652-a5bc-2c8086d1dd4d","resolution":{"observed_at":"2026-08-06T05:11:12.264204Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02924","last_updated":"2024-06-05T04:25:23Z","snapshot_observed_at":"2026-08-09T09:34:57.546210Z","submitted_at":"2024-06-05T04:25:23Z","title":"Pruner-Zero: Evolving Symbolic Pruning Metric from scratch for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02924","snapshot_observed_at":"2026-08-06T05:11:11.706409Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.02128","last_updated":"2025-08-04T07:22:36Z","snapshot_observed_at":"2026-08-08T06:49:38.643278Z","submitted_at":"2025-08-04T07:22:36Z","title":"Amber Pruner: Leveraging N:M Activation Sparsity for Efficient Prefill in Large Language Models","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-06T05:11:11.706409Z"},"links":{"cited_paper":"/paper/2406.02924","citing_paper":"/paper/2508.02128"},"observation_digest":"sha256:d958793e67211073d0731e926946f6d77f48bb91664a987609cf43296b04d29f","observation_id":"5c20c156-e7f4-4329-816b-56e55fc1328a","resolution":{"observed_at":"2026-08-06T05:11:11.706409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.02128","last_updated":"2025-08-04T07:22:36Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T06:49:38.643278Z","submitted_at":"2025-08-04T07:22:36Z","title":"Amber Pruner: Leveraging N:M Activation Sparsity for Efficient Prefill in Large Language Models"},"reference_resolution":{"displayed":52,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":48,"verified_exact":3,"verified_fuzzy":1},"total_outbound_references":52},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 2 inbound Pith citation observations for arXiv:2508.02128."}