An efficient training algorithm for models with block-wise sparsity

· 2025 · arXiv 2503.21928

1 Pith paper cite this work. Polarity classification is still indexing.

1 Pith paper citing it

representative citing papers

AsyncSparse: Accelerating Sparse Matrix-Matrix Multiplication on Asynchronous GPU Architectures

cs.DC · 2026-04-20 · unverdicted · novelty 7.0

AsyncSparse presents BCSR and WCSR kernels that use TMA and warp specialization to accelerate SpMM, outperforming prior libraries by 1.47-6.24x on SuiteSparse and achieving 2.66x end-to-end speedup on Qwen2.5-7B at 90% block sparsity.

citing papers explorer

Showing 1 of 1 citing paper.

AsyncSparse: Accelerating Sparse Matrix-Matrix Multiplication on Asynchronous GPU Architectures cs.DC · 2026-04-20 · unverdicted · none · ref 43
AsyncSparse presents BCSR and WCSR kernels that use TMA and warp specialization to accelerate SpMM, outperforming prior libraries by 1.47-6.24x on SuiteSparse and achieving 2.66x end-to-end speedup on Qwen2.5-7B at 90% block sparsity.

An efficient training algorithm for models with block-wise sparsity

fields

years

verdicts

representative citing papers

citing papers explorer