DynaX: Dynamic X:M Sparse Attention Acceleration
Authors: Xiao Xiong, Zhaorui Chen, et al. | Affiliation: Chongqing University | PDF: DynaX_Sparse_Attention_Dynamic_XM_Pruning_2025.pdf
一句话总结
DynaX 用 dynamic X:M 两步结构化剪枝 + block scheduling 匹配 PEA,在长序列 attention 上达 89–92% 稀疏度且精度损失 <1%,BERT-base 相对 Sanger 1.99× 加速、5.16× 能效。
核心贡献
- Dynamic X:M pruning:每组动态选 X 个重要 score(非固定 N:M),降低 prediction 内存开销
- 2-step 剪枝流程:低比特 Q/K 预计算 → N:M → X:N,兼顾稀疏度与规则性
- Block scheduling:score block 重组对齐 SDDMM/SpMM 的 PEA 粒度
- Algorithm-hardware co-design:专用模块流水线实现各优化步骤
- 长序列瓶颈定位:attention 占 BERT/ViT 总算力 47–93%
关键数字
| 设置 | 结果 |
|---|---|
| Sparsity (short / long seq) | 89.54% / 91.77% |
| Accuracy loss | <1% |
| Speedup vs Sanger / SALO2 (BERT) | 1.99× / 1.50× |
| Energy vs Sanger / SALO2 | 5.16× / 4.20× |
| vs GPU (accelerator) | 35.14× speedup; 299.23× energy efficiency |
| Accelerator efficiency | 25.55 TOPS/W avg |
与 wiki 交叉引用
- FlashAttention — IO-aware dense attention 基线
- FlashAttention-2 — 长序列 attention kernel 优化
- FlashAttention-3 — 低精度/async attention 演进
- Prefill Decode Divergence — 长上下文 prefill attention 成本
- GEMM vs GEMV — attention SDDMM/SpMM 算子强度
Citations
[1] DynaX_Sparse_Attention_Dynamic_XM_Pruning_2025.pdf — Xiong et al. (ASPLOS ‘25) [2] dynax-sparse-attention-acceleration.md — 结构化摘录