SPIMOE: 推理 MoE 的异构 PIM 混合稀疏协同

一句话结论

把长推理 MoE 的 Attention / Expert-FFN 拆到 SRAM-PIM + HBM-PIM,并用自适应专家路由、block-sparse attention 与物理 KV 淘汰做混合稀疏;相对 A100 端到端最高 8.35×,MoE FFN 相对 PIMoE 最高 3.33×(ICCAD ’26)。

动机

  • CoT 长推理使负载从 FFN 主导转向 attention / KV 主导;MoE 动态路由又带来不规则专家访问。
  • 既有 PIM 工作多单独优化 MoE 或 attention,缺 Attention–FFN 解耦 + 推理感知稀疏 的端到端协同。

对照 CARDAN、Weave、End-to-End Memory Data Path、DNN Accelerator Systolic Dataflow。

方案

  1. 算法:自适应专家路由(含 cognitive expert boost / phase-depth 剪枝);block-sparse attention;按 last-used 的物理 KV block 淘汰。
  2. 硬件:32× SRAM-PIM 核(Attention,800 MHz)+ 4× HBM-PIM 模块(QKV/FFN,bank PU 400 MHz);2.5D interposer;4×8 NoC mesh(256-bit/flit @800 MHz)。
  3. 映射:静态专家映射(共激活 clique)+ 动态子批调度,使 Attention 与 MoE 路径流水重叠。
  4. 评测:Qwen3-30B-A3B、Phi-mini-MoE-instruct;基线 A100-80GB 与 PIMoE;系统级仿真(含扩展 DRAMsim3 / 12 nm 综合)。

效果(仅论文数字)

指标数字
端到端 vs A100(b=8, seq=256)Qwen3-30B-A3B 8.35×;Phi-mini-MoE 7.08×
端到端 vs A100(seq length 2K,摘要/贡献)最高 6.27×
MoE FFN vs PIMoE最高 3.33×(Switch-Large-128 上随配置 3.33×–2.03×)
精度摘要:推理精度与 full-attention 基线可比

与 wiki 的关系

Citations

[1] arXiv PDF — Yang et al., ICCAD ’26, arXiv:2609.34612 [2] raw stub