HAPMoE:MoE × 异构集群的自动并行

一句话结论

同时面对 MoE 动态路由/All-to-All 与 异构加速器集群,HAPMoE 用轻量 MoE 代价模型在 六维 并行空间搜索,计划可直接落 Megatron-LM;e2e 训练吞吐相对基线最高 3.2×,非均匀 pipeline 再最高 +78%,搜索 <1 分钟。

动机

  • 自动并行要么做稠密+异构、要么做 MoE+同构,很少同时覆盖 EP/TPE 与设备带宽不对称。
  • MoE 的 dispatch/combine 与专家负载不均,使异构上的代价预测与稳定缩放更难。

对照 LLM Distributed Training Collectives、Mixture-of-Kittens、Heterogeneous Inference。

方案

  1. 轻量 profiling + MoE-aware 代价模型。
  2. 六维并行空间搜索(含非均匀 pipeline 与 EP 相关维),剪枝增强动态规划。
  3. 输出:可部署到 Megatron-LM 的混合并行计划。

效果(仅论文数字)

指标数字
e2e 训练吞吐 vs 基线(异构集群)最高 3.2×
非均匀 pipeline 附加收益最高 +78%
搜索时间<1 分钟

与 wiki 的关系

Citations

[1] arXiv PDF — Fan et al., arXiv:2609.39350 [2] raw stub