AFORE:AFD 流水窗口里”预知 + 重叠”的专家重配置

一句话结论

Attention–FFN 解耦(AFD)把 FFN 变成独立流水级后,热专家直接卡住整条流水。AFORE 发现 AFD 天然提供两样东西:① 下一微批的 expert-token 分布在进入 FFN 前就已知(不用猜历史);② 前面在飞微批的计算构成迁移窗口。于是用”按目标微批真实需求挑副本 + NVLink GPU-GPU 拷贝重叠”做微批级重配:相对最强基线吞吐 +10.1–17.6%、P95 ITL −7.1–9.5%;相对静态放置吞吐平均 +29.8%、P95 ITL 平均 −18.2%;迁移延迟被 完全隐藏。

动机

  • top-8 路由下一个 AFD 窗口内热专家 max/mean 5.2×;静态放置时 8 个 EP worker 最忙者达平均 2.5×;ShareGPT 最不均层 3.3×。
  • 合成偏斜路由:单体 attention-FFN 执行吞吐 −11.9%,AFD 下 −20.1%——AFD 放大了不均。
  • 动机实验(16×A100,PD+AFD:4 prefill / 4 attention / 8 FFN,EP=8):静态不均比 1.70×;历史重配 → 1.42×(吞吐 +4.5%);加 demand prefetch → 1.10×(再 +7.1%);再加迁移重叠 → 暴露等待 0.461 / 0.437 → 0.000 ms、再 +16.4%;合计 vs Static 吞吐 +30.3%、P95 ITL −17.8%。

方案

  1. 微批感知调度问题:主副本 + 冗余副本布局;迁移感知代价模型只在”FFN 瓶颈收益 > 关键路径暴露迁移”时触发;贪心负载再分配。
  2. Demand prefetch:attention worker 把目标微批路由导出的紧凑向量直接发给调度器。
  3. 重叠迁移:一旦目标需求可得即发起 NVLink p2p 专家权重拷贝,与前序微批 FFN 计算重叠;在微批边界原子切换路由,不打断在飞执行(attention↔FFN 回传走 StepMesh)。

效果(仅论文数字)

指标数字
平台2 节点 × 8 A100;NVLink/NVSwitch 300 GB/s/GPU 单向;每节点 8 个 RDMA bond,各 50 GB/s
模型 / 负载GLM-4.5-Air 110B,PD+AFD;ShareGPT / FineWeb / CodeForces / GSM8K 回放
vs 最强基线(EPLB / HarMoEny / Lina / Libra 中最强)吞吐 +10.1–17.6%,P95 ITL −7.1–9.5%
vs Static吞吐 +26.0–34.1%(平均 29.8%),P95 ITL −16.7–19.6%(平均 18.2%)
去掉 prefetch吞吐 −12.4–17.9%,P95 ITL +6.3–10.5%
去掉重叠吞吐 −15.2–21.3%,P95 ITL +12.2–16.0%
迁移成本 vs 窗口原始迁移 0.453–0.495 ms vs 前瞻窗口 2.008–2.119 ms;324/324 样本 0 暴露;剩余余量中位 1.459–1.668 ms,最小 0.447 ms
调度器中位 8.23 µs(EP=2)→ 245.81 µs(EP=128);1,400 目标中 99.5% 达最优,EP≥8 全最优

与 wiki 的关系

  • Disaggregated Inference — AFD 的副作用(FFN 级被热专家拖慢)与对应解法
  • MegaScale-Infer — AFD/M2N 原型;AFORE 在其上补”动态专家重配”
  • M2N Communication — attention↔FFN 的 M:N 通信路径
  • MegaFlux — 同是热专家复制,MegaFlux 在 megakernel 内、AFORE 在 AFD 流水级间
  • RailWave — 上层改需求(AFORE)与下层改执行(RailWave)互补

局限与开放问题

  • 只在 A100、16 GPU、单一 110B 模型上评测;Hopper/Blackwell + 更大 EP 与 NVL72 级 scale-up 域下迁移窗口是否仍充裕?
  • 副本显存开销与 KV 预算的权衡未充分量化。
  • AFD 的微批前瞻窗口约 2 ms;若 attention 侧更快(短上下文)窗口收窄,隐藏是否失效?

Citations

[1] arXiv PDF — Li et al., arXiv:2610.03203 [2] raw stub