Trillion-Parameter MoE in a Box: Decoupling Memory Provisioning with High-Bandwidth Flash

Authors: Pengfei Xia, Tuo Hao, Shengwei Li, Jinjing Chen, Shiru Wei, Wenjun Zou, Rui Zhang, Hui Zang Affiliation: Huawei Technologies Co., Ltd. arXiv: 2609.15636(2026-09-14,cs.AR) PDF: arXiv PDF

相对 FLINT / DASH 做 HBF 路径与 FTL,本文回答 权重已在 HBF 之后 的供给问题:状态 DRAM 要多少带宽/容量比?host 暴露是否必须跟 HBF 内部带宽同比?

动机

数据中心常用 continuous batching + PD 解耦摊销驻留;本文转向 低并发(约 1–8)万亿 MoE 一体机:整模驻一节点,冷/热 prefill、投机校验与 decode 共享固定资源。量化权重达 TB(DSV4-Pro 865 GB、Kimi-K3 1560 GB),HBM-only 难做紧凑节点。HBF 适配合读权重;一旦权重迁出,DRAM 不再随模型规模涨,而 HBF 包数随容量涨时「全暴露」会让 host I/O 跟着模型规模跑。

方案

设计空间覆盖 HBF×DRAM(HBM3e / SOCAMM2 / LPCAMM2)、暴露比 η_exp=B_ext/B_int(按 96 GB/s host-link quanta)、可选 HBF 上 FP8 near-data 引擎。工作负载含实测专家路由与 多轮 agentic traces。结论强调两个 正交膝点:状态带宽 vs HBF 传输。

效果(仅论文数字)

  • Q1:256-GB 状态层地板上,两模型达 1.10× 完成时间目标只需带宽/容量比 1.4–4.0 s⁻¹(Kimi-K3 1.4 / DSV4-Pro 4.0),相对 HBM3e 33.3 s⁻¹ 约 8×–24× 放松。LPCAMM2×8(512 GB、1.09 TB/s)可达 DSV4-Pro 目标;同容量若干 SOCAMM/LPCAMM 配置仍在线外。
  • Q2:HBF×6 每包暴露 384 GB/s,聚合 2.30 TB/s,比全暴露参考 6.14 TB/s 低 62.5%,仍可落在约 10% 性能窗;更多包可在同目标下降低每包所需 host 带宽。
  • 状态膝点约在 0.6–1.2 TB/s(DSV4-Pro)与 0.4–0.6 TB/s(Kimi-K3)量级(Trace A);越过膝点后再加该维带宽收益扁平。

口径提醒: 分析/仿真供给膝点,非商用一体机实测 tok/s;模型规格取自文内 Table 1。

与 wiki 的关系

开放问题

  1. 膝点对更宽投机草稿长度 / 更高并发是否漂移。
  2. near-data FP8 引擎对低用专家的增益未成主结果数字。
  3. 与 FLINT/DASH 路径栈如何联合闭式供给。

Citations

[1] arXiv PDF — Xia et al., arXiv:2609.15636 [2] trillion-param-moe-hbf-memory-provisioning.md — 结构化摘录