EMA: Elastic and Performance Transparent Memory Across GPUs

一句话结论

同机 GPU 通过 Elastic Address Space 互借/回收 HBM:借方预取使远端接近本地;贷方可即时收回。相对静态分区吞吐最高 +52%,并达到 2× 物理容量静态供给吞吐的 96%,延迟接近本地基线。

动机

  • LLM 推理 KV/权重使单卡 HBM 突发打满,邻卡却可能空闲;云实例绑定后容量搁浅。
  • 需要同时满足:借方透明(远端≈本地)与 贷方安全(回收后不低于静态分区)。

方案

  1. EAS:把可借容量并入统一地址抽象;容量不保证永久,但访问路径统一。
  2. 预取:按 layer-group / slab 提前拉远端数据,掩盖 NVLink 延迟。
  3. 回收:贷方按需 reclaim,借方释放对应份额。
  4. 评测:A100 等多卡;LLaMA/OPT;NVLink 双向最高约 600 GB/s(文中 A100 设定)。

效果(仅论文数字)

指标数字
吞吐 vs 静态分区最高 +52%
vs 2× 容量静态供给达到其吞吐的 96%
延迟与静态本地基线相近(摘要)
地址空间EAS 可将可用空间扩至约 2× 本地 HBM

与 wiki 的关系

Citations

[1] arXiv PDF — Xu, Xia, Stoica, arXiv:2609.27040 [2] raw stub