Optimizing the Parallelism of Communication and Computation in Distributed Training Platform

ICA3PP 2023 (LNCS 14487) | DOI 10.1007/978-981-97-0834-5_20
Hou, Yuan, Ma, Xu, Wang, et al.(国防科技大学)

hierarchical Torus-Ring 分布式训练平台上,通过调度重叠计算与 collective 通信,分别削减 data parallelism 的通信暴露和 model parallelism 的计算暴露

核心贡献

  1. Data parallelism:weight-gradient Ring AllReduce 与 activation 计算并行
  2. Model parallelism:activation AllGather 与 weight-gradient 计算并行
  3. 基于 Ring All-Reduce 的通信-计算联合调度

关键数字

模型训练加速(5 iter)
ResNet50+23.77–25.64%
Transformer+11.66–12.83%

与 wiki 交叉

Citations

[1] Optimizing_Comm_Comp_Parallelism_Distributed_Training_2024.pdf [2] optimizing-comm-comp-parallelism-training.md — 结构化摘录