Interconnection Network Design Space(互连网络设计空间)

互连网络是多节点系统的通信骨架——系统性能上限往往由节点间通信效率决定,而非单节点算力。Dally & Towles 将设计问题组织为四层强耦合的设计空间。

四层设计空间

┌─────────────────────────────┐
│  应用 / 算法 (Algorithms)   │  ← 流量特征(burst、pattern、size)
├─────────────────────────────┤
│  拓扑 (Topology)            │  ← 物理/逻辑布局
│  路由 (Routing)             │  ← 路径选择
│  流控 (Flow Control)        │  ← 资源分配与缓冲
├─────────────────────────────┤
│  微架构 (Microarchitecture) │  ← 路由器/链路硬件实现
└─────────────────────────────┘

耦合示例(层间不可独立优化):

选择连锁约束
2D Mesh最短路径集受限 → dimension-ordered / Torus 路由
Wormhole 流控需虚通道 (VC) 打破路由死锁环
高基数路由器改变最优拓扑(Fat Tree / Flattened Butterfly 优于 Mesh)

基本术语

术语定义例子
Node通信端点CPU、GPU、Switch、PE
Link两节点间物理连接SerDes、光纤、片上 wire
Port节点上一个方向的物理接口Mesh PE 的上下左右各一 port
Channel链路 + 缓冲区,端到端资源单元一条物理链路上的多条 VC
Message应用层逻辑数据单元AllReduce 一次操作
Packet / Flit / Phit网络层 / 流控层 / 物理层细分单元见 NoC Router 微架构

三大应用域

域典型规模优化目标代表系统
处理器互连8–100k 节点延迟 + 吞吐量InfiniBand Fat Tree、HPC Torus
I/O 互连数百–数千可靠性 + 延迟Fibre Channel、SAS
片上互连 (NoC)4–1000+ 节点面积 + 功耗 + 延迟Cerebras WSE Mesh(Mesh and Torus Topology)、Linear and Ring Topology(TileLink Ring)

拓扑选择约束:全连接不可制造。WSE-3 为 ~949×949 2D Mesh(度=4,直径≈1896,B_b≈949 条链路)——详见 Interconnection Topology Metrics 与 Interconnection Network Cost Model。

Mesh vs Fat Tree 的域差异

NoC / HPC 机柜数据中心 scale-out
约束端口数、片上面积、布线密度机架规模、bisection BW、成本
常见拓扑Mesh、Torus、k-ary n-cubeClos and Fat-Tree Topology、CLOS(见 Switching Networks)
原因固定端口预算下 Mesh 可单片实现高基数交换 + 多级结构提供可扩展 bisection BW

性能瓶颈三视角

互连成为系统瓶颈时,可从三方面诊断:

  1. 物理上限:光速传播、SerDes 功耗、pin 密度
  2. 拓扑上限:bisection bandwidth、热点、contention(见 WSE Performance Model)
  3. 协议开销:序列化延迟、包头、流控 bubble

相关页面

2026-09 增量

  • HDA-MoE:3D NMP 上 Mesh/Torus/Fat-tree 的 Link Balance 放置,把专家映射算进 NoC 占用。
  • WaferTrans:晶圆 scale-up 域的 地址翻译控制面(PPD),与数据面带宽分账。

书 Ch.6–7:应用流量如何选拓扑(2026-09)

Ch.6 把 Dally 四层接到 LLM 流量:同一组 6 端口/卡,维序 AllReduce 下环面与交换网打平;均匀 All-to-All(MoE dispatch)环面按平均跳数摊带宽,64 卡约 3× 慢、512 卡 6×。选择依据:规则集体 vs 任意小消息、协作域卡数、是否愿用交换硅换等距。

Ch.7 补 scale-out 三模型:割集 (T=V/B)、在途 (N\ge\lceil BT/m\rceil)、关键路径从数据就绪起。算法改的是哪段出口的字节,不是「总发送量」。rail 对齐、超售 (f\le1/r)、ECMP 冲突与 incast 反馈距离都是设计空间里的可算旋钮。对照 超节点。

MeshKV:KV 流量类驱动 VC/路由分区(2026-09-21)

MeshKV 把 decode KV 拆成 KV_FETCH / KV_DATA 多播与 PART 单播两类,分到 VN1/VN0,用 Turn Model 限制转弯;相对只加 express 边的 Budgeted Express-Mesh,旋钮是 流量类与多播,不是拓扑边预算。

Flux:设计空间的时间维——何时重配置(2026-09-25)

Flux 把应用层训练依赖图直接约束拓扑时间表:重配置延迟 τ 成为一等参数(1 μs–1 ms)。相对只选静态拓扑或周期轮转,它展示「有用电路 + 与计算重叠」比单纯减少重配置次数更重要。

MCM GPU:网络可扩展性压过算力密度(2026-10-06)

Divide and Conquer: MCM GPUs 用 GPGPU-Sim+BookSim 系统扫 scale-out/scale-up/hybrid × Ring/Mesh/Torus/Flattened Butterfly:4-chiplet ring 下 SM 8× 仅换来 1.23×;Ring 在 16/64 chiplet 跌破单片 50%/10%;16-chiplet Torus(256 SM)相对同算力 SOTA MCM 性能 2.40×、能耗 −4.45×;64-chiplet 非 ring 配置以 1/2–1/4 算力反超 16-chiplet 1024 SM(最高 1.39×/2×)。结论:拓扑(端口数/平均距离)是 chiplet 化 GPU 的一阶设计变量。

Citations

[1] interconn-study-21d-day-01.md — Dally & Towles Ch.1(Day 1) [2] interconn-study-21d-day-03.md — Ch.3.1–3.2(Day 3) [3] interconn-study-21d-day-04.md — Ch.3.3–3.5(Day 4) [4] interconn-study-21d-day-05.md — Ch.3 线性/Ring(Day 5) [5] interconn-study-21d-day-06.md — Ch.3 Mesh/Torus(Day 6) [6] interconn-study-21d-day-07.md — Ch.3 间接网络(Day 7) [7] interconn-study-21d-day-08.md — Ch.3 Butterfly/MIN(Day 8) [8] interconn-study-21d-day-09.md — Ch.3 拓扑变体(Day 9) [9] interconn-study-21d-day-10.md — Ch.3 综合(Day 10) [10] interconn-study-21d-day-11.md — Ch.4–5 Routing(Day 11) [11] interconn-study-21d-day-12.md — Ch.6–7 Adaptive(Day 12) [12] interconn-study-21d-day-13.md — Ch.8.1–8.4 CDG/Dally(Day 13) [13] interconn-study-21d-day-14.md — Ch.8.5–8.8 Duato(Day 14) [14] interconn-study-21d-day-15.md — Ch.9 Flow Control(Day 15) [15] interconn-study-21d-day-16.md — Ch.10 Virtual Channels(Day 16) [16] interconn-study-21d-day-17.md — Ch.11–12 Pipeline/Allocators(Day 17) [17] interconn-study-21d-day-18.md — Ch.12–13 Optimizations(Day 18) [18] interconn-study-21d-day-19.md — Ch.13–14 NI / System(Day 19) [19] interconn-study-21d-day-20.md — NoC 论文与案例(Day 20) [20] interconn-study-21d-day-21.md — 21 天知识地图(Day 21) [21] LEAP_IMC_NoC_LLM_Inference_2026.pdf — LEAP INC mesh [22] Fengshui_Chiplet_Ecosystem_BASIC_Codesign_2026.pdf — Fengshui chiplet 生态 [23] SAGE_Semantic_Aware_Geographic_Error_Recovery_AI_2026.pdf — SAGE 语义错误恢复 [24] Ch.6–7 — 李博杰《AI Infra》 [25] AI-Infra-Book.pdf [26] arXiv:2609.19207 — MeshKV [27] arXiv:2609.25949 — Flux OCS scheduling [28] arXiv:2610.03061 — MCM GPU Divide and Conquer