Interconnection Network Design Space(互连网络设计空间)
互连网络是多节点系统的通信骨架——系统性能上限往往由节点间通信效率决定,而非单节点算力。Dally & Towles 将设计问题组织为四层强耦合的设计空间。
四层设计空间
┌─────────────────────────────┐
│ 应用 / 算法 (Algorithms) │ ← 流量特征(burst、pattern、size)
├─────────────────────────────┤
│ 拓扑 (Topology) │ ← 物理/逻辑布局
│ 路由 (Routing) │ ← 路径选择
│ 流控 (Flow Control) │ ← 资源分配与缓冲
├─────────────────────────────┤
│ 微架构 (Microarchitecture) │ ← 路由器/链路硬件实现
└─────────────────────────────┘
耦合示例(层间不可独立优化):
| 选择 | 连锁约束 |
|---|---|
| 2D Mesh | 最短路径集受限 → dimension-ordered / Torus 路由 |
| Wormhole 流控 | 需虚通道 (VC) 打破路由死锁环 |
| 高基数路由器 | 改变最优拓扑(Fat Tree / Flattened Butterfly 优于 Mesh) |
基本术语
| 术语 | 定义 | 例子 |
|---|---|---|
| Node | 通信端点 | CPU、GPU、Switch、PE |
| Link | 两节点间物理连接 | SerDes、光纤、片上 wire |
| Port | 节点上一个方向的物理接口 | Mesh PE 的上下左右各一 port |
| Channel | 链路 + 缓冲区,端到端资源单元 | 一条物理链路上的多条 VC |
| Message | 应用层逻辑数据单元 | AllReduce 一次操作 |
| Packet / Flit / Phit | 网络层 / 流控层 / 物理层细分单元 | 见 NoC Router 微架构 |
三大应用域
| 域 | 典型规模 | 优化目标 | 代表系统 |
|---|---|---|---|
| 处理器互连 | 8–100k 节点 | 延迟 + 吞吐量 | InfiniBand Fat Tree、HPC Torus |
| I/O 互连 | 数百–数千 | 可靠性 + 延迟 | Fibre Channel、SAS |
| 片上互连 (NoC) | 4–1000+ 节点 | 面积 + 功耗 + 延迟 | Cerebras WSE Mesh(Mesh and Torus Topology)、Linear and Ring Topology(TileLink Ring) |
拓扑选择约束:全连接不可制造。WSE-3 为 ~949×949 2D Mesh(度=4,直径≈1896,B_b≈949 条链路)——详见 Interconnection Topology Metrics 与 Interconnection Network Cost Model。
Mesh vs Fat Tree 的域差异
| NoC / HPC 机柜 | 数据中心 scale-out | |
|---|---|---|
| 约束 | 端口数、片上面积、布线密度 | 机架规模、bisection BW、成本 |
| 常见拓扑 | Mesh、Torus、k-ary n-cube | Clos and Fat-Tree Topology、CLOS(见 Switching Networks) |
| 原因 | 固定端口预算下 Mesh 可单片实现 | 高基数交换 + 多级结构提供可扩展 bisection BW |
性能瓶颈三视角
互连成为系统瓶颈时,可从三方面诊断:
- 物理上限:光速传播、SerDes 功耗、pin 密度
- 拓扑上限:bisection bandwidth、热点、contention(见 WSE Performance Model)
- 协议开销:序列化延迟、包头、流控 bubble
相关页面
- Interconnection Topology Metrics — 度/直径/二分带宽
- Clos and Fat-Tree Topology — Clos 定理与 Fat-Tree 代价等价
- Mesh and Torus Topology — 2-D Mesh/Torus 与 k-ary n-cube
- Linear and Ring Topology — 1-D 基线拓扑
- Interconnection Network Cost Model — 延迟与成本公式
- Switching Principles — 电路/分组/虫孔交换演进
- Interconnection Network Protocol Stack — 物理→传输四层接口
- NoC Router 微架构 — 微架构层实现
- Cerebras WSE — 晶圆级 Mesh NoC 实例
- Multi-plane Clos Topology for AI Training — 数据中心 Fat Tree 变体
- Butterfly and MIN Topology — 自路由 MIN(Day 8)
- Topology Optimization Variants — Folding/CMesh/Express(Day 9)
- Deterministic Routing and DOR — 确定性路由 / XY / e-cube(Day 11)
- Adaptive Routing for NoC — 拥塞感知 / VRR(Day 12)
- Deadlock-Free Routing CDG and Dally Theorem — CDG / Dally 定理(Day 13)
- Duato Escape VC Deadlock-Free Routing — Duato / 逃逸 VC(Day 14)
- Flow Control Fundamentals — 流控基础 / Flit / HoL(Day 15)
- Æthereal NoC — contention-free TDM GS(IEEE MDT 2005)
- Virtual Channel Flow Control — VC + Credit(Day 16)
- NoC Router Pipeline and Allocators — 五级流水 + 分配器(Day 17)
- NoC Router Pipeline Optimizations — Speculative / look-ahead / CMesh(Day 18)
- Network Interface and System-Level Design — NI / E2E / 拥塞控制(Day 19)
- NoC Research Methodology and Case Studies — 论文反推与 Polaris/WSE(Day 20)
- Interconn-Study 21d Knowledge Map — 21 天收束(Day 21)
- Post-Moore Architecture Frontiers — 光互连 / 可重构 / demand-aware NoC(Day 29)
- HYDRA — 封装内 NoI mesh:hybrid serving 轨迹倒逼组成/放置/D2D 带宽,不是先定 mesh 再灌合成流
- CHIPSMORE — IPCN 2D mesh 带 in-network DMAC(compute-in-interconnect);UCIe 利用率 <25%,瓶颈不在 Inter-CT
- LEAP — mesh + IRCU INC;确定性 Broadcast/Reduce/AllGather 服务 LLM 分区数据流
- Fengshui — chiplet 池×BASIC 联合;算子级 die 组成进入封装/互连协同设计
- SAGE — 可靠性从比特正确扩展到数值语义可接受
2026-09 增量
- HDA-MoE:3D NMP 上 Mesh/Torus/Fat-tree 的 Link Balance 放置,把专家映射算进 NoC 占用。
- WaferTrans:晶圆 scale-up 域的 地址翻译控制面(PPD),与数据面带宽分账。
书 Ch.6–7:应用流量如何选拓扑(2026-09)
Ch.6 把 Dally 四层接到 LLM 流量:同一组 6 端口/卡,维序 AllReduce 下环面与交换网打平;均匀 All-to-All(MoE dispatch)环面按平均跳数摊带宽,64 卡约 3× 慢、512 卡 6×。选择依据:规则集体 vs 任意小消息、协作域卡数、是否愿用交换硅换等距。
Ch.7 补 scale-out 三模型:割集 (T=V/B)、在途 (N\ge\lceil BT/m\rceil)、关键路径从数据就绪起。算法改的是哪段出口的字节,不是「总发送量」。rail 对齐、超售 (f\le1/r)、ECMP 冲突与 incast 反馈距离都是设计空间里的可算旋钮。对照 超节点。
MeshKV:KV 流量类驱动 VC/路由分区(2026-09-21)
MeshKV 把 decode KV 拆成 KV_FETCH / KV_DATA 多播与 PART 单播两类,分到 VN1/VN0,用 Turn Model 限制转弯;相对只加 express 边的 Budgeted Express-Mesh,旋钮是 流量类与多播,不是拓扑边预算。
Flux:设计空间的时间维——何时重配置(2026-09-25)
Flux 把应用层训练依赖图直接约束拓扑时间表:重配置延迟 τ 成为一等参数(1 μs–1 ms)。相对只选静态拓扑或周期轮转,它展示「有用电路 + 与计算重叠」比单纯减少重配置次数更重要。
MCM GPU:网络可扩展性压过算力密度(2026-10-06)
Divide and Conquer: MCM GPUs 用 GPGPU-Sim+BookSim 系统扫 scale-out/scale-up/hybrid × Ring/Mesh/Torus/Flattened Butterfly:4-chiplet ring 下 SM 8× 仅换来 1.23×;Ring 在 16/64 chiplet 跌破单片 50%/10%;16-chiplet Torus(256 SM)相对同算力 SOTA MCM 性能 2.40×、能耗 −4.45×;64-chiplet 非 ring 配置以 1/2–1/4 算力反超 16-chiplet 1024 SM(最高 1.39×/2×)。结论:拓扑(端口数/平均距离)是 chiplet 化 GPU 的一阶设计变量。
Citations
[1] interconn-study-21d-day-01.md — Dally & Towles Ch.1(Day 1) [2] interconn-study-21d-day-03.md — Ch.3.1–3.2(Day 3) [3] interconn-study-21d-day-04.md — Ch.3.3–3.5(Day 4) [4] interconn-study-21d-day-05.md — Ch.3 线性/Ring(Day 5) [5] interconn-study-21d-day-06.md — Ch.3 Mesh/Torus(Day 6) [6] interconn-study-21d-day-07.md — Ch.3 间接网络(Day 7) [7] interconn-study-21d-day-08.md — Ch.3 Butterfly/MIN(Day 8) [8] interconn-study-21d-day-09.md — Ch.3 拓扑变体(Day 9) [9] interconn-study-21d-day-10.md — Ch.3 综合(Day 10) [10] interconn-study-21d-day-11.md — Ch.4–5 Routing(Day 11) [11] interconn-study-21d-day-12.md — Ch.6–7 Adaptive(Day 12) [12] interconn-study-21d-day-13.md — Ch.8.1–8.4 CDG/Dally(Day 13) [13] interconn-study-21d-day-14.md — Ch.8.5–8.8 Duato(Day 14) [14] interconn-study-21d-day-15.md — Ch.9 Flow Control(Day 15) [15] interconn-study-21d-day-16.md — Ch.10 Virtual Channels(Day 16) [16] interconn-study-21d-day-17.md — Ch.11–12 Pipeline/Allocators(Day 17) [17] interconn-study-21d-day-18.md — Ch.12–13 Optimizations(Day 18) [18] interconn-study-21d-day-19.md — Ch.13–14 NI / System(Day 19) [19] interconn-study-21d-day-20.md — NoC 论文与案例(Day 20) [20] interconn-study-21d-day-21.md — 21 天知识地图(Day 21) [21] LEAP_IMC_NoC_LLM_Inference_2026.pdf — LEAP INC mesh [22] Fengshui_Chiplet_Ecosystem_BASIC_Codesign_2026.pdf — Fengshui chiplet 生态 [23] SAGE_Semantic_Aware_Geographic_Error_Recovery_AI_2026.pdf — SAGE 语义错误恢复 [24] Ch.6–7 — 李博杰《AI Infra》 [25] AI-Infra-Book.pdf [26] arXiv:2609.19207 — MeshKV [27] arXiv:2609.25949 — Flux OCS scheduling [28] arXiv:2610.03061 — MCM GPU Divide and Conquer