NVLink / NVSwitch Scale-Up Fabric
NVIDIA Hopper / Blackwell 白皮书与 GTC 材料。paper-deepdive Day 8:paper-deepdive-day-08.md。摘要:nvidia-nvlink-hopper-blackwell.md。
哲学(相对 TPU v4 OCS):Topology is fixed (fat-tree);把每链路带宽做胖,使运行时换拓扑不必要。
关键数字(白皮书/笔记)
| 代际 | 每 GPU NVLink 双向带宽 | 备注 |
|---|---|---|
| Hopper NVLink 4 | ~900 GB/s | H100 |
| Blackwell NVLink 5 | ~1.8 TB/s | 2× Hopper |
| NVL72 | 72 GPU 单域 | ~18 NVSwitch tray;聚合带宽笔记称 ~130 TB/s/rack 量级 |
| Rubin NVLink 6(HC2026) | 3.6 TB/s per GPU all-to-all | 72 GPU;Counted Write;130 TFLOPS in-network |
| NVSwitch Gen4(笔记) | 高基数 ASIC(数百 port 级) | Clos/fat-tree 中枢 |
工艺:H100 ~80B 管;B200 笔记称 ~208B(双 die 等)。实体延伸:Nvidia Vera Rubin NVL72、Kyber Rack。
Hot Chips 2026:Fusion 教程 给 NVL72 机柜几何(9×4 NVLink 6 switch,28.8 TB/s/tray,900 GB/s C2C,CHI)。Rubin GPU 补协议:Counted Write 替换 MEMBAR+atomic;相对 Ethernet 3× 延迟、10× packet rate、130 TFLOPS in-network。同日对照 Helios UALoE(以太网 load-store,1.8 TB/s/dir)。TPU 8 仍走 OCS/Boardfly,不是 fat-tree。
Photonic Prefill(arXiv:2609.01821)把电学 72-GPU 铜域当作 MoE prefill 的硬边界:跨 rack 后走慢 scale-out,光学配对给出 4× SU 带宽与最大 1152 GPU 全光 pod;B300 FP4 上 128K@288 ~2.9×、生产平台跨边界 2.2–4.5×(分析模型,非实测光子)。
Synchronization Tax(Cornell, arXiv:2608.22503)指出第二条趋势和第一条打架:集体墙钟里有一段 与 B 无关 的 barrier 等待 τ。8-GPU 域可占通信时间 >50%;EVT 下最优带宽随域规模 下降(512 vs 8 GPU 为 2.06× 更低 B*)。论文 Table 1 口径 NVLink GB/s/GPU:A100 300 / H100·H200 450 / B200 900,域 8→72——与上表双向 ~900 GB/s(Hopper)不要混用。
两条 scale-up 哲学
| Google TPU v4 | NVIDIA NVLink | |
|---|---|---|
| 拓扑 | OCS 可重构 | 固定 fat-tree |
| 每芯片链路 | 相对薄 | 极胖(~6× ICI 叙事) |
| 域规模 | Pod 4096 chip | NVL72 72 GPU |
| 交换 | 光电路(慢切换、低 pJ/bit) | 高基数 packet switch |
| 理论祖先 | Day 4/6「拓扑是旋钮」 | Day 6 high-radix Clos 工业极致 |
与 NoC 经典的连接
- Fat-tree / Clos:Clos and Fat-Tree、High-Radix Clos Adaptive Routing
- VC + credit:Virtual Channel Flow Control
- 集体通信直径 O(log N) vs Mesh O(√N):LLM Distributed Training Collectives
WSE 路径第三极:单晶圆 Mesh,无 NVSwitch/OCS——见 Cerebras WSE。
相关页面
- TPU v4 OCS Reconfigurable Fabric
- Nvidia Vera Rubin NVL72
- UnifiedBus UB — 另一 scale-up 协议栈
- Multi-plane Clos Topology for AI Training
- Paper Deep-Dive Map
- Hot Chips 2026 NVIDIA Fusion
- Hot Chips 2026 Rubin GPU
- Hot Chips 2026 Helios UALoE
- Synchronization Tax — τ 征税,B* 随域规模下降
- Entwine — 单节点 NVLink 上 tile 级 GEMM–RS 重叠
训练侧:把集体关在 NVLink 域
BASP 在 Ulysses 训练中按 micro-batch 建 SP 子组;当子组大小 = 每节点 GPU 数时,attention all-to-all 可不出节点,避开 IB。Einsummable 默认假设单机 NVSwitch 非阻塞域做 intra-op 并行。片内更细一层:CREDIT 的 DSMEM 是 GPC 内 inter-SM,不是 NVLink。
Entwine 仍在单节点 NVLink 域,但把通信粒度做到 GEMM tile:交错产出 + SM 通信核 + 预算选型;vs 顺序 NCCL geomean 1.232×。
书 Ch.6–7:域边界与收敛(2026-09)
李博杰 Ch.6 把 NVL 域写成「先判断再摊」的协作单位,对照 超节点:
- H100 NVLink 4:450 GB/s/dir(双向 900);(\alpha) 取 MSCCL++ 0.822 μs。Qwen3-32B 机内 TP8 单步 5.15 ms;跨两台 HGX 的 TP16 用实测 32.74 μs/AR → 6.67 ms,更慢。更大域常用来装更多实例或超八卡模型,不是把 8-KV-head 模型切到 TP16。
- NVSwitch Gen3:64 端口 × 25 GB/s/dir。下联/上联 32/32 → 800 GB/s 上联;48/16 只 400。DGX H100 NVLink 出节点 2:1 收敛。Switch System 最多 256 张 H100,全交换 115.2 TB/s = 256×450。
- 64 卡设计案例(每卡 6×50 GB/s,TPU v4 ICI 口径):维序归约环面=交换;均匀 All-to-All 交换约 3×(512 卡 6×)。
- Ch.7:1024 卡训练里高速域 8→64 卡、出口随卡增长,吞吐约 +36%;出口仍按 8×400 Gbit/s 封顶时,64 卡分层归约可能慢于连续环。
Co-Fabric:跨 host 总线语义对照(2026-09-25)
Co-Fabric 试图把类总线的 memory 语义做到跨 OS/host,对照本页「域内固定高带宽、跨域走 scale-out」。其评测基线是 64-xPU RoCE 而非 NVLink/NVSwitch;报告相对 RoCE:延迟 **over 50%**↓、带宽 2–5×、DeepSeek R1 +30%–80%、互连成本约 −80%。
MoK / Purlin:NVL72 软件栈(2026-10-01)
Mixture-of-Kittens 证明为 scale-out 优化的 MoE 系统迁到 NVL72 时常慢于朴素 NCCL;专用 megakernel(push/pull 选型、可调粒度、无 CPU 同步)相对最强公开基线最高 2.37×,512 GPU 生产 e2e 1.41×。Purlin 则把域内集体的编排与 Atom datapath 解耦,集体延迟最高 5.14×、带宽 4.50×,SGLang 在线交互过载最高 2.85×。
Citations
[1] paper-deepdive-day-08.md — Hopper/Blackwell NVLink 精读(Day 8) [2] hc2026-nvidia-rubin.md — Rubin GPU / NVLink 6, Hot Chips 2026 [3] Synchronization_Tax_GPU_Scale_Up_Domains_2026.pdf — Devraj et al., arXiv:2608.22503;同步税 vs 带宽缩放 [4] Scaling_Inference_Prefill_High_Radix_Photonic_2026.pdf — Madhavan et al., arXiv:2609.01821;光学 1152 pod vs 电学 72 [5] Entwine_Tiled_Computation_Fine_Grained_GPU_Comm_2026.pdf — Entwine [6] Ch.6 超节点 — 李博杰《AI Infra》 [7] AI-Infra-Book.pdf [8] CoFabric_Unified_xPU_Interconnection_2026.pdf — Co-Fabric vs RoCE scale-up [9] MixtureOfKittens_MoE_Megakernel_NVL72_2026.pdf — MoK / NVL72 MoE [10] Purlin_Collectives_Orchestration_Datapath_2026.pdf — Purlin collectives