NVLink / NVSwitch Scale-Up Fabric

NVIDIA Hopper / Blackwell 白皮书与 GTC 材料。paper-deepdive Day 8:paper-deepdive-day-08.md。摘要:nvidia-nvlink-hopper-blackwell.md。

哲学(相对 TPU v4 OCS):Topology is fixed (fat-tree);把每链路带宽做胖,使运行时换拓扑不必要。

关键数字(白皮书/笔记)

代际每 GPU NVLink 双向带宽备注
Hopper NVLink 4~900 GB/sH100
Blackwell NVLink 5~1.8 TB/s2× Hopper
NVL7272 GPU 单域~18 NVSwitch tray;聚合带宽笔记称 ~130 TB/s/rack 量级
Rubin NVLink 6(HC2026)3.6 TB/s per GPU all-to-all72 GPU;Counted Write;130 TFLOPS in-network
NVSwitch Gen4(笔记)高基数 ASIC(数百 port 级)Clos/fat-tree 中枢

工艺:H100 ~80B 管;B200 笔记称 ~208B(双 die 等)。实体延伸:Nvidia Vera Rubin NVL72、Kyber Rack。

Hot Chips 2026:Fusion 教程 给 NVL72 机柜几何(9×4 NVLink 6 switch,28.8 TB/s/tray,900 GB/s C2C,CHI)。Rubin GPU 补协议:Counted Write 替换 MEMBAR+atomic;相对 Ethernet 3× 延迟、10× packet rate、130 TFLOPS in-network。同日对照 Helios UALoE(以太网 load-store,1.8 TB/s/dir)。TPU 8 仍走 OCS/Boardfly,不是 fat-tree。

Photonic Prefill(arXiv:2609.01821)把电学 72-GPU 铜域当作 MoE prefill 的硬边界:跨 rack 后走慢 scale-out,光学配对给出 4× SU 带宽与最大 1152 GPU 全光 pod;B300 FP4 上 128K@288 ~2.9×、生产平台跨边界 2.2–4.5×(分析模型,非实测光子)。

Synchronization Tax(Cornell, arXiv:2608.22503)指出第二条趋势和第一条打架:集体墙钟里有一段 与 B 无关 的 barrier 等待 τ。8-GPU 域可占通信时间 >50%;EVT 下最优带宽随域规模 下降(512 vs 8 GPU 为 2.06× 更低 B*)。论文 Table 1 口径 NVLink GB/s/GPU:A100 300 / H100·H200 450 / B200 900,域 8→72——与上表双向 ~900 GB/s(Hopper)不要混用。

两条 scale-up 哲学

Google TPU v4NVIDIA NVLink
拓扑OCS 可重构固定 fat-tree
每芯片链路相对薄极胖(~6× ICI 叙事)
域规模Pod 4096 chipNVL72 72 GPU
交换光电路(慢切换、低 pJ/bit)高基数 packet switch
理论祖先Day 4/6「拓扑是旋钮」Day 6 high-radix Clos 工业极致

与 NoC 经典的连接

WSE 路径第三极:单晶圆 Mesh,无 NVSwitch/OCS——见 Cerebras WSE。

相关页面

BASP 在 Ulysses 训练中按 micro-batch 建 SP 子组;当子组大小 = 每节点 GPU 数时,attention all-to-all 可不出节点,避开 IB。Einsummable 默认假设单机 NVSwitch 非阻塞域做 intra-op 并行。片内更细一层:CREDIT 的 DSMEM 是 GPC 内 inter-SM,不是 NVLink。

Entwine 仍在单节点 NVLink 域,但把通信粒度做到 GEMM tile:交错产出 + SM 通信核 + 预算选型;vs 顺序 NCCL geomean 1.232×。

书 Ch.6–7:域边界与收敛(2026-09)

李博杰 Ch.6 把 NVL 域写成「先判断再摊」的协作单位,对照 超节点:

  • H100 NVLink 4:450 GB/s/dir(双向 900);(\alpha) 取 MSCCL++ 0.822 μs。Qwen3-32B 机内 TP8 单步 5.15 ms;跨两台 HGX 的 TP16 用实测 32.74 μs/AR → 6.67 ms,更慢。更大域常用来装更多实例或超八卡模型,不是把 8-KV-head 模型切到 TP16。
  • NVSwitch Gen3:64 端口 × 25 GB/s/dir。下联/上联 32/32 → 800 GB/s 上联;48/16 只 400。DGX H100 NVLink 出节点 2:1 收敛。Switch System 最多 256 张 H100,全交换 115.2 TB/s = 256×450。
  • 64 卡设计案例(每卡 6×50 GB/s,TPU v4 ICI 口径):维序归约环面=交换;均匀 All-to-All 交换约 3×(512 卡 6×)。
  • Ch.7:1024 卡训练里高速域 8→64 卡、出口随卡增长,吞吐约 +36%;出口仍按 8×400 Gbit/s 封顶时,64 卡分层归约可能慢于连续环。

Co-Fabric:跨 host 总线语义对照(2026-09-25)

Co-Fabric 试图把类总线的 memory 语义做到跨 OS/host,对照本页「域内固定高带宽、跨域走 scale-out」。其评测基线是 64-xPU RoCE 而非 NVLink/NVSwitch;报告相对 RoCE:延迟 **over 50%**↓、带宽 2–5×、DeepSeek R1 +30%–80%、互连成本约 −80%。

MoK / Purlin:NVL72 软件栈(2026-10-01)

Mixture-of-Kittens 证明为 scale-out 优化的 MoE 系统迁到 NVL72 时常慢于朴素 NCCL;专用 megakernel(push/pull 选型、可调粒度、无 CPU 同步)相对最强公开基线最高 2.37×,512 GPU 生产 e2e 1.41×。Purlin 则把域内集体的编排与 Atom datapath 解耦,集体延迟最高 5.14×、带宽 4.50×,SGLang 在线交互过载最高 2.85×。

Citations

[1] paper-deepdive-day-08.md — Hopper/Blackwell NVLink 精读(Day 8) [2] hc2026-nvidia-rubin.md — Rubin GPU / NVLink 6, Hot Chips 2026 [3] Synchronization_Tax_GPU_Scale_Up_Domains_2026.pdf — Devraj et al., arXiv:2608.22503;同步税 vs 带宽缩放 [4] Scaling_Inference_Prefill_High_Radix_Photonic_2026.pdf — Madhavan et al., arXiv:2609.01821;光学 1152 pod vs 电学 72 [5] Entwine_Tiled_Computation_Fine_Grained_GPU_Comm_2026.pdf — Entwine [6] Ch.6 超节点 — 李博杰《AI Infra》 [7] AI-Infra-Book.pdf [8] CoFabric_Unified_xPU_Interconnection_2026.pdf — Co-Fabric vs RoCE scale-up [9] MixtureOfKittens_MoE_Megakernel_NVL72_2026.pdf — MoK / NVL72 MoE [10] Purlin_Collectives_Orchestration_Datapath_2026.pdf — Purlin collectives