TPU v4 OCS Reconfigurable Fabric(TPU v4 光可重构互连)

Jouppi et al., ISCA 2023(+ v5p 报告)。paper-deepdive Day 7:paper-deepdive-day-07.md。摘要:tpu-v4-optically-reconfigurable.md。

哲学:Topology is a function——用 Optical Circuit Switch (OCS) 在运行时把 4096-chip pod 的逻辑拓扑切成更适合 workload 的形态(训练偏 torus/collective,推理偏低维 mesh)。

关键数字(笔记量级)

项值
Chip~275 TFLOPS BF16 / chip(7nm)
Pod4096 chips ≈ 1.1 PFLOPS BF16
Supercomputer9 pods ≈ 36K chips ≈ 1.1 EFLOPS
OCS 切换~100 ms 级(远慢于 packet hop)
光学能效笔记称 ~1 pJ/bit 量级 vs packet switch 更高

有效带宽:可重构 + 适配 collective → 笔记称 pod 内可达很高利用率(相对固定拓扑的 30–50% 有效带宽叙事)。

相对前序论文

Day关系
4 Balfour固定拓扑下 mesh Pareto;可重构使每个 workload 选自己的 Pareto 点
6 Kim Clos高基数/多路径;OCS 是 全局自适应 的物理实现(换拓扑而非 per-packet)
5 VC/WHOCS 电路交换段可绕开 packet 死锁问题
1 FRED为 AllReduce 选更优逻辑拓扑(直径/流量匹配)

对照路线:NVSwitch——固定 fat-tree + 极高每链路带宽,拒绝运行时换拓扑。

与 WSE

TPU v4 podCerebras WSE
Scale-up 边界4096 chip + OCS单晶圆 ~90 万 PE
拓扑可重构 4D torus 族固定 2D Mesh
介质电 + 光电路片上电 Mesh

研究启发:可重构 wafer/逻辑拓扑;Pod = scale-up boundary 的工程定义。

相关页面

Flux:按训练图排 OCS 电路(2026-09-25)

Flux(imec / Antwerp)把 LLM training iteration 的 compute/通信依赖与 OCS 重配置建成同一 MILP,相对 RotorNet/BvN 周期调度:摘要称 iteration 最高 10×、峰值 NIC buffer >三个数量级。仿真为 Llama 3 8B、8 GPU、2 OCS、800 Gbps、τ 1 μs–1 ms。相对本页 TPU v4「拓扑可软件化」,Flux 的旋钮是 何时换哪条电路,并显式重叠重配置与计算。

Citations

[1] paper-deepdive-day-07.md — TPU v4 OCS 精读(Day 7) [2] Flux_OCS_Scheduling_LLM_Training_2026.pdf — Troch et al., arXiv:2609.25949;workload-aware OCS MILP