TPU v4 OCS Reconfigurable Fabric(TPU v4 光可重构互连)
Jouppi et al., ISCA 2023(+ v5p 报告)。paper-deepdive Day 7:paper-deepdive-day-07.md。摘要:tpu-v4-optically-reconfigurable.md。
哲学:Topology is a function——用 Optical Circuit Switch (OCS) 在运行时把 4096-chip pod 的逻辑拓扑切成更适合 workload 的形态(训练偏 torus/collective,推理偏低维 mesh)。
关键数字(笔记量级)
| 项 | 值 |
|---|---|
| Chip | ~275 TFLOPS BF16 / chip(7nm) |
| Pod | 4096 chips ≈ 1.1 PFLOPS BF16 |
| Supercomputer | 9 pods ≈ 36K chips ≈ 1.1 EFLOPS |
| OCS 切换 | ~100 ms 级(远慢于 packet hop) |
| 光学能效 | 笔记称 ~1 pJ/bit 量级 vs packet switch 更高 |
有效带宽:可重构 + 适配 collective → 笔记称 pod 内可达很高利用率(相对固定拓扑的 30–50% 有效带宽叙事)。
相对前序论文
| Day | 关系 |
|---|---|
| 4 Balfour | 固定拓扑下 mesh Pareto;可重构使每个 workload 选自己的 Pareto 点 |
| 6 Kim Clos | 高基数/多路径;OCS 是 全局自适应 的物理实现(换拓扑而非 per-packet) |
| 5 VC/WH | OCS 电路交换段可绕开 packet 死锁问题 |
| 1 FRED | 为 AllReduce 选更优逻辑拓扑(直径/流量匹配) |
对照路线:NVSwitch——固定 fat-tree + 极高每链路带宽,拒绝运行时换拓扑。
与 WSE
| TPU v4 pod | Cerebras WSE | |
|---|---|---|
| Scale-up 边界 | 4096 chip + OCS | 单晶圆 ~90 万 PE |
| 拓扑 | 可重构 4D torus 族 | 固定 2D Mesh |
| 介质 | 电 + 光电路 | 片上电 Mesh |
研究启发:可重构 wafer/逻辑拓扑;Pod = scale-up boundary 的工程定义。
相关页面
- NVLink NVSwitch Scale-Up Fabric — 对立哲学
- High-Radix Clos Adaptive Routing
- Post-Moore Architecture Frontiers — 光互连
- LLM Distributed Training Collectives
- Multi-plane Clos Topology for AI Training
- Paper Deep-Dive Map
- Hot Chips 2026 TPU 8 — 8t 仍 OCS 切片(9600-chip / 2.4 TB/s ICI);8i 改 Boardfly(1152-chip,max 7 hops);Virgo 134,400 TPU
Flux:按训练图排 OCS 电路(2026-09-25)
Flux(imec / Antwerp)把 LLM training iteration 的 compute/通信依赖与 OCS 重配置建成同一 MILP,相对 RotorNet/BvN 周期调度:摘要称 iteration 最高 10×、峰值 NIC buffer >三个数量级。仿真为 Llama 3 8B、8 GPU、2 OCS、800 Gbps、τ 1 μs–1 ms。相对本页 TPU v4「拓扑可软件化」,Flux 的旋钮是 何时换哪条电路,并显式重叠重配置与计算。
Citations
[1] paper-deepdive-day-07.md — TPU v4 OCS 精读(Day 7) [2] Flux_OCS_Scheduling_LLM_Training_2026.pdf — Troch et al., arXiv:2609.25949;workload-aware OCS MILP