Cerebras WSE (Wafer-Scale Engine)

晶圆级 AI 加速器。WSE-3:900K 核心,44 GB SRAM,214 Pbit/s fabric 带宽。

Hot Chips 2026:CS-4 / Nexus / CS-6

CS-4 = 三片 WSE-3 Turbo。相对 CS-3:compute 125 → 750 PFLOPS;SRAM 44 → 132 GB;mem BW 21.6 → 129.6 PB/s;fabric 26.7 → 160.5 PB/s;I/O 1.2 → 7.2 Tbit/s;晶圆间 2 µs。新 Direct Wafer Links + RoCE。单晶圆标 43,200 TB/s vs Rubin 22 TB/s;wafer fabric 53.5 PB/s。GA Q3 2026。Nexus 预留 CS-5 / CS-6;CS-6 预告 wafer-scale SRAM + 3D stacked DRAM(FLOPS/BW 未知)。CS-5 数字标 internal projections。

与通用 CPU 体系结构的差异

维度通用 OoO CPUWSE
ILP硬件 Tomasulo + 分支预测编译器静态调度(Deterministic Execution)
内存L1/L2/L3 + DRAM/HBM44 GB 片上 SRAM,无 DRAM(DRAM and Memory System、Memory Hierarchy)
地址MMU + TLB + 虚拟内存无 MMU/TLB,物理/SRAM 直寻(Virtual Memory and TLB)
互连片外总线/NoC + coherence晶圆级 2D Mesh + 虫孔,无 coherence/shootdown
同步MFENCE + coherence 链PE barrier / 显式消息(Memory Consistency Model、Memory Fence and Barrier)
经济小 die 高良率整晶圆良率约束(Quantitative Architecture Fundamentals)

完整能力/代价矩阵见 DSA Processor Design Tradeoffs。

2D Mesh 拓扑

WSE-3 ~900K PE 排列为 ~949×949 2D Mesh,每 PE 4 端口(上下左右):

度量值
度4
直径≈ 2×948 = 1896 hops
平均距离≈ 632 hops(d̄,见 Interconnection Topology Metrics)
二分带宽 B_b≈ 949 条链路(~3.8 TB/s @ 4 GB/s/link)

相对 N 节点全连接,Mesh 以多跳换低端口数——约 145× 链路节省。未选 Torus:环绕长 wire 在晶圆上不可行(Interconnection Topology Metrics)。满注入带宽 vs B_b 差 ~947× → 必须算子融合与通信局部性(Interconnection Network Cost Model)。

虫孔交换与流量匹配

WSE 采用 wormhole routing 变体(非电路交换):

  • LLM 推理 traffic 为短突发消息(activation、gradient)+ 高并发 collective
  • 电路交换:建路/拆路开销 >> 数据本身;N 跳通路独占沿途全部链路 → 并发度崩溃
  • 虫孔:单 flit 注入、小 buffer、与 AllReduce 等 collective 天然契合

确定性路由

  • 24 个 color(虚拟通道),编译时静态路由
  • 每跳 ~0.4ns,color 之间互不阻塞
  • 与 Nvidia Groq 3 Lpx 的 plesiosynchronous C2C 是不同路径实现确定性
  • Color 机制详见 Cerebras Color Mechanism

与 Groq LPU 的对比

维度Cerebras WSEGroq 3 LPU
核心900K 简单 PE256 复杂 LPU
内存44 GB 片上 SRAM + memoryX NVMe128 GB 片上 SRAM
路由24 color 静态96 C2C plesiosynchronous
编程CSL(数据流)Compiler spatial
模型分布式内存分布式内存

Reduce/AllReduce Collective

memoryX 外置存储

WSE-3 经 PCIe Gen5 ×16(~64 GB/s)连接 memoryX:约 4× NVMe SSD(~30 TB 顺序读 ~28 GB/s 量级)+ host DRAM 池。片上 ~21 PB/s SRAM 与 NVMe 带宽差 ~750,000×——适合 checkpoint/冷加载,不适合 per-token KV 从 SSD 读取。详见 SSD and NVMe Storage System。

相关页面

Citations

[1] Near-optimal_wafer-scale_reduce.pdf [2] SpaDA_Spatial_Dataflow_Architecture_Programming_Language_2026.pdf — SpaDA 语言与编译器(Gianinazzi et al. 2026) [3] interconn-study-21d-day-01.md — WSE Mesh 引入(互连 Day 1) [4] interconn-study-21d-day-02.md — WSE 虫孔选型(互连 Day 2) [5] interconn-study-21d-day-03.md — Mesh 拓扑度量(互连 Day 3) [6] interconn-study-21d-day-04.md — 成本/延迟模型(互连 Day 4) [7] arch-study-30d-day-02.md — 功耗/良率(体系结构 Day 2) [8] arch-study-30d-day-14.md — 无 Cache 对比(Day 14) [9] arch-study-30d-day-15.md — 无 MMU/TLB(Day 15) [10] arch-study-30d-day-16.md — DSA 能力矩阵(Day 16) [11] WaferLLM_LLM_Inference_at_Wafer_Scale_2025.pdf — WaferLLM PLMR/MeshGEMM(He et al. 2025) [12] arch-study-30d-day-26.md — WSE 量化综合(Day 26) [13] arch-study-30d-day-25.md — DSA/脉动 vs SLA(Day 25) [14] interconn-study-21d-day-13.md — CDG/Dally、Mesh vs Torus(Day 13) [15] interconn-study-21d-day-14.md — Duato / 逃逸 VC(Day 14) [16] hc2026-cerebras-cs4.md — CS-4 / Nexus, Hot Chips 2026