Maia 200 — Data Center Scale AI Accelerator (Software Defined Dataflow)

Speakers: Prashant Ranjan, Jackson Peng, Torsten Hoefler(Microsoft)
Venue: Hot Chips 2026 Day 2
PDF: raw/papers/HC2026_Microsoft_Maia_200.pdf(非公开本地路径)

Azure 推理压 $/token 与 W/token。架构类 SDLA(Software Defined Local Access Dataflow):显式 SW 编排、控制/数据流分离。Kernel roofline 逐点 未知(图、无表)。

SoC

Dense tensor TOPS:FP4 10,145 / FP8 5,072 / BF16 1,268。HBM 7 TB/s,6 stacks,216 GB。SRAM 272 MB @ 80 TB/s。Host PCIe Gen6 x8,64 GB/s。Backend 网:1,400 GB/s 单向,28×400。Die ~820 mm²,package 75×75,TDP(provision)750 W,TSMC 3 nm,CoWoS-S。

存储:tile L1 TSRAM、cluster L2 CSRAM、chip HBM。层级 GNOC 做片内 multicast/broadcast。Tile:TTU(矩阵/卷积,FP8/FP6/FP4 block-scaled)、TVP(可编程 SIMD)、TCP(控制 + semaphore)。HW 队列最多 3 pre- 和 3 post-semaphore。

ATL / 机柜

自定义嵌入式 AI NIC ANC + Ethernet scale-up 传输 ATL:端点控 multipath(packet spray、负载均衡、OOO receiver)、HW 快速故障检测/恢复、E2E 加密。<8 pJ/b,<1 µs P2P 单向 mem2mem。幻灯写 ATL 影响 UET 与 MRC 标准化。

Tray FCQ:4 加速器固定 Ethernet 全连接(无交换机)做 TP AllGather/AllReduce。之上一条 Ethernet/ATL,两层 unified Clos,口号 chip → 6k accelerator cluster。软件 MCCL(non-blocking MPI)。

集体按尺寸自适应:broadcast(小)/ hierarchical(中)/ ring(大)。Attention:FlashAttention 风格 QK block;交错 2 tensor + 2 SIMD。Kernel 结果「as of June 2026」:FP8×FP8 与 FP4×FP4 GEMM TP=1;fused SDPA FA2;AllReduce BF16 TP8 与 AllToAll TP8。

归档全文

2026-08-25 出现独立预印本 Maia 200 SDLA(arXiv:2608.24664)。不要把两份来源的数字混进同一张表:幻灯有 SRAM 272 MB @ 80 TB/s、ATL <1 µs P2P mem2mem;全文有 6144 精确规模、ATLv2 接收端驱动、Hamming Mesh 20+8 / 4 plane、8 芯 Allgather 78%/94% SoL。峰值 TOPS / HBM / 28×400 / 750 W 两边一致。

与 wiki 的关系

Citations

[1] raw/papers/HC2026_Microsoft_Maia_200.pdf(非公开本地路径) — Ranjan / Peng / Hoefler, Hot Chips 2026 [2] hc2026-microsoft-maia-200.md — 结构化摘录 [3] maia-200-sdla.md — Xu et al. arXiv:2608.24664 归档全文