《深入理解 AI Infra:量化分析与系统设计》

李博杰开源教材(Apache-2.0)。定位是 AI Infra 的量化体系结构书:对照 H&P《量化研究方法》,从硬件约束和模型架构推导系统设计,而不是罗列框架 API。

源 stub:bojieli-ai-infra-book.md。章节摘要在 ai-infra-book。

方法:「从约束推导设计」

先明确任务与质量,再列出计算、存储、通信和依赖;检查容量是否装得下、带宽是否供得上、哪些等待无法消除。估算不必一开始精确,但必须知道算进了什么、漏了什么。方法专页:Constraint-Driven AI Infra Design。

贯穿五问:搬什么、搬多少、搬几次、经过哪里、谁必须等它。

利用率:峰值下界是物理极限。计算侧 (F/(\Pi T)) 为 MFU,带宽侧 (R/(\beta T)) 为 MBU。下界与实测之差要么是模型漏项,要么是可去掉的系统开销。

阅读地图

部分章本 wiki 主要对接
模型与负载Ch.1–Ch.3Quantitative Architecture、Decode
芯片与系统Ch.4–Ch.7GPU SIMT、超节点、NVLink fabric、Clos、UB
推理与训练Ch.8–Ch.12Disaggregated Inference、Collectives

作者建议:模型/应用侧重 8–9、11–12;系统/网络侧重 5–7、9–10;芯片侧重 4–7。先自己估,再对书。

作者线索(为何这本书对 UB / 超节点有一手数字)

  • MSRA / 中科大系统研究;Bing DNN 的 FPGA 模型并行(2016)。
  • MindSpore AKG 算子生成;在线 softmax → 后来 FlashAttention 同族思路。
  • 2020 起 Unified Bus:万卡互联;书中 OpenURMA 仿真给出 Load/Store vs PCIe NIC 的 μs 级分解。
  • KV-Direct(可编程 NIC KV);创业后实时语音管线(5 s → ~500–600 ms)。

贯穿算例(工作层只保留量级)

  • Qwen3-8B / 32B / 235B-A22B:容量、TP、EP、PD 配比。
  • DeepSeek V4 / V4.1 Flash:CED、SWA、Engram 表、200K decode。
  • HGX H100 八卡:NVLink 450 GB/s/dir,ConnectX-7 50 GB/s/dir。
  • CloudMatrix384:384×910C + 192 CPU,UB 交换。

数字一律来自书中手稿;未在书中出现的规格不补。

Citations

[1] GitHub manuscripts — 前言与目录 [2] AI-Infra-Book.pdf [3] Online [4] raw stub