Network-on-Wafer(晶圆级网络 / NoW)
把整片或近整片晶圆当作一个 scale-up 域时,reticle / die 之间的互连不再是常规 NoC 或板级 D2D,而是被光罩尺寸、键合几何和封装路线卡住的 Network-on-Wafer。拓扑往往不是先画图再布线,而是 物理放置长出拓扑。
三条 WSI 物理路线
| 路线 | 代表 | 同层相邻能否直连 | 垂直维 | 对 NoW 的含义 |
|---|---|---|---|---|
| Field stitching | Cerebras WSE | 能(曝光重叠缝出连续金属) | 无(单片) | 软件看到均匀 2D mesh;缝上有冗余绕故障 |
| Chiplet-on-fanout | Tesla Dojo、若干 WSC 论文 | 能(扇出 / 中介层 + PHY) | 通常无 | 可做 mesh / Clos-like;要付 D2D PHY 面积与功耗 |
| WoW hybrid bonding | TSMC SoIC-WoW;Iff et al. 2026 | 不能 | 面对面 HB,pitch <10 μm 量产 / 1 μm 研究 | 只有对侧重叠 reticle 能连;放置 = 拓扑 |
第三种是 2026 年才被系统当网络问题写的:HB 电气接近上层金属、不需要 PHY,但几何重叠是硬约束。详见 3D Stacking Technologies、Hybrid Bonding。
WoW 下的设计旋钮
- Logic-on-Interconnect vs Logic-on-Logic:底片纯互连(热简单、算力减半)还是两片都有 compute(密度高、热/电难)。
- Radix via overlap:半格错位 ≈ mesh、radix-4;互连 reticle 旋转/交错提到 radix-6;45° 缩小互连 reticle 提到 radix-7;LoL 用轮廓 reticle 提到 radix-5。
- 路由:不规则图上 Dijkstra 最短路 + SCB 破环;选择随机或看邻居 buffer。
- 利用率:矩形网格 vs 尽量填满圆晶圆。Iff 文最大收益出现在最大填充 + LoI。
论文数字(只复述):相对 mesh-like baseline 吞吐最高 +250%、延迟 -36%、每字节能量 -38%;Llama-7B 训练 trace 平均延迟到 baseline 的 60%。
与 3.5D chiplet 树的对照
Mozart 也是晶圆级,但互连是 2.5D NoP-Tree(中心 attention、叶专家、in-network switch),垂直维是 per-chiplet logic-on-SRAM hybrid bonding,不是 WoW 重叠成网。它优化的是 MoE All-to-All 的 token 复制数 C_T,不是平均路径 hop。
3DLS 把隔离做在 封装垂直维(KVT vs decode AllReduce),侧向仍是 2.5D D2D,不是整晶圆 NoW。相关工作引用了 WSC-LLM 与 PD-aware NoW 共设计。
HYDRA 是 chiplet-on-fanout 近亲:被动硅 interposer 上最多 24 个计算 die、2D mesh NoI。它优化 hybrid LLM serving 的组成/放置/D2D 带宽,不是场拼接,也不是 WoW 重叠成网。
Samsung zHBM(Hot Chips 2026)也写 WoW + HCB,但是 xPU 垂直叠到 HBM C-die、取消 2.5D interposer——封装级 3D,不是整晶圆 NoW 重叠网。Pistil 是 20-chiplet 2.5D flower,更不是晶圆级。
光 interposer NoW(第四条近亲)
Yoon et al. 2026 把 300 mm SiN 光 interposer 当 scale-up 域:GPU 居中、HBM 外围,多层 X–Y 波导、O-E-O 中继,不是电学 WoW 重叠,也不是 Cerebras 缝金属。DWDM 账是 32 Gb/s × 32 λ → 目标 1.5 TB/s die-to-die。主结论不是拓扑,而是 MRR 热光 stall ~47–49 ms/突发 会把 MoE All-to-All 拉到 2.7–3.8×;铁电调谐把这条延迟抹掉。开放问题里的 photonic NoW 从此有一篇可引用的全文,但仍缺与 DyPNet-MSC 的对照。
和 wiki 已有 mesh/WSE 页的关系
- Mesh and Torus Topology — WSE/Dojo 默认 2D mesh;WoW baseline 只是“像 mesh”,不能用 XY 维序。
- Collective-Capable NoC — 片上集体硬件;WoW 文评的是 packet 吞吐,集体算法仍空。
- WSE Reduce Algorithms / Near-Optimal Wafer-Scale Reduce — field-stitch mesh 上的 reduce;不能直接搬到重叠约束图。
- WaferLLM System — 在 Cerebras 均匀 mesh 上做 LLM 算子;NoW 换拓扑后 MeshGEMM/V 的两跳假设要重验。
- AIC Folded Multi-Ring NoC — reticle 尺度折叠环,不是晶圆级重叠网。
- DICE — 封装内 CCD–IOD SerDes PHY(PAM4+FEC)。WoW hybrid bonding 电气接近上层金属、通常不需要这层 PHY;不要把 DICE 的误码/重传数字套到 NoW。
晶圆级 DSE:先构造可行域
Fovea(清华,2026-08)不设计新拓扑,而是论证:同质 repeated-die 晶圆仍然不是一张万能模板。die 轮廓同时决定光罩合规、tiling、D2D lane 数和边界 I/O 能否放下;面积可行里平均 29.4% 的分析 top-10% 会被物理约束打掉。分析 vs ASTRA-sim+ns-3 约 4000× 成本且 20.96% 成对反转,所以用 Decision Domain 只精评无法排除的候选。范围是 chiplet-on-wafer 边界 D2D,不是 WoW 重叠网,也不是 Cerebras field stitch。
晶圆级 Unified Memory 的翻译面(2026-09)
WaferTrans(清华)不改 NoW 边集合,而是指出:WSG 片上带宽够做近无损 UM 时,远程 VA 翻译若仍走 CPU-IOMMU,会先把收益吃掉。方案是每 GPU 的 PTE Presence Directory + PTE-PC,在晶圆内解析远程翻译;vs Trans-FW 平均 2.5×(Sequential/Adjacent 3.1×),面积约 0.40%。开放问题里「软件栈看见什么样的域」因此多了一层:拓扑之外还有 翻译控制面是否出晶圆。
当前认知
- NoW 不是“大号 NoC”:物理路线先决定边集合,再谈路由/流控。
- 2026 年可写进设计空间的轴:WoW 重叠几何(Iff/ETH)、3.5D 异构树(Mozart)、同质 repeated-die 物理可行域(Fovea)、以及光 interposer 的 调谐延迟(Yoon/Yu,不是名义带宽)。
- 集体通信、良率、热 仍是开放层:Iff 指出 FRED 式 Clos-like 在 WoW 几何下不可行;Mozart 自陈仍 memory-bound;光 NoW 上热已经能量化成 All-to-All stall。
开放问题
- 不规则 WoW 图上的 AllReduce / All-to-All 最优算法是什么?
- Field-stitch 均匀 mesh 与 WoW 高 radix 不规则图,对 WaferLLM 类算子谁更友好?
- Photonic NoW:Yoon/Yu 2026 量化了 MRR 热 stall;仍缺与 ISPASS 2026 DyPNet-MSC 及电学 WoW 的对照。
- 3DLS 的垂直隔离能否叠在 WoW 的 LoL 上,做成“层间 KVT + 层内高 radix NoW”?
- Fovea 的 Decision Domain 能否接到 WoW 重叠几何 / 异构 chiplet 混合物?
书 Ch.6.7.4:ROM 晶圆对照(2026-09)
Ch.6 用 OpenTallas 对 V4.1 Flash 的等硅面积分析(未流片):权重进掩模 ROM 后,单用户速度由片上 AllReduce 决定(200K、batch-1:4070 tok/s,通信占比 65%);片上 SRAM 44 GB(WSE-3 口径)装不下 510 GB checkpoint。这是「晶圆当超节点」时五问里 搬什么/谁等它 的极端:权重通路与 KV 通路分离后,NoW 集体延迟变成单用户上限。数字勿与已量产 WSE 混用。
Citations
[1] Network_Design_Wafer_Scale_WoW_Hybrid_Bonding_2026.pdf — Iff et al. 2026 [2] Mozart_35D_Wafer_Scale_MoE_Training_2026.pdf — Luo et al. 2026 [3] Fovea_Physical_Implication_Aware_Wafer_Scale_DSE_2026.pdf — Li et al. 2026 [4] 3DLS_3D_Logic_Stacked_Disaggregated_LLM_Serving_2026.pdf — Lee et al. 2026 [5] Thermal_Tuning_Wafer_Scale_Optical_Interconnect_LLM_MoE_2026.pdf — Yoon, Chen, Yu 2026 [5] WaferTrans_IOMMU_free_Wafer_Scale_GPU_2026.pdf — Tang et al., arXiv:2609.06125;IOMMU-free 翻译 [6] Ch.6.7.4 — 李博杰《AI Infra》ROM 晶圆对照 [7] AI-Infra-Book.pdf