Interconnection Network Protocol Stack(互连网络协议栈)
COMET 补充了 scale-across WAN 的 transport/offload 案例:用 erasure-code path stripe 与稀疏 loss tracking 把可靠性状态从 BDP 解耦,并映射为 FPGA 上可并行复制的数据路径。
互连网络在物理层到传输层采用与 TCP/IP 类似的四层分解。各层职责边界清晰,便于将 NoC、scale-up fabric、scale-out 网络统一分析。
四层结构
┌────────────────────────────────────┐
│ 传输层 (Transport) │ ← 端到端可靠/有序、拥塞控制
├────────────────────────────────────┤
│ 网络层 (Network) │ ← 路由、包格式、拥塞信号
├────────────────────────────────────┤
│ 数据链路层 (Link) │ ← 错误检测、重传、链路训练、流控
├────────────────────────────────────┤
│ 物理层 (Physical) │ ← 编码、SerDes、信道
└────────────────────────────────────┘
| 层 | NoC 典型实现 | 职责 |
|---|---|---|
| Physical | 片上 wire、收发器 | 比特传输、编码、均衡 |
| Link | Credit-based 流控、ACK/NACK | 链路级可靠、VC 分配 |
| Network | XY / 自适应 / 确定性 color 路由 | 逐跳转发、死锁避免 |
| Transport | 端到端有序、拥塞控制 | 跨多跳的消息语义 |
Network Interface (NI)
NI 是计算与网络的边界——连接 PE/CPU 核心与 Router:
CPU/PE 核心
↑
Network Interface (NI)
↑
Router ←── flit ──→ Router
NI 决定:哪些 collective 可硬件卸载、哪些需软件参与、注入/egress 缓冲深度。WSE 与 UnifiedBus UB 均在 NI 处暴露不同抽象(CSL 数据流 vs URMA Jetty)。
与本 wiki 其他页面的映射
| 通用层 | UB 实现 | NoC / WSE |
|---|---|---|
| Physical | UB 物理层 | 片上 wire、无 SerDes;chiplet 封装内则为 SerDes+FEC |
| Link | UB 数据链路层 | Credit 流控、VC(见 NoC Router) |
| Network | UB 网络层 | 24-color 静态路由 |
| Transport | UB 传输层 | 端到端 collective 语义 |
Chiplet 封装内 PHY(相对片上 wire)
片上 NoC 把 Physical 当成 CMOS wire。跨 CCD/IOD 的短距 C2C 不是这条抽象:DICE 在 gem5 里把这一跳建成 QC-LDPC + PAM4 + AWGN/jitter/crosstalk + LLR 解调 + 按 flit 重传。固定延迟 HeteroGarnet 会把延迟构成画得像 monolithic,IPC 相对 DICE 平均偏 6.8%、最高 27.6%(方向因负载而异)。晶圆级 hybrid bonding / field stitch 通常没有这层 SerDes,见 Network-on-Wafer。
HYDRA 的 D2D 停在 UCIe x64 advanced-package + NVIDIA GRS PHY 的带宽/面积假设(256–640 GB/s),没有 DICE 那种 PAM4/FEC 运行时模型。
Maia 200 的 ATLv2 是 传输层:接收端驱动 RDMA、AES-GCM-256、selective retransmit、包喷洒。物理/链路仍是 PFC 以太 + 400G ANC,不是 chiplet SerDes PHY。
SAGE(城大香港)在可靠投递之上加 数值语义:BF16 Class-H/M/L 决定是否重放、地理检查点决定从多远重放;Garnet 上相对固定 34-hop 平均延迟 −28%、Ψ_del −30.1%。与 DICE 的「PHY 延迟要不要建细」互补——SAGE 问「哪些错误值得付重传税」。
历史坐标
协议栈各层随互连介质演进:电话网铜线 → HPC 专用链路 → 硅片 NoC → 晶圆级单介质(Cerebras WSE)。详见 Switching Principles 中的时代划分与里程碑。
相关页面
- Interconnection Network Design Space — 设计空间顶层框架
- NoC Router 微架构 — 链路/网络层 Router 实现
- Switching Principles — 交换方式与历史演进
- UB 数据链路层机制 — Credit 流控实例
- Network Interface and System-Level Design — NI / E2E / 拥塞(Day 19)
- DICE — chiplet PHY 运行时模型(QC-LDPC / PAM4)
- C2C-Explorer — scale-up C2C 的 AXI/MAC/credit 层,不建模误码
- HYDRA — 包内 NoI 的 UCIe x64/GRS 带宽档,不是 PHY 误码模型
- Maia 200 SDLA — Ethernet ATLv2 接收端驱动
- SAGE — 语义分级重放 / 地理检查点
Co-Fabric:跨 host 的四层 bus 栈(2026-09-25)
Co-Fabric(IEIT)给出 Media / Link(credit+链路重传)/ Fabric(Port-ID)/ Semantic(load/store)四层,相对 RoCE 网络栈砍掉独立传输层。64-xPU 3D-Mesh:节点间延迟 **over 50%**↓、带宽 2–5×;AllReduce 小包延迟为 RoCE 的 10%–20%。
Citations
[1] interconn-study-21d-day-02.md — Dally & Towles Ch.2 学习笔记(21 天互连研究 Day 2) [2] dice-detailed-inter-chiplet-end-to-end-phy-modeling.md — Aligholipour et al., arXiv:2607.24221
[3] SAGE_Semantic_Aware_Geographic_Error_Recovery_AI_2026.pdf — Hung et al., arXiv:2609.10126;语义错误恢复 [4] CoFabric_Unified_xPU_Interconnection_2026.pdf — Peng et al., arXiv:2609.25560;Co-Fabric 四层栈