Interconnection Network Protocol Stack(互连网络协议栈)

COMET 补充了 scale-across WAN 的 transport/offload 案例:用 erasure-code path stripe 与稀疏 loss tracking 把可靠性状态从 BDP 解耦,并映射为 FPGA 上可并行复制的数据路径。

互连网络在物理层到传输层采用与 TCP/IP 类似的四层分解。各层职责边界清晰,便于将 NoC、scale-up fabric、scale-out 网络统一分析。

四层结构

┌────────────────────────────────────┐
│ 传输层 (Transport)                 │  ← 端到端可靠/有序、拥塞控制
├────────────────────────────────────┤
│ 网络层 (Network)                   │  ← 路由、包格式、拥塞信号
├────────────────────────────────────┤
│ 数据链路层 (Link)                  │  ← 错误检测、重传、链路训练、流控
├────────────────────────────────────┤
│ 物理层 (Physical)                  │  ← 编码、SerDes、信道
└────────────────────────────────────┘
层NoC 典型实现职责
Physical片上 wire、收发器比特传输、编码、均衡
LinkCredit-based 流控、ACK/NACK链路级可靠、VC 分配
NetworkXY / 自适应 / 确定性 color 路由逐跳转发、死锁避免
Transport端到端有序、拥塞控制跨多跳的消息语义

Network Interface (NI)

NI 是计算与网络的边界——连接 PE/CPU 核心与 Router:

   CPU/PE 核心
        ↑
   Network Interface (NI)
        ↑
   Router ←── flit ──→ Router

NI 决定:哪些 collective 可硬件卸载、哪些需软件参与、注入/egress 缓冲深度。WSE 与 UnifiedBus UB 均在 NI 处暴露不同抽象(CSL 数据流 vs URMA Jetty)。

与本 wiki 其他页面的映射

通用层UB 实现NoC / WSE
PhysicalUB 物理层片上 wire、无 SerDes;chiplet 封装内则为 SerDes+FEC
LinkUB 数据链路层Credit 流控、VC(见 NoC Router)
NetworkUB 网络层24-color 静态路由
TransportUB 传输层端到端 collective 语义

Chiplet 封装内 PHY(相对片上 wire)

片上 NoC 把 Physical 当成 CMOS wire。跨 CCD/IOD 的短距 C2C 不是这条抽象:DICE 在 gem5 里把这一跳建成 QC-LDPC + PAM4 + AWGN/jitter/crosstalk + LLR 解调 + 按 flit 重传。固定延迟 HeteroGarnet 会把延迟构成画得像 monolithic,IPC 相对 DICE 平均偏 6.8%、最高 27.6%(方向因负载而异)。晶圆级 hybrid bonding / field stitch 通常没有这层 SerDes,见 Network-on-Wafer。

HYDRA 的 D2D 停在 UCIe x64 advanced-package + NVIDIA GRS PHY 的带宽/面积假设(256–640 GB/s),没有 DICE 那种 PAM4/FEC 运行时模型。

Maia 200 的 ATLv2 是 传输层:接收端驱动 RDMA、AES-GCM-256、selective retransmit、包喷洒。物理/链路仍是 PFC 以太 + 400G ANC,不是 chiplet SerDes PHY。

SAGE(城大香港)在可靠投递之上加 数值语义:BF16 Class-H/M/L 决定是否重放、地理检查点决定从多远重放;Garnet 上相对固定 34-hop 平均延迟 −28%、Ψ_del −30.1%。与 DICE 的「PHY 延迟要不要建细」互补——SAGE 问「哪些错误值得付重传税」。

历史坐标

协议栈各层随互连介质演进:电话网铜线 → HPC 专用链路 → 硅片 NoC → 晶圆级单介质(Cerebras WSE)。详见 Switching Principles 中的时代划分与里程碑。

相关页面

Co-Fabric:跨 host 的四层 bus 栈(2026-09-25)

Co-Fabric(IEIT)给出 Media / Link(credit+链路重传)/ Fabric(Port-ID)/ Semantic(load/store)四层,相对 RoCE 网络栈砍掉独立传输层。64-xPU 3D-Mesh:节点间延迟 **over 50%**↓、带宽 2–5×;AllReduce 小包延迟为 RoCE 的 10%–20%。

Citations

[1] interconn-study-21d-day-02.md — Dally & Towles Ch.2 学习笔记(21 天互连研究 Day 2) [2] dice-detailed-inter-chiplet-end-to-end-phy-modeling.md — Aligholipour et al., arXiv:2607.24221

[3] SAGE_Semantic_Aware_Geographic_Error_Recovery_AI_2026.pdf — Hung et al., arXiv:2609.10126;语义错误恢复 [4] CoFabric_Unified_xPU_Interconnection_2026.pdf — Peng et al., arXiv:2609.25560;Co-Fabric 四层栈