MOCAP: Wafer-Scale Chunked Pipelining for Prefill-Only LLM Inference

Authors: Zichuan Wang, Huizheng Wang, Yuheng Xiao, Haonan Zuo, et al. | Affiliations: Tsinghua University, SJTU, Shanghai AI Lab | PDF: MOCAP_Wafer_Scale_Chunked_Pipelining_Prefill_2026.pdf

一句话总结

MOCAP 针对 prefill-only(长上下文、单 token 输出)在 wafer-scale chip 上做 memory-orchestrated chunked pipeline:用 MBKR 均衡 stage 间 KV 堆积、LBCP 非均匀分块平衡 attention 增长,相对 GPipe 平均 76.4% 降延迟、3.24× 吞吐。

核心贡献

  1. Prefill-only WSC 框架:首个系统优化 WSC 上 prefill-only LLM inference(非通用 decode 路径)
  2. Memory-Balanced KV Reallocation (MBKR):跨 pipeline stage 重分配 KV,缓解因果依赖导致的 memory imbalance
  3. Latency-Balanced Chunk Partitioning (LBCP):自适应非均匀 chunk 划分,平衡 attention 成本与 KV 迁移开销
  4. Terapipe 式 token chunk pipeline:细粒度 chunk 流水线降低 bubble,相对 Terapipe 最大序列长度 +31%
  5. WSC 通信优势量化:同等算力/容量下 WSC 相对 HGX B200 端到端延迟约 -46.8%(GR24)

关键数字

设置结果
vs GPipe76.4% 更低 E2E latency;3.24× 平均 throughput
vs Terapipe最大支持序列长度 1.31×
WSC vs GPU (GR24)平均 total latency -46.8%
工作负载Prefill-only,上下文可达 ~10⁵ tokens

与 wiki 交叉引用

Citations

[1] MOCAP_Wafer_Scale_Chunked_Pipelining_Prefill_2026.pdf — Wang et al. (2026) [2] mocap-wafer-scale-chunked-pipelining.md — 结构化摘录