SPLASH(布局切换):服务中热切换 Attention 并行布局
命名:与既有 SPLASH(稀疏注意力×HBF)(arXiv:2609.23816)同名异文。本文为 ICT CAS 的 并行布局切换 服务系统(arXiv:2609.37626)。
一句话结论
在请求不停机的前提下切换 attention 并行布局(TP / DP-attention / CP / 新提出的 DOP);B200 上 GLM-5.3 端到端吞吐相对固定布局 1.3–1.73×;中位切换开销 <0.51% 所在 step(完整切换 e2e 0.02–11.76 ms,阻塞式可达 667.31 ms)。
动机
- Reasoning / agentic / RL-rollout:批次从「大量短请求」演变为「少数超长上下文」,最优布局随运行变化;现有引擎启动时钉死布局。
- 现代少/无 KV head 的注意力使 权重分片 与 KV 归属 可解耦——布局差异主要是谁持有权重与 cache。
对照 Disaggregated Inference、Prefill-Decode Divergence、Parallelism Transition Point。
方案
- 复用+后台搬移+批边界交接:多数状态已在目标布局所需位置;缺态按层在推理背景传输,step 边界 handoff。
- Decoupled Ownership Parallelism (DOP):权重按 TP 切、每请求 KV 单 owner(如 DP-attn);相对 DP-attn 不复制,KV 容量 +27–60%(GLM-5.3 FP8@T=8 每卡多出 12.69 GiB 给 KV)。
- 过渡感知调度:分析模型选当前最优布局;四布局随负载跟踪。
- 实现:SGLang 0.5.10 fork;GLM-5.3@B200、DeepSeek-V3.2@H200、GLM-5.3-Flash@DCU。
效果(仅论文数字)
| 指标 | 数字 |
|---|---|
| e2e 吞吐 vs 固定布局(GLM-5.3@B200) | 1.3–1.73× |
| 切换中位开销 | <0.51% step |
| 完整切换 e2e | 0.02–11.76 ms(vs 阻塞最高 667.31 ms) |
| DOP vs DP-attn KV 容量 | +27–60%;示例 +12.69 GiB/GPU |
| 固定布局长上下文:DOP vs CP | 最长四点吞吐 3.4–10.6% 更高(文中测量段) |
与 wiki 的关系
- Disaggregated Inference — 运行时并行布局作为服务旋钮
- Memory Hierarchy and Cache — DOP 释放的是 KV 容量 而非介质层级
- SPLASH(HBF) — 同名异文:稀疏×闪存 vs 布局热切换