Crossflow: Prefill–Decode Elasticity for Agentic LLM Serving

一句话结论

在不改节点角色的前提下,让 decode 节点用短寿命可撤销租约借出本地 prefill 能力,使 P/D 边界弹性化:相对静态分池,token 吞吐 geomean +16.2–17.4%,高负载最高 +43.4%,且每个评测点 mean TTFT 都下降。

动机

  • 静态 P/D 换 replica 需数十分钟,而相位比波动更快:舰队分钟级 uncached-in/out peak-to-mean 最高 4.7×;公开 agentic 日内小时比中位 24.5×。
  • 按 p95 定容闲置最高约 17% 集群容量;定低则一侧排队、一侧空转。
  • Agentic 流量(成簇到达、tool 释放、前缀复用、输出长度发散)放大错配。对照 PDD 的跨 DC 静态异构、PipeSwift 的 PP 代理服务。

方案

  1. Decode 节点保持 decode-first,但发布 lease:上限约束本地 prefill 算力、KV 容量、传输工作量与投影输出。
  2. 租约短寿命、可撤销,避免长期侵占 decode 余量。
  3. 评测:公开 TraceLab + 内部 traces;GPT-OSS-120B、GLM-5.2(753B/40B active)于 GB300。

效果(仅论文数字)

指标数字
Token 吞吐 vs Static P/Dgeomean +16.2–17.4%(req/in/out:16.6/17.4/16.2%)
高负载峰值输出 +43.4%、输入 +42.7%
Mean TTFT每点下降 −10.0–34.4%(内部 GLM 可达 −32.2–47.7%)
动机波动分钟 peak-to-mean 4.7×;agentic 小时比中位 24.5×;p95 闲置最高 ≈17%

与 wiki 的关系

Citations

[1] arXiv PDF — Xu et al., Meta, arXiv:2609.27085 [2] raw stub