Disaggregated Inference(解耦推理)
定义
将 Transformer 的不同模块(attention、FFN/MoE)部署在不同硬件/节点上,各自独立扩展和优化。核心思想:不同模块的资源瓶颈不同,解耦后可以针对性分配硬件。
动机
传统部署中,attention 和 FFN 共享同一 GPU,导致:
- Attention(decode 阶段):memory-bound(需读全部 KV cache),但计算量低 → GPU 算力浪费
- FFN(dense):compute-bound,batch 大时算力利用率高
- FFN(MoE):sparse activation → 每个 expert 的 effective batch 小 → 变成 memory-bound
矛盾:同一 GPU 上,attention 需要内存带宽,MoE FFN 需要聚合 batch 提升算力利用率,两者互相牵制。
核心架构
Attention Nodes (M个) Expert Nodes (N个)
┌──────────┐ ┌──────────┐
│ Attn + KV│ ── M2N ──→ │ Expert 0 │
│ Cache │ │ Expert 1 │
│ (replica)│ ←── N2M ── │ ... │
└──────────┘ └──────────┘
Data Parallel Expert Parallel
独立扩展 独立扩展
- Attention nodes:存储 KV cache,用 data parallelism 复制多份
- Expert nodes:每个 GPU 存一个 expert,用 expert parallelism 扩展
- 通信:M2N(dispatch tokens)+ N2M(collect results)
NVIDIA LPX 产品化(AFD)
NVIDIA 在 Nvidia Groq 3 Lpx 中将 AFD(Attention FFN Disaggregation)产品化:
- GPU 运行 attention(stateful,需要 HBM 存 KV cache)
- LPU 运行 FFN/MoE expert(stateless,确定性架构适配静态工作负载)
- Token routing 通过 Spectrum-X Ethernet scale-out fabric
- Ping-pong pipeline 掩盖通信延迟
- 这是 M2N 通信模式在 GPU+LPU 异构场景的具体实现
关键优势
- 独立扩展:attention 和 expert 各自选择 parallelism 策略
- 异构部署:attention 用 HBM 大的 GPU,expert 用 SRAM 快的 LPU
- Batch 聚合:多个 attention replica 聚合请求 → expert 的 effective batch 增大 → MoE FFN 回到 compute-intensive
- 资源利用率:每种硬件只做自己擅长的事
核心技术挑战
1. Ping-Pong Pipeline
disaggregation 引入额外通信 → 需要用 pipeline 并行掩盖延迟。将 batch 分成 m 个 micro-batch,在 attention 和 expert 之间”乒乓”传递。
必要条件:
- Ta ≈ Te(计算时间匹配)
- Tc < Tf(通信 < 计算)
- m ≥ 2 × (1 + Tc/Tf)
2. M2N 通信
3. 部署规划
给定模型 + workload + SLO → 自动确定 parallelism 策略、micro-batch 数、硬件配置。优化目标:throughput per dollar。
与其他解耦方案的关系
| 方案 | 解耦维度 | 通信模式 | 目标 |
|---|---|---|---|
| Disaggregated Attn/FFN | 模块层 | M2N/N2M | MoE 推理效率 |
| Disaggregated Prefill/Decode | 阶段层 | KV transfer | 降低 TTFT/TPOT |
| Pool-based KV | 内存层 | KV routing | KV cache 管理 |
| 3DLS 物理隔离 | 封装垂直维 | 垂直 KVT + 侧向 AR | 去掉共享 D2D 争用 |
| HYDRA 封装内 PD×算子 | 封装内 chiplet | NoI mesh | hybrid Transformer–Mamba serving |
| CHIPSMORE 层流水共享权重 | 封装内 CT cluster | IPCN mesh + UCIe | base/LoRA 多请求,不复制 RRAM 权重 |
| LEAP-D 片上 PD 解耦 | 同片 prefill/decode 宏区 | mesh INC + KV 区传 | IMC 留 prefill;decode 扩 scratchpad |
| AInfer-PD 同池复用 | 同设备 P/D 并发(非第二池) | turnstile 排交叉集体 + DeepEP 相位私有态 | 共享权重/KV;防 ADP/ATP 进度环 |
| 光学 scale-up × PD DES | 解耦 prefill/decode worker | 4× SU BW / 1152 pod | TTFT↓ 但 decode 饱和可抬 TPOT |
| PipeSwift 共置 PP(JCT) | 阶段共置 + 管线并行 | stage P2P + MTP | agentic completion time,非 token SLO |
| Crossflow 弹性 P/D 边界 | 同集群相位池 | decode 租约本地 prefill | 吞吐 geomean +16.2–17.4%;高负载最高 +43.4% |
| 书 Ch.9 PD / AF | 阶段池 / 层内算子池 | KV 整份交接;逐层激活 | 异构配比;同构常先分块 prefill |
与 Luke 研究的关联
- Scale-up fabric:disaggregation 意味着跨节点的高频通信,是 scale-up fabric 的核心场景
- 可重构网络:不同模型、不同 expert 数量 → M:N 比例变化 → 需要动态适配
- MoE 路由:expert 的稀疏激活 + disaggregation = 通信模式高度动态
开放问题
- Attention/FFN 解耦是否适用于 dense model?还是仅限 MoE?
- Prefill/Decode 解耦 + Attn/FFN 解耦能否叠加?
- 光交换/可重构网络能否简化 M2N 的复杂性?
实证支持
Understanding Inference Scaling For Llms 通过 8B-671B 模型的系统实验为 prefill/decode 解耦提供了实证基础:
- Prefill 是 compute-bound(低 HBM BW util),Decode 是 bandwidth-bound(高 HBM BW saturation)
- Reasoning >99% wall-clock 在 decode → 硬件应物理解耦
- Prefill Decode Divergence 量化了两阶段的正交资源需求
相关页面
-
RoofLang — 仿真搜索并行/放置;V4 紧凑 KV 带来 3.5–39.5× 峰值 decode(相对对照模型)
-
Dissecting Hopper Utilization — 测量侧:抬高 decode M(packing / persistent)与 PD 同属抬利用率杠杆
-
Megascale Infer 2504.02263 — 首个大规模 disaggregated expert parallelism 系统
-
FlashMoE Kernel — 单节点 EP megakernel(与 disagg 正交,可叠在 expert 侧)
-
MegaMoE Kernel — DeepSeek wave EP overlap
-
M2N Communication — disaggregation 产生的通信模式
-
Heterogeneous Inference — GPU + LPU 异构推理
-
Nvidia Groq 3 Lpx — LPX 产品化 AFD
-
Prefill Decode Divergence — Prefill vs Decode 的资源特性分歧
-
Understanding Inference Scaling For Llms — 系统性推理 scaling 瓶颈分析
-
PRESERVE Prefetch — 分布式 serving 中权重/KV HBM→L2 prefetch
-
HCache State Restoration — 会话状态快速恢复(隐藏激活)
-
FlexInfer Offloading — 端侧预算自适应 offload
-
SuperInfer Superchips — GH200 NVLink-C2C 上 SLO-aware KV 调度
-
3DLS — chiplet 上 PD+TP 的 KVT/AR 物理隔离(IEEE CAL 2026)
-
ReXpert — 驻留 ReRAM FFN 池 + 有界组播;iso-compute vs H20 9.5× FFN 延迟
-
DASH — 不拆模块池,拆 HBF→GPU 的 Direct/Relay 投递
-
HYDRA — 封装内 prefill/decode × Attention/Mamba chiplet 拆分,不是机柜 AFD
-
ThAME — 同包内 host / DRAM-PNM attn / FeFET expert
-
CHIPSMORE — CIM chiplet 层流水多请求共享权重 + 分层 KV;不是机柜 AFD
-
LEAP — 片上 IMC-NoC 的 LEAP-D PD 解耦;vs H100 1.52× 吞吐 / 24.91× 能效(仿真)
-
AInfer-PD — 同池 P/D 复用的集体/DeepEP 隔离;vs Normal −7.1–22.5%、vs SGLang −24.8–32.9%
-
Photonic Prefill — 光学扩大 scale-up pod 后对 PD 解耦 serving 的 TTFT/TPOT 传导(DES)
-
Fengshui — 算子级 BASIC/chiplet 池;与相位拆分互补的 die 经济学
-
Composable CXL — 内存解耦共享 KV(非 P/D 池);跨节点 prefix TTFT 5.5–36.6×
-
AI Infra Book Ch.9 — PD/AF 预算与配比
-
PDD — 跨 DC Prefill+RelayDecode+MainDecode;H100×H200 BCR 最高 +37.5%(面向 agentic TTFT)
-
Trillion MoE in a Box — 对照:低并发 单节点 HBF 一体机,不是机柜 PD 池
-
UNISON — 会话级 KV 近存调度(与 PD 池正交)
-
PipeSwift — JCT 目标下复活 PP+MTP;vs SGLang EP 1.21–1.45×、vs PD-disagg 1.14–1.54×(agentic 轨迹)
-
Ask the Tool — 工具等待期 progress→KV keep/evict/prefetch;p90 TTFT after tool vs LRU −20.7%/−20.8%
书 Ch.9:配比与交接预算(2026-09)
李博杰教材把解耦写成可算的配比,而不是「一定更快」:Ch.9。
- 稳定:(\lambda d_r < n_r);共置 (\mu=N/(d_P+d_D))。4×A100+4×H20、8K/1025、Qwen3-8B:共置 3.02 req/s,到达 3.5 时持续积压。
- 同构 8×A100 整数划分 PD 上限 2.83 < 共置 3.05;分离换的是排队隔离。分块 prefill 理想捎带可到 4.50——同构通常先分块。
- 异构 A100×4 做 P、H20×4 做 D:4.55 req/s(1.51× 共置)。角色对调 2.22。H20 算力弱、带宽约 2× A100,适合 D。
- KV 交接:GQA 8K = 1.125 GiB @ 25 GB/s → 48.3 ms;紧凑 MLA 549 MiB → 23.0 ms。(\mu_{PD}=\min(\mu_P,\mu_D,B_{\mathrm{net}}/V_{KV}))。无前缀复用时经共享池中转多搬一次、多等 48.3 ms,应直传。
- AF / 专家分离每层 dispatch+combine;稠密逐层 72×8 KiB 由启动主导(0.384 ms)。专家复用交点:AVX ~72 行、AMX ~689 行才值得搬权重上 GPU。
FPGA–GPU 步级解耦投机推理(2026-09-28)
HeteroReason 把 LRM 的 draft 卸到 FPGA、PRM/target 留在 GPU,并在 FPGA 本地做 prefill–decode 解耦 + step-ahead 管线;相对同构 GPU 延迟 1.01×–1.42×、能效 1.25×–1.57×(MICRO’26)。
EPD Encode 控制点与 Agentic 分支投机(2026-09-29)
EAServe(PACT’26)把 MLLM 的 Encode 做成 EPD 管线控制点(微批 + 共驻 prefill offload + SM 分区 + HAS),moderate 档 goodput 相对 Dynamo / vLLM 最高 4.3× / 1.7×;A100 上 LLaVA-34B 达 4.91 req/s(vs EPDServe 4.86×)。DynBranch 不改 P/D 池拓扑,而在 model-API 边界对 agentic 分支决议窗口做可寻址投机子图与跨请求复用(32B@4×H200 vs 最强基线延迟最高 −32%)。
RR-Evict 在 1P3D PD 解耦编码 agent(Qwen3-8B / SWE-bench @ H100)上验证:轮转尾块淘汰相对 LRU 改善尾部 TTFT / 未缓存 token(对话共置工况摘要最高 −75.4% / −65.7%),说明 prefix-cache 策略与 P/D 池拓扑正交。
运行时并行布局与 SSD 稀疏 KV(2026-10-01)
SPLASH-layouts 在不停机条件下热切换 TP/DP-attention/CP/DOP,相对固定布局吞吐 1.3–1.73×(GLM-5.3@B200),把「并行布局」做成与 P/D 池拓扑正交的服务旋钮。Janus 针对 agent append-prefill 的稀疏 KV SSD 路径,TTFT 最高 1.57–3.69×。
AFD 放大专家不均与微批级重配(2026-10-06)
AFORE:AFD 把 FFN 变成独立流水级后,偏斜路由吞吐损失从单体 −11.9% 放大到 −20.1%。AFORE 利用”下一微批路由在 FFN 前可见”与”前序在飞微批构成迁移窗口”,用 NVLink p2p 复制热专家:GLM-4.5-Air 110B(2×8 A100)吞吐 +10.1–17.6%、P95 ITL −7.1–9.5%(vs 最强基线),迁移 0.45–0.50 ms 全被 ~2 ms 前瞻窗口隐藏。是 MegaScale-Infer 式 AFD 的动态负载补丁,与 M2N Communication 相关。
Citations
[1] arXiv:2504.02263 [2] [raw/articles/GTC 2026 – The Inference Kingdom Expands.md](raw/articles/GTC 2026 – The Inference Kingdom Expands.md) [3] Understanding_Inference_Scaling_for_LLMs.pdf [4] 3DLS_3D_Logic_Stacked_Disaggregated_LLM_Serving_2026.pdf — 3DLS 物理隔离 [5] ReXpert_MoE_ReRAM_Near_Memory_Disaggregated_Serving_2026.pdf — ReXpert 驻留 FFN 池 [6] DASH_Dual_Path_HBF_MoE_LLM_Inference_2026.pdf — DASH HBF 双路径 [7] HYDRA_Heterogeneous_Chiplet_DSE_Hybrid_LLM_2026.pdf — HYDRA 封装内 hybrid serving DSE [8] Scaling_Inference_Prefill_High_Radix_Photonic_2026.pdf — 光学 prefill × PD DES [9] AInfer_PD_InPlace_Prefill_Decode_MoE_2026.pdf — AInfer-PD 同池复用 [10] Fengshui_Chiplet_Ecosystem_BASIC_Codesign_2026.pdf — Fengshui [11] Composable_CXL_Memory_K8s_LLM_Serving_2026.pdf — Composable CXL serving [12] Ch.9 分布式推理 — 李博杰《AI Infra》 [13] AI-Infra-Book.pdf [14] arXiv:2609.13161 — PDD 跨 DC PD [15] arXiv:2609.15636 — Trillion MoE HBF 供给 [16] arXiv:2609.09643 — UNISON agent KV 近存调度 [17] arXiv:2609.16491 — PipeSwift agentic PP serving [18] arXiv:2609.18849 — Ask the Tool progress-aware KV [19] arXiv:2609.28717 — HeteroReason [20] arXiv:2609.31551 — EAServe EPD [21] arXiv:2609.31047 — DynBranch [21] arXiv:2609.32278 — RR-Evict [22] arXiv:2609.37626 — SPLASH-layouts [23] arXiv:2609.36938 — Janus [24] arXiv:2610.03203 — AFORE