Disaggregated Inference(解耦推理)

定义

将 Transformer 的不同模块(attention、FFN/MoE)部署在不同硬件/节点上,各自独立扩展和优化。核心思想:不同模块的资源瓶颈不同,解耦后可以针对性分配硬件。

动机

传统部署中,attention 和 FFN 共享同一 GPU,导致:

  • Attention(decode 阶段):memory-bound(需读全部 KV cache),但计算量低 → GPU 算力浪费
  • FFN(dense):compute-bound,batch 大时算力利用率高
  • FFN(MoE):sparse activation → 每个 expert 的 effective batch 小 → 变成 memory-bound

矛盾:同一 GPU 上,attention 需要内存带宽,MoE FFN 需要聚合 batch 提升算力利用率,两者互相牵制。

核心架构

Attention Nodes (M个)          Expert Nodes (N个)
┌──────────┐                  ┌──────────┐
│ Attn + KV│ ── M2N ──→      │ Expert 0 │
│ Cache    │                  │ Expert 1 │
│ (replica)│ ←── N2M ──      │ ...      │
└──────────┘                  └──────────┘
  Data Parallel                Expert Parallel
  独立扩展                     独立扩展
  • Attention nodes:存储 KV cache,用 data parallelism 复制多份
  • Expert nodes:每个 GPU 存一个 expert,用 expert parallelism 扩展
  • 通信:M2N(dispatch tokens)+ N2M(collect results)

NVIDIA LPX 产品化(AFD)

NVIDIA 在 Nvidia Groq 3 Lpx 中将 AFD(Attention FFN Disaggregation)产品化:

  • GPU 运行 attention(stateful,需要 HBM 存 KV cache)
  • LPU 运行 FFN/MoE expert(stateless,确定性架构适配静态工作负载)
  • Token routing 通过 Spectrum-X Ethernet scale-out fabric
  • Ping-pong pipeline 掩盖通信延迟
  • 这是 M2N 通信模式在 GPU+LPU 异构场景的具体实现

关键优势

  1. 独立扩展:attention 和 expert 各自选择 parallelism 策略
  2. 异构部署:attention 用 HBM 大的 GPU,expert 用 SRAM 快的 LPU
  3. Batch 聚合:多个 attention replica 聚合请求 → expert 的 effective batch 增大 → MoE FFN 回到 compute-intensive
  4. 资源利用率:每种硬件只做自己擅长的事

核心技术挑战

1. Ping-Pong Pipeline

disaggregation 引入额外通信 → 需要用 pipeline 并行掩盖延迟。将 batch 分成 m 个 micro-batch,在 attention 和 expert 之间”乒乓”传递。

必要条件:

  • Ta ≈ Te(计算时间匹配)
  • Tc < Tf(通信 < 计算)
  • m ≥ 2 × (1 + Tc/Tf)

2. M2N 通信

见 M2N Communication

3. 部署规划

给定模型 + workload + SLO → 自动确定 parallelism 策略、micro-batch 数、硬件配置。优化目标:throughput per dollar。

与其他解耦方案的关系

方案解耦维度通信模式目标
Disaggregated Attn/FFN模块层M2N/N2MMoE 推理效率
Disaggregated Prefill/Decode阶段层KV transfer降低 TTFT/TPOT
Pool-based KV内存层KV routingKV cache 管理
3DLS 物理隔离封装垂直维垂直 KVT + 侧向 AR去掉共享 D2D 争用
HYDRA 封装内 PD×算子封装内 chipletNoI meshhybrid Transformer–Mamba serving
CHIPSMORE 层流水共享权重封装内 CT clusterIPCN mesh + UCIebase/LoRA 多请求,不复制 RRAM 权重
LEAP-D 片上 PD 解耦同片 prefill/decode 宏区mesh INC + KV 区传IMC 留 prefill;decode 扩 scratchpad
AInfer-PD 同池复用同设备 P/D 并发(非第二池)turnstile 排交叉集体 + DeepEP 相位私有态共享权重/KV;防 ADP/ATP 进度环
光学 scale-up × PD DES解耦 prefill/decode worker4× SU BW / 1152 podTTFT↓ 但 decode 饱和可抬 TPOT
PipeSwift 共置 PP(JCT)阶段共置 + 管线并行stage P2P + MTPagentic completion time,非 token SLO
Crossflow 弹性 P/D 边界同集群相位池decode 租约本地 prefill吞吐 geomean +16.2–17.4%;高负载最高 +43.4%
书 Ch.9 PD / AF阶段池 / 层内算子池KV 整份交接;逐层激活异构配比;同构常先分块 prefill

与 Luke 研究的关联

  • Scale-up fabric:disaggregation 意味着跨节点的高频通信,是 scale-up fabric 的核心场景
  • 可重构网络:不同模型、不同 expert 数量 → M:N 比例变化 → 需要动态适配
  • MoE 路由:expert 的稀疏激活 + disaggregation = 通信模式高度动态

开放问题

  1. Attention/FFN 解耦是否适用于 dense model?还是仅限 MoE?
  2. Prefill/Decode 解耦 + Attn/FFN 解耦能否叠加?
  3. 光交换/可重构网络能否简化 M2N 的复杂性?

实证支持

Understanding Inference Scaling For Llms 通过 8B-671B 模型的系统实验为 prefill/decode 解耦提供了实证基础:

  • Prefill 是 compute-bound(低 HBM BW util),Decode 是 bandwidth-bound(高 HBM BW saturation)
  • Reasoning >99% wall-clock 在 decode → 硬件应物理解耦
  • Prefill Decode Divergence 量化了两阶段的正交资源需求

相关页面

  • RoofLang — 仿真搜索并行/放置;V4 紧凑 KV 带来 3.5–39.5× 峰值 decode(相对对照模型)

  • Dissecting Hopper Utilization — 测量侧:抬高 decode M(packing / persistent)与 PD 同属抬利用率杠杆

  • Megascale Infer 2504.02263 — 首个大规模 disaggregated expert parallelism 系统

  • FlashMoE Kernel — 单节点 EP megakernel(与 disagg 正交,可叠在 expert 侧)

  • MegaMoE Kernel — DeepSeek wave EP overlap

  • M2N Communication — disaggregation 产生的通信模式

  • Heterogeneous Inference — GPU + LPU 异构推理

  • Nvidia Groq 3 Lpx — LPX 产品化 AFD

  • Prefill Decode Divergence — Prefill vs Decode 的资源特性分歧

  • Understanding Inference Scaling For Llms — 系统性推理 scaling 瓶颈分析

  • PRESERVE Prefetch — 分布式 serving 中权重/KV HBM→L2 prefetch

  • HCache State Restoration — 会话状态快速恢复(隐藏激活)

  • FlexInfer Offloading — 端侧预算自适应 offload

  • SuperInfer Superchips — GH200 NVLink-C2C 上 SLO-aware KV 调度

  • 3DLS — chiplet 上 PD+TP 的 KVT/AR 物理隔离(IEEE CAL 2026)

  • ReXpert — 驻留 ReRAM FFN 池 + 有界组播;iso-compute vs H20 9.5× FFN 延迟

  • DASH — 不拆模块池,拆 HBF→GPU 的 Direct/Relay 投递

  • HYDRA — 封装内 prefill/decode × Attention/Mamba chiplet 拆分,不是机柜 AFD

  • ThAME — 同包内 host / DRAM-PNM attn / FeFET expert

  • CHIPSMORE — CIM chiplet 层流水多请求共享权重 + 分层 KV;不是机柜 AFD

  • LEAP — 片上 IMC-NoC 的 LEAP-D PD 解耦;vs H100 1.52× 吞吐 / 24.91× 能效(仿真)

  • AInfer-PD — 同池 P/D 复用的集体/DeepEP 隔离;vs Normal −7.1–22.5%、vs SGLang −24.8–32.9%

  • Photonic Prefill — 光学扩大 scale-up pod 后对 PD 解耦 serving 的 TTFT/TPOT 传导(DES)

  • Fengshui — 算子级 BASIC/chiplet 池;与相位拆分互补的 die 经济学

  • Composable CXL — 内存解耦共享 KV(非 P/D 池);跨节点 prefix TTFT 5.5–36.6×

  • AI Infra Book Ch.9 — PD/AF 预算与配比

  • PDD — 跨 DC Prefill+RelayDecode+MainDecode;H100×H200 BCR 最高 +37.5%(面向 agentic TTFT)

  • Trillion MoE in a Box — 对照:低并发 单节点 HBF 一体机,不是机柜 PD 池

  • UNISON — 会话级 KV 近存调度(与 PD 池正交)

  • PipeSwift — JCT 目标下复活 PP+MTP;vs SGLang EP 1.21–1.45×、vs PD-disagg 1.14–1.54×(agentic 轨迹)

  • Ask the Tool — 工具等待期 progress→KV keep/evict/prefetch;p90 TTFT after tool vs LRU −20.7%/−20.8%

书 Ch.9:配比与交接预算(2026-09)

李博杰教材把解耦写成可算的配比,而不是「一定更快」:Ch.9。

  • 稳定:(\lambda d_r < n_r);共置 (\mu=N/(d_P+d_D))。4×A100+4×H20、8K/1025、Qwen3-8B:共置 3.02 req/s,到达 3.5 时持续积压。
  • 同构 8×A100 整数划分 PD 上限 2.83 < 共置 3.05;分离换的是排队隔离。分块 prefill 理想捎带可到 4.50——同构通常先分块。
  • 异构 A100×4 做 P、H20×4 做 D:4.55 req/s(1.51× 共置)。角色对调 2.22。H20 算力弱、带宽约 2× A100,适合 D。
  • KV 交接:GQA 8K = 1.125 GiB @ 25 GB/s → 48.3 ms;紧凑 MLA 549 MiB → 23.0 ms。(\mu_{PD}=\min(\mu_P,\mu_D,B_{\mathrm{net}}/V_{KV}))。无前缀复用时经共享池中转多搬一次、多等 48.3 ms,应直传。
  • AF / 专家分离每层 dispatch+combine;稠密逐层 72×8 KiB 由启动主导(0.384 ms)。专家复用交点:AVX ~72 行、AMX ~689 行才值得搬权重上 GPU。

FPGA–GPU 步级解耦投机推理(2026-09-28)

HeteroReason 把 LRM 的 draft 卸到 FPGA、PRM/target 留在 GPU,并在 FPGA 本地做 prefill–decode 解耦 + step-ahead 管线;相对同构 GPU 延迟 1.01×–1.42×、能效 1.25×–1.57×(MICRO’26)。

EPD Encode 控制点与 Agentic 分支投机(2026-09-29)

EAServe(PACT’26)把 MLLM 的 Encode 做成 EPD 管线控制点(微批 + 共驻 prefill offload + SM 分区 + HAS),moderate 档 goodput 相对 Dynamo / vLLM 最高 4.3× / 1.7×;A100 上 LLaVA-34B 达 4.91 req/s(vs EPDServe 4.86×)。DynBranch 不改 P/D 池拓扑,而在 model-API 边界对 agentic 分支决议窗口做可寻址投机子图与跨请求复用(32B@4×H200 vs 最强基线延迟最高 −32%)。

RR-Evict 在 1P3D PD 解耦编码 agent(Qwen3-8B / SWE-bench @ H100)上验证:轮转尾块淘汰相对 LRU 改善尾部 TTFT / 未缓存 token(对话共置工况摘要最高 −75.4% / −65.7%),说明 prefix-cache 策略与 P/D 池拓扑正交。

运行时并行布局与 SSD 稀疏 KV(2026-10-01)

SPLASH-layouts 在不停机条件下热切换 TP/DP-attention/CP/DOP,相对固定布局吞吐 1.3–1.73×(GLM-5.3@B200),把「并行布局」做成与 P/D 池拓扑正交的服务旋钮。Janus 针对 agent append-prefill 的稀疏 KV SSD 路径,TTFT 最高 1.57–3.69×。

AFD 放大专家不均与微批级重配(2026-10-06)

AFORE:AFD 把 FFN 变成独立流水级后,偏斜路由吞吐损失从单体 −11.9% 放大到 −20.1%。AFORE 利用”下一微批路由在 FFN 前可见”与”前序在飞微批构成迁移窗口”,用 NVLink p2p 复制热专家:GLM-4.5-Air 110B(2×8 A100)吞吐 +10.1–17.6%、P95 ITL −7.1–9.5%(vs 最强基线),迁移 0.45–0.50 ms 全被 ~2 ms 前瞻窗口隐藏。是 MegaScale-Infer 式 AFD 的动态负载补丁,与 M2N Communication 相关。

Citations

[1] arXiv:2504.02263 [2] [raw/articles/GTC 2026 – The Inference Kingdom Expands.md](raw/articles/GTC 2026 – The Inference Kingdom Expands.md) [3] Understanding_Inference_Scaling_for_LLMs.pdf [4] 3DLS_3D_Logic_Stacked_Disaggregated_LLM_Serving_2026.pdf — 3DLS 物理隔离 [5] ReXpert_MoE_ReRAM_Near_Memory_Disaggregated_Serving_2026.pdf — ReXpert 驻留 FFN 池 [6] DASH_Dual_Path_HBF_MoE_LLM_Inference_2026.pdf — DASH HBF 双路径 [7] HYDRA_Heterogeneous_Chiplet_DSE_Hybrid_LLM_2026.pdf — HYDRA 封装内 hybrid serving DSE [8] Scaling_Inference_Prefill_High_Radix_Photonic_2026.pdf — 光学 prefill × PD DES [9] AInfer_PD_InPlace_Prefill_Decode_MoE_2026.pdf — AInfer-PD 同池复用 [10] Fengshui_Chiplet_Ecosystem_BASIC_Codesign_2026.pdf — Fengshui [11] Composable_CXL_Memory_K8s_LLM_Serving_2026.pdf — Composable CXL serving [12] Ch.9 分布式推理 — 李博杰《AI Infra》 [13] AI-Infra-Book.pdf [14] arXiv:2609.13161 — PDD 跨 DC PD [15] arXiv:2609.15636 — Trillion MoE HBF 供给 [16] arXiv:2609.09643 — UNISON agent KV 近存调度 [17] arXiv:2609.16491 — PipeSwift agentic PP serving [18] arXiv:2609.18849 — Ask the Tool progress-aware KV [19] arXiv:2609.28717 — HeteroReason [20] arXiv:2609.31551 — EAServe EPD [21] arXiv:2609.31047 — DynBranch [21] arXiv:2609.32278 — RR-Evict [22] arXiv:2609.37626 — SPLASH-layouts [23] arXiv:2609.36938 — Janus [24] arXiv:2610.03203 — AFORE