CXL Tiered Memory
定义
CXL(Compute Express Link) 把远端/扩展内存挂到 CPU 一致性域附近,形成 本机 DRAM ↔ CXL 内存 的分层容量。LLM serving / 训练常受 KV cache、激活、权重副本 容量挤压;CXL 分层用页迁移与数据通路优化,在可接受延迟下扩大有效内存。
三条研究线
| 方向 | 代表 | 核心问题 |
|---|---|---|
| 页迁移策略 | M5 | 何时、迁哪些页;避免 thrashing 与错误层级 |
| 解耦内存数据移动 | CosMoS | 解耦内存池上的 cost-effective 搬运/访问支持 |
| CXL fabric | Aurelia | 多主机共享 CXL 内存的 fabric / tentacle 拓扑 |
与 LLM 系统的交汇
- KV / 会话状态:长上下文与多轮对话放大容量需求;分层内存与 HCache、FlexInfer 的 offload/prefetch 正交但目标相近(把冷状态移出热路径)。
- 训练激活/检查点:大 batch 与长序列可把中间张量放到 CXL 层,代价是带宽与延迟。
- 超芯片 / C2C:SuperInfer 在 GH200 上利用 NVLink-C2C 的统一内存视图——与 CXL 同属「扩大可寻址内存」,介质与一致性模型不同。
开放问题
- LLM serving 的访问模式(顺序扫 KV vs 随机 KV)是否匹配通用 OS 页迁移启发式?
- CXL 带宽/延迟相对 HBM:何时该用软件 prefetch/异步 DMA,而非被动缺页?
- Fabric 规模化后的 QoS:多租户训练/推理如何隔离?
相关页面
- End-to-End Memory Data Path — CPU↔内存通路全景
- DRAM and Memory System — DRAM 层次
- Disaggregated Inference — 计算/状态解耦
- Heterogeneous Inference — 异构内存/加速器栈
- SSD and NVMe Storage System — 更冷一层(存储)对照
Citations
[1] M5_CXL_Tiered_Memory_Page_Migration_2025.pdf [2] CosMoS_Disaggregated_Memory_Data_Movement_2025.pdf [3] Aurelia_CXL_Fabric_Tentacle_2023.pdf