CXL Tiered Memory

定义

CXL(Compute Express Link) 把远端/扩展内存挂到 CPU 一致性域附近,形成 本机 DRAM ↔ CXL 内存 的分层容量。LLM serving / 训练常受 KV cache、激活、权重副本 容量挤压;CXL 分层用页迁移与数据通路优化,在可接受延迟下扩大有效内存。

三条研究线

方向代表核心问题
页迁移策略M5何时、迁哪些页;避免 thrashing 与错误层级
解耦内存数据移动CosMoS解耦内存池上的 cost-effective 搬运/访问支持
CXL fabricAurelia多主机共享 CXL 内存的 fabric / tentacle 拓扑

与 LLM 系统的交汇

  • KV / 会话状态:长上下文与多轮对话放大容量需求;分层内存与 HCacheFlexInfer 的 offload/prefetch 正交但目标相近(把冷状态移出热路径)。
  • 训练激活/检查点:大 batch 与长序列可把中间张量放到 CXL 层,代价是带宽与延迟。
  • 超芯片 / C2CSuperInfer 在 GH200 上利用 NVLink-C2C 的统一内存视图——与 CXL 同属「扩大可寻址内存」,介质与一致性模型不同。

开放问题

  1. LLM serving 的访问模式(顺序扫 KV vs 随机 KV)是否匹配通用 OS 页迁移启发式?
  2. CXL 带宽/延迟相对 HBM:何时该用软件 prefetch/异步 DMA,而非被动缺页?
  3. Fabric 规模化后的 QoS:多租户训练/推理如何隔离?

相关页面

Citations

[1] M5_CXL_Tiered_Memory_Page_Migration_2025.pdf [2] CosMoS_Disaggregated_Memory_Data_Movement_2025.pdf [3] Aurelia_CXL_Fabric_Tentacle_2023.pdf