HBFlex: A Flexible Memory System for Bridging Fine-Grained LLM States and Coarse-Grained HBF Parallel Execution

Authors: Shuzhang Zhong, Weikai Xu, Yifan Zhou, Tongbin Zhao, Tenghao Zhao, Yifei Kang, Cunyin Chang, Shu Li, Guangyu Sun, Meng Li Affiliation: Peking University; HKUST; Alibaba Group arXiv: 2609.18675(2026-09-16,cs.AR;Thu 9/17 列表) PDF: arXiv PDF

相对 Trillion MoE HBF 供给 回答「权重已在 HBF 后状态层要多少」,以及 FLINT / DASH 的混合/双路径,HBFlex 做 全 HBF 下细粒度 KV 的放置–写回–回收闭环。

动机

  • 混合 HBM/HBF 在固定封装预算下用 HBM 保动态 KV,会挤掉本可给 HBF 的平面 → 权重读带宽被卡住。
  • 全 HBF 多出平面,但 KV 细粒度读导致平面热点、增量 program 与读争用、混合寿命放大 GC(文内 DeepSeek-V4-Pro 朴素 WAF ≈ 30×)。

方案

  1. 全 HBF 组织:封装预算全给 HBF;base die 缓冲动态更新。
  2. 读路径:平面感知放置 + attention/PagedAttention 读时的运行时负载均衡。
  3. 写路径:增量更新聚合,在足够长的计算窗口内写回,降低 write–read 干扰。
  4. 回收:寿命引导块打包 + 延迟回收,减少 valid-page 迁移。
  5. 评测:trace-driven;6 stack × 16 die × 32 plane = 3072 planes;每栈 488 GB/s、合计 2.93 TB/s;四模型 × 四 Alibaba Bailian traces + SWE-bench。

效果(仅论文数字)

指标数字
吞吐 vs FlashAccel FA-CSI最高 1.58×
吞吐 vs H3(高并发)最高 3.30×
TTFT geomean vs FA-CLI / FA-CSI1.20× / 1.33×
TPOT geomean vs FA-CLI / FA-CSI1.21× / 1.35×
TTFT / TPOT vs H322.65× / 1.89×
朴素全 HBF KV GC WAF(V4-Pro)≈ 30×(动机基线)

口径: 仿真吞吐/延迟,非硅实测 tok/s;基线含 H3、FlashAccel co-located/cascaded。

与 wiki 的关系

开放问题

  1. 更高并发 / 更长 agent 会话下窗口写回是否仍躲得过读热点。
  2. 与 Trillion 文的状态层膝点如何联合闭式供给。
  3. 真实 FTL/控制器固件开销未展开。

Citations

[1] arXiv PDF — Zhong et al., arXiv:2609.18675 [2] hbflex-flexible-memory-hbf-llm.md — 结构化摘录