RR-Evict: Agentic 前缀缓存的细粒度轮转淘汰

一句话结论

Agent 多轮会 同步刷新 整条私有历史的 recency,使节点级 LRU 退化为「整智能体清空」;RR-Evict 对空闲轨迹 round-robin 淘汰尾块,保留更多可复用前缀。相对 LRU,P99 TTFT 最高 −75.4%,P99 未缓存 prompt token 最高 −65.7%(SGLang @ H100)。

动机

  • 长程 agent:工具/用户等待期间保留 prefix KV;并发升高后必须淘汰。
  • Recency synchronization:一次前缀匹配刷新整条路径节点,LRU 连续抽中最老空闲 agent 的几乎全部历史 → 回归时冷预填,尾部 TTFT 爆。
  • Fancy Eviction 显示生产轨迹上花哨策略难超 LRU;本文指出 agentic 访问节拍 让 LRU 自身失效,需要换分布目标而非更复杂预测。

对照 Ask the Tool、Memory Hierarchy and Cache、Disaggregated Inference。

方案

  1. 按 agent 轨迹分组;容量不足时 轮转访问 各空闲轨迹,每次淘汰一个 尾块(保连续有效前缀)。
  2. 无需预测到达或工具时延;可与 completion 生命周期信号分层(文中主结果不依赖预测)。
  3. 评测:SGLang;H100 NVLink。对话:Qwen3-Coder-30B-A3B @ τ²-bench(共置)。编码:Qwen3-8B @ SWE-bench,1P3D PD 解耦。基线 LRU 与 completion-aware LRU。

效果(仅论文数字)

指标数字
vs LRU(τ²-bench,摘要/正文)P99 TTFT 最高 −75.4%;P99 uncached prompt tokens 最高 −65.7%
vs LRU + Completion SignalsP99 TTFT 最高 −46.9%;P99 uncached 最高 −30.6%
场景共置对话 + PD 解耦编码(Fig.6 等,相对 LRU 归一化)

与 wiki 的关系

Citations

[1] arXiv PDF — Pan et al., arXiv:2609.32278 [2] raw stub