Tessera: Decoupling Logical Masks from GPU Execution for Dynamic Block-Sparse Attention

一句话结论

Tessera 把 BSA 的逻辑 mask与 GPU 物理 tile/任务组织解耦,并用剖析表低开销选型:在 2,315 真实 mask 与工业视频 DiT 上,BSA 请求最高 6.79×;HunyuanVideo 720p 的 50-step 环 1.22–2.08×。

动机

  • 视频 DiT 注意力占墙钟大部分;BSA 用逻辑块 mask 降算力,但 mask 随请求/头/层/去噪步变化。
  • 固定内核绑死逻辑几何 → 跨 mask/GPU 次优;编译式特化 → 准备开销吃掉收益。

方案

  1. 物理映射:Direct / 合并 / 细分逻辑块 → 物理 tile。
  2. 任务组织:tile 成任务,复用、并行、重叠搬运。
  3. Regime 表:离线剖析桶 → 在线查表;四代 NVIDIA 本地 CUDA catalog。

效果(仅论文数字)

指标数字
BSA 请求最高加速6.79×
vs FlashInfer / FlexAttention / flex-block-attngeomean 1.85–5.11× / 1.62–33.73× / 3.96×
四平台 vs 基线1.12–6.38×
HunyuanVideo 720p:attention / 50-step 环2.95–6.79× / 1.22–2.08×
消融:映射 / 组织vs Direct ≈1.38×;H100 组织 1.105×

口径: 视频 DiT BSA runtime(非 LLM 文本服务);工作负载与 SPLASH 的 LLM 稀疏×HBF 正交。

与 wiki 的关系

  • FlashAttention-3 / GPU SIMT — 稠密/稀疏执行层对照
  • SPLASH — LLM 稀疏×内存层次;本文是 GPU runtime×动态 mask
  • Vortex — 稀疏/压缩推理加速器侧对照

Citations

[1] arXiv PDF — Liu et al., NUS, arXiv:2609.25869 [2] raw stub