FlexPosit: Tunable Fractional Precision for LLM Inference Accelerators
Authors: Yimin Gao, Liangtao Dai, Jun Yin, Xinfei Guo, Mircea Stan Affiliation: University of Virginia; Shanghai Jiao Tong University arXiv: 2609.04724(2026-09-04,cs.AR) Venue: ASP-DAC 2027(预印本) PDF: arXiv PDF
把 LLM 量化的「分数位宽」做成可硬件调的时间参数:Posit 锥形精度 + channel-window 敏感度 MPQ + bit-serial 脉动阵列(GPCU 控精度窗)。对照 DNN Accelerator Systolic Dataflow:仍是脉动数据流,但精度在 4–8 bit 连续可调,追求 group-wise 精度与 channel-wise 规整的折中。
动机
- Group-wise 准但 per-PE rescale 面积大(文中 32×32 阵列 per-PE 缩放可抬核心面积 >30%);channel-wise 规整但低比特易崩。
- 现有加速器多停在离散 4/8-bit 模式,未暴露分数精度。
方案
- Posit(n,es) 量化与分布感知标定;敏感度排序升级 channel-window(虚拟精度如 4.1 b = 部分窗升到 5 b)。
- 架构: per-column SerialPosit decoder + 统一 PE + GPCU;4-way MAC cluster 缓解 bit-serial。
- 实现: Verilog RTL,商业 16 nm 综合;iso-area 对比 FP16 / BitMoD / OliVe。
效果(仅论文数字)
| 对比 | 结果 |
|---|---|
| vs BitMoD(group) | 最高约 1.8× 吞吐、1.2× 更低能耗 |
| vs OliVe(channel) | 约 1.5× 吞吐、2.0× 更低能耗 |
| (B=8, L=8192) vs FP16/BitMoD/OliVe | 加速 3.4× / 1.6× / 1.2×;能耗降 3.5× / 1.2× / 1.8× |
| PE 面积 | FlexPosit ≈ FP16 的 0.12×(118.2 µm²);iso-area 配 32×16 |
sub-5-bit 权重下接近 FP16 PPL。综合/仿真,非流片实测。
与 wiki 的关系
- DNN Accelerator Systolic Dataflow — 脉动/位串行精度轴
- Heterogeneous Inference — 边缘低比特推理加速器对照
- Mixed Precision Training — 训练侧混合精度对照(本文是推理 PTQ+加速器)
- CHIPSMORE — 另一条低能耗 LLM 推理硬件(CIM)
- LEAP — IMC/NoC 推理对照
开放问题
- 激活也走低比特 / KV cache 量化时,GPCU 时间窗如何与 attention 对齐?
- 更大模型(70B+)的敏感度剖析成本?
- 与真实 HBM/NoC 带宽耦合后,iso-area 吞吐优势还剩多少?
Citations
[1] arXiv PDF — Gao et al., arXiv:2609.04724 [2] flexposit-tunable-fractional-precision-llm.md — ingest stub