
📖标题:STEPQuant: When and Where Errors Matter in Delta-Rule Recurrent State Quantization🌐来源:arXiv, 2609.38169v1🛎️文章简介🔸研究问题:在使用线性注意力机制的大模型中,如何在不损失精度的前提下,对随并发请求增加而膨胀的固定大小循环状态进行低比特量化压缩?🔸主要贡献:论文提出了STEPQuant框架,通过时空联合量化策略,在6-bit精度下几乎无损地压缩循环状态,使服务总显存降低高达68.7%。📝重点思路🔸发现误差传播规律:论文指出直接均匀量化会导致严重精度下降,因为量化误差会在连续的Delta规则更新中累积。研究发现误差影响取决于两个维度:时间上,长寿命记忆中的误差会持续存在;空间上,不同Key行对输出误差的影响不同,且状态幅度在行列间差异巨大。🔸时间维度:生命周期感知位分配。根据量化误差的大小和记忆的持久性(由门控保留率决定)来分配精度。给那些误差大且留存时间长的单元分配更高精度,并在固定预算下优化整体失真,同时保留少量高风险单元为FP16作为锚点。🔸空间维度:Key行感知双轴拟合。针对状态矩阵在Key行和Value列方向均存在异常值的几何特性,提出分别拟合行和列的缩放因子。行缩放因子结合了当前幅度和该行对输出误差的影响权重,列缩放因子则在高影响行上赋予更大权重,从而更精细地适应空间分布。🔸系统实现优化:将STEPQuant集成到SGLang推理引擎中,设计了优化的GPU内核,融合状态重构、Delta更新和读取操作,并异步执行尺度拟合与写回,减少内存流量并提升计算效率。🔎分析总结🔸精度表现优异:在Qwen3.8-27B和Kimi-Linear-48B模型上,6-bit STEPQuant的准确率几乎与FP32基准持平,显著优于均匀INT8和INT6。即使在4-bit配置