SpecLA: 线性注意力模型的高效推测解码
本文提出了 SpecLA,一种针对有状态线性注意力模型的推测解码运行时。它通过拓扑感知内核验证链和树,存储验证过程中产生的紧凑因子以恢复接受状态,并使用置信剪枝和目标对齐的EAGLE风格草案生成器提供有用候选。在NVIDIA H100上使用公共GDN-1.3B目标,SpecLA实现了比自回归解码高达1.70倍的端到端加速。
线性注意力模型(如Mamba、RWKV等)通过引入循环状态来替代Transformer中不断增长的键值(KV)缓存,从而大幅降低了长序列推理过程中的内存占用。然而,这类模型的自回归解码过程仍然需要逐令牌地读取、更新和写入这些状态,导致推理速度受到串行计算瓶颈的限制。推测解码(Speculative Decoding)是一种通过并行验证多个草拟令牌来加速自回归解码的有效技术,但现有的推测解码系统均针对Transformer的KV缓存结构设计,无法直接应用于具有状态依赖的线性注意力模型。其核心挑战在于:验证过程必须遵循循环依赖关系,仅更新被接受的轨迹;同时,草案生成器需要避免提交无效候选,以免浪费宝贵的验证资源。
针对这些问题,研究团队(Zhibin Wang等7位作者)在2026年7月提交的论文中提出了SpecLA——一个专为有状态线性注意力模型设计的推测解码运行时。SpecLA通过拓扑感知的GPU内核高效地验证链状和树状的候选序列,在验证过程中存储紧凑的因子表示以恢复被接受的状态,并采用置信度剪枝策略结合目标对齐的EAGLE风格草案生成器,为验证器提供高质量的候选。实验在NVIDIA H100 GPU上进行,使用公开的GDN-1.3B模型作为目标。结果表明,SpecLA实现了高达1.70倍的端到端加速比,且不牺牲生成质量。这一工作为线性注意力模型的高效推理提供了新的解决方案,有望推动其在实时交互式应用中的部署,例如聊天机器人和代码生成等场景。
SpecLA的创新之处在于其拓扑感知的验证内核,能够高效处理链状和树状的候选依赖关系,这在以往的推测解码系统中未曾涉及。此外,通过存储验证过程中产生的紧凑因子,SpecLA可以在接受候选后快速恢复最新的状态,避免了昂贵的完整序列重新计算。置信度剪枝机制则过滤掉低质量的草案候选,确保了验证资源的有效利用。该研究目前以arXiv预印本形式发布(arXiv:2607.16673),属于计算与语言(cs.CL)领域,未来有望扩展到更大规模的模型和不同的硬件平台。