实现轻量级检测变压器的全整数推理
本文提出了I-LW-DETR,首个完全整数运算的轻量级DETR,解决了视觉Transformer检测器在NPU和微控制器上部署的难题,通过三种关键组件实现模型大小减少3.6倍,计算成本降低超过一个数量级,精度损失适中。
视觉Transformer(ViT)检测器在精度上已接近卷积神经网络(CNN),但关键组件如可变形注意力、特征融合和非线性激活函数天然与整数算术不兼容,导致在NPU和微控制器上部署困难。现有量化检测器要么保留Softmax、GELU和LayerNorm等浮点算子,要么聚焦于重型骨干网络,使得轻量级检测Transformer缺乏端到端的整数实现,限制了其在资源受限设备上的应用。
针对这一空白,研究团队提出了I-LW-DETR——首个完全整数运算的轻量级DETR(Detection Transformer)。在前向传播中,包括Transformer非线性操作在内的每一个步骤都使用整数算术执行,无需任何浮点或混合精度操作。I-LW-DETR基于三个关键组件构建:
- 尺度保持分裂卷积(Scale-preserving Split Convolution):为多尺度投影仪的每个分支分配独立的激活尺度,确保在整数运算中保持特征表示的准确性。
- SD-ShiftGELU(Sign-Dependent ShiftGELU):一种符号相关的GELU近似,通过元素级移位操作模拟GELU非线性,避免传统近似带来的精度下降。
- 约束Shiftmax(Constrained Shiftmax):一种整数友好的Softmax替代方案,通过约束移位操作维持稳定的归一化输出。
实验在多个模型规模(如LW-DETR的tiny、small和medium变体)上验证了所提量化流水线的有效性。与全精度基线相比,I-LW-DETR在仅带来中等精度损失(如mAP下降不超过1-2个百分点)的前提下,将模型大小减少了约3.6倍,计算成本降低了一个数量级以上。例如,在LW-DETR-tiny上,全整数模型在COCO val2017上达到42.1%的mAP,而原始全精度模型为44.0%。
这项成果的关键意义在于,它首次实现了轻量级检测Transformer的完全整数推理,使得这些模型可以直接部署在不支持浮点运算的NPU和微控制器上。这对于边缘计算、物联网和嵌入式视觉应用具有重要意义,因为在这些场景中,硬件资源极端有限,而整数算术运算效率高、功耗低。此外,I-LW-DETR的设计原则——将非线性算子替换为整数兼容近似——可推广到其他Transformer架构,为更广泛的模型量化提供新思路。
论文于2026年7月27日提交至arXiv,作者包括Thanh Cong Le等人。该工作有望推动视觉Transformer在资源受限设备上的实际部署,并为未来轻量级模型的设计提供参考。