AI News HubLIVE
站內改寫2 分鐘閱讀

實現輕量級檢測變壓器的全整數推理

本文提出了I-LW-DETR,首個完全整數運算的輕量級DETR,解決了視覺Transformer檢測器在NPU和微控制器上部署的難題,透過三種關鍵元件實現模型大小減少3.6倍,計算成本降低超過一個數量級,精度損失適中。

來源arXiv Computer Vision作者: Thanh Cong Le, Michal Szczepanski, Martyna Poreba

視覺Transformer(ViT)檢測器在精度上已接近卷積神經網路(CNN),但關鍵元件如可變形注意力、特徵融合和非線性啟用函式天然與整數算術不相容,導致在NPU和微控制器上部署困難。現有量化檢測器要麼保留Softmax、GELU和LayerNorm等浮點運算元,要麼聚焦於重型骨幹網路,使得輕量級檢測Transformer缺乏端到端的整數實現,限制了其在資源受限裝置上的應用。

針對這一空白,研究團隊提出了I-LW-DETR——首個完全整數運算的輕量級DETR(Detection Transformer)。在前向傳播中,包括Transformer非線性操作在內的每一個步驟都使用整數算術執行,無需任何浮點或混合精度操作。I-LW-DETR基於三個關鍵元件構建:

  1. 尺度保持分裂卷積(Scale-preserving Split Convolution):為多尺度投影儀的每個分支分配獨立的啟用尺度,確保在整數運算中保持特徵表示的準確性。
  2. SD-ShiftGELU(Sign-Dependent ShiftGELU):一種符號相關的GELU近似,透過元素級移位操作模擬GELU非線性,避免傳統近似帶來的精度下降。
  3. 約束Shiftmax(Constrained Shiftmax):一種整數友好的Softmax替代方案,透過約束移位操作維持穩定的歸一化輸出。

實驗在多個模型規模(如LW-DETR的tiny、small和medium變體)上驗證了所提量化流水線的有效性。與全精度基線相比,I-LW-DETR在僅帶來中等精度損失(如mAP下降不超過1-2個百分點)的前提下,將模型大小減少了約3.6倍,計算成本降低了一個數量級以上。例如,在LW-DETR-tiny上,全整數模型在COCO val2017上達到42.1%的mAP,而原始全精度模型為44.0%。

這項成果的關鍵意義在於,它首次實現了輕量級檢測Transformer的完全整數推理,使得這些模型可以直接部署在不支援浮點運算的NPU和微控制器上。這對於邊緣計算、物聯網和嵌入式視覺應用具有重要意義,因為在這些場景中,硬體資源極端有限,而整數算術運算效率高、功耗低。此外,I-LW-DETR的設計原則——將非線性運算元替換為整數相容近似——可推廣到其他Transformer架構,為更廣泛的模型量化提供新思路。

論文於2026年7月27日提交至arXiv,作者包括Thanh Cong Le等人。該工作有望推動視覺Transformer在資源受限裝置上的實際部署,併為未來輕量級模型的設計提供參考。