深度神經網絡(DNN)如今越來越多地部署在真實世界的視覺系統中,但後門攻擊可以偷偷操縱這些模型的預測。攻擊者會在訓練或微調階段植入某種觸發器,使模型遇到帶有該觸發器的樣本時產生目標誤分類,同時模型在常規乾淨樣本上的準確率依然很高,因此這類攻擊極具隱蔽性。現有的多數防禦手段都需要訪問模型內部結構、依賴原始訓練數據或有乾淨的驗證樣本,這在許多現實場景中並不現實,尤其是當防禦者只能通過API對模型進行黑盒查詢時,傳統的防禦方案往往難以落地。
針對這一挑戰,研究人員提出了一種名為TRIM(Trigger Removal by Identifying Manipulated Regions,通過識別被操縱區域來清除觸發器)的部署導向型黑盒防禦方法。它的核心思路非常直觀:先找出圖像中導致模型行為異常的區域,然後只對這些可疑區域進行淨化和修復,同時保留圖像中其餘正常的語義內容。TRIM不需要模型內部表示、不需要訓練數據、也不依賴任何干淨的參考樣本,可以直接在推理階段運行。
TRIM的實現由三個關鍵組件構成。第一是基於深度特徵的區域分割,利用模型從圖像中提取到的深層特徵將圖像劃分成有意義的區域,而不是靠簡單的像素級補丁檢測;第二是自適應觸發器發現,藉助圖像修復(inpainting)和基於擴散模型的重建技術,自動嘗試遮擋或重建圖像的局部區域,並觀察模型預測的變化,從而鎖定真正導致錯誤分類的觸發區域。這個過程不預設觸發器的類型、形狀或位置,因此能夠應對各種形式的攻擊;第三是選擇性區域淨化,在準確識別出被污染區域後,僅對這些局部區域進行清潔處理,而保留圖像中良性的內容,從而在防禦攻擊的同時儘量少地影響正常推理效果。
為了支持實際部署,TRIM還引入了一個實用的工程改進:它會緩存已經識別出的觸發器的特徵嵌入。當類似的觸發器再次出現時,模型可以直接利用緩存快速識別,避免重複執行耗時的檢測和淨化計算。實驗部分覆蓋了多個常用數據集,並測試了混合型(blended)、稀疏型(sparse)、可變尺寸(varying-size)以及多個觸發器同時出現等多種後門攻擊類型。結果顯示,TRIM在這些場景中均穩定地優於現有的黑盒防禦方法,可以將攻擊成功率(ASR)最低降低到1.16%,同時保持乾淨準確率最高達到87.87%。這組數據説明了即便防禦者手中沒有任何額外的輔助數據,也依然有機會在純黑盒的推理接口上實現有效的後門緩解。
該論文由Ahmed Abdelnaby等作者於2026年9月2日提交至arXiv,編號為arXiv:2609.03139,研究領域涉及計算機視覺與模式識別(cs.CV)以及密碼學與安全(cs.CR)。這項工作為黑盒場景下的後門防禦提供了新的思路,尤其側重真實部署中的可用性,未來可能會對AI模型上線前的安全評估和運行時監控產生積極影響。