深度神经网络(DNN)如今越来越多地部署在真实世界的视觉系统中,但后门攻击可以偷偷操纵这些模型的预测。攻击者会在训练或微调阶段植入某种触发器,使模型遇到带有该触发器的样本时产生目标误分类,同时模型在常规干净样本上的准确率依然很高,因此这类攻击极具隐蔽性。现有的多数防御手段都需要访问模型内部结构、依赖原始训练数据或有干净的验证样本,这在许多现实场景中并不现实,尤其是当防御者只能通过API对模型进行黑盒查询时,传统的防御方案往往难以落地。
针对这一挑战,研究人员提出了一种名为TRIM(Trigger Removal by Identifying Manipulated Regions,通过识别被操纵区域来清除触发器)的部署导向型黑盒防御方法。它的核心思路非常直观:先找出图像中导致模型行为异常的区域,然后只对这些可疑区域进行净化和修复,同时保留图像中其余正常的语义内容。TRIM不需要模型内部表示、不需要训练数据、也不依赖任何干净的参考样本,可以直接在推理阶段运行。
TRIM的实现由三个关键组件构成。第一是基于深度特征的区域分割,利用模型从图像中提取到的深层特征将图像划分成有意义的区域,而不是靠简单的像素级补丁检测;第二是自适应触发器发现,借助图像修复(inpainting)和基于扩散模型的重建技术,自动尝试遮挡或重建图像的局部区域,并观察模型预测的变化,从而锁定真正导致错误分类的触发区域。这个过程不预设触发器的类型、形状或位置,因此能够应对各种形式的攻击;第三是选择性区域净化,在准确识别出被污染区域后,仅对这些局部区域进行清洁处理,而保留图像中良性的内容,从而在防御攻击的同时尽量少地影响正常推理效果。
为了支持实际部署,TRIM还引入了一个实用的工程改进:它会缓存已经识别出的触发器的特征嵌入。当类似的触发器再次出现时,模型可以直接利用缓存快速识别,避免重复执行耗时的检测和净化计算。实验部分覆盖了多个常用数据集,并测试了混合型(blended)、稀疏型(sparse)、可变尺寸(varying-size)以及多个触发器同时出现等多种后门攻击类型。结果显示,TRIM在这些场景中均稳定地优于现有的黑盒防御方法,可以将攻击成功率(ASR)最低降低到1.16%,同时保持干净准确率最高达到87.87%。这组数据说明了即便防御者手中没有任何额外的辅助数据,也依然有机会在纯黑盒的推理接口上实现有效的后门缓解。
该论文由Ahmed Abdelnaby等作者于2026年9月2日提交至arXiv,编号为arXiv:2609.03139,研究领域涉及计算机视觉与模式识别(cs.CV)以及密码学与安全(cs.CR)。这项工作为黑盒场景下的后门防御提供了新的思路,尤其侧重真实部署中的可用性,未来可能会对AI模型上线前的安全评估和运行时监控产生积极影响。