AI News HubLIVE
站内改写2 分钟阅读

基于分割引导的空间索引实现可泛化且可解释的深度伪造检测

提出一种分割引导的空间索引方法,通过语义选择面部区域补丁(而非整体特征)进行深度伪造检测,在Celeb-DF v2上达到0.905 AUC,优于现有方法,且无需微调或目标域数据。

来源arXiv Computer Vision作者: Izaldein Al-Zyoud, Abdulmotaleb El Saddik

深度伪造检测技术面临两大核心挑战:泛化性(在未见过的伪造方法上仍能有效检测)和可解释性(让检测结果能够被人类理解)。现有的主流方法通常采用“先池化后分类”的流程:将人脸图像分割成多个补丁令牌,通过Transformer编码器提取所有令牌的特征,然后将所有令牌的特征池化成一个全局特征,最后基于该全局特征进行分类。然而,这种设计会稀释与伪造操作相关的局部证据,因为全局池化将来自不同面部区域的信息混合在一起,使得关键操作痕迹被大量无关信号掩盖。

来自渥太华大学的研究人员提出了一种全新的范式——分割引导的空间索引(Segmentation-Guided Spatial Indexing),该方法彻底反转了标准流程。其核心思想是:先利用语义分割技术选择与人脸操作最相关的区域补丁令牌,例如嘴部、眼部等,然后仅对所选区域进行池化和分类。具体实现中,作者使用一个冻结的FaRL(Facial Attribute Recognition and Localization)解析器,为DINOv3 ViT-L/16模型生成的每个补丁令牌分配语义标签,丢弃非目标区域的令牌,最后通过一个线性探针对保留的令牌进行分类决策。

这种空间索引机制巧妙地利用了DINOv3模型的内在特性:DINOv3在预训练过程中自发地学习到了补丁级别的空间一致性,这一性质正是其能够实现涌现分割(emergent segmentation)的基础。通过空间索引,线性探针可以专注于一个更加纯净的局部子空间,其中与操作相关的证据受到全脸线索的干扰大大降低。更重要的是,区域归因是结构性的:当嘴部模型预测为假时,决策仅基于嘴部令牌,而不是像传统方法那样依赖叠加的显著性图,这提供了天然的可解释性。

实验结果表明,该方法在标准深度伪造检测基准Celeb-DF v2上取得了卓越性能。嘴部索引的线性探针实现了0.905的AUC,分别比LipForensics和Xception高出8.1个百分点和16.9个百分点。值得注意的是,这一性能是在完全不微调DINOv3和FaRL模型、且不使用任何目标域数据的情况下取得的,展现了极强的泛化能力。消融实验进一步揭示了方法的机制:如果使用DINOv3的[CLS]令牌替代区域选择,AUC会骤降26.4个百分点;如果用FaRL特征替代DINOv3特征,AUC会下降20.9个百分点。这充分说明DINOv3的自监督表示和空间索引机制两者对于最终性能都是独立且必要的,单独使用其中任何一个都无法接近完整系统的效果。

这项工作为深度伪造检测领域提供了一条新的技术路径:通过结构化的区域选择来提升泛化性和可解释性,而不必依赖复杂的训练流程或外部数据。未来,该方法可望被集成到现有的检测管道中,或者作为预处理的筛选模块,从而在实际部署中提高检测系统的鲁棒性和可信度。