AI News HubLIVE
站内改写1 分钟阅读

Swin 与 EfficientNet 结合:面向 GAN 人脸取证的高效轻量架构

这篇论文针对 GAN 生成的合成人脸,提出并比较了多种轻量级 Swin Transformer 检测架构。作者利用包含 14 万张真实与合成人脸的基准数据集进行评估,结果显示结合 EfficientNet-B0 卷积特征与 Swin Transformer 的混合模型在测试集上达到 99% 的准确率和 99.44% 的召回率,同时保持了较低的计算开销。

来源arXiv Computer Vision作者: Sejuti Basu, Ashima Sood, Vijay Kumar, Sahil Sharma

生成对抗网络(GAN)、扩散模型和自回归生成模型现在可以创建与真实照片几乎无法区分的人脸图像。这种能力让数字伪造检测变得更加困难,也带来身份盗窃、诈骗和虚假信息传播等现实风险。虽然现有检测系统多依赖 CNN 或全局视觉 Transformer,本文专门针对 GAN 生成的合成人脸——许多以人脸为中心的深度伪造的核心——尝试仅通过图像分析实现高效识别。

论文指出,CNN 擅长捕捉纹理相关的局部特征,但在理解更广泛的上下文时存在局限;传统视觉 Transformer(ViT)能够有效建模长距离结构关系,却需要巨大的计算资源。为此,作者围绕 Swin Transformer 展开研究,测试了三种实现:一个从头训练的紧凑 Swin Transformer;使用 ImageNet-1K 预训练权重并对二分类任务进行微调的 Swin-Tiny 和 Swin-Small;以及一种将 EfficientNet-B0 的卷积处理与 Swin Transformer 后端结合的新型混合模型。

实验使用 140K Real and Fake Faces 数据集。该数据集包含 StyleGAN 生成的伪造人脸以及来自 Flickr 和 DFDC 的真实人脸图像,并划分了平衡的训练、验证和测试集。在 5000 张测试图像上,EfficientNetB0+Swin 混合模型取得了 99% 的准确率和 99.44% 的召回率,优于两个纯 Swin 变体,也优于该数据集上先前以 CNN 为主的基线方法。

论文作者认为,将 CNN 的层级特征与 Swin 的移动窗口自注意力结合,能够在保持较低计算需求的同时有效检测 GAN 生成的人脸。该研究以 arXiv:2609.01749v1 预印本形式发布,投稿时间为 2026 年 9 月 1 日,并在线上举行的国际会议 IICTDS 2025 上展示。论文共 12 页、含 2 幅图和 1 张表,会议论文集即将出版。