Swin 與 EfficientNet 結合:面向 GAN 人臉取證的高效輕量架構
這篇論文針對 GAN 生成的合成人臉,提出並比較了多種輕量級 Swin Transformer 檢測架構。作者利用包含 14 萬張真實與合成人臉的基準資料集進行評估,結果顯示結合 EfficientNet-B0 卷積特徵與 Swin Transformer 的混合模型在測試集上達到 99% 的準確率和 99.44% 的召回率,同時保持了較低的計算開銷。
生成對抗網路(GAN)、擴散模型和自迴歸生成模型現在可以建立與真實照片幾乎無法區分的人臉影像。這種能力讓數字偽造檢測變得更加困難,也帶來身份盜竊、詐騙和虛假資訊傳播等現實風險。雖然現有檢測系統多依賴 CNN 或全域性視覺 Transformer,本文專門針對 GAN 生成的合成人臉——許多以人臉為中心的深度偽造的核心——嘗試僅透過影像分析實現高效識別。
論文指出,CNN 擅長捕捉紋理相關的區域性特徵,但在理解更廣泛的上下文時存在侷限;傳統視覺 Transformer(ViT)能夠有效建模長距離結構關係,卻需要巨大的計算資源。為此,作者圍繞 Swin Transformer 展開研究,測試了三種實現:一個從頭訓練的緊湊 Swin Transformer;使用 ImageNet-1K 預訓練權重並對二分類任務進行微調的 Swin-Tiny 和 Swin-Small;以及一種將 EfficientNet-B0 的卷積處理與 Swin Transformer 後端結合的新型混合模型。
實驗使用 140K Real and Fake Faces 資料集。該資料集包含 StyleGAN 生成的偽造人臉以及來自 Flickr 和 DFDC 的真實人臉影像,並劃分了平衡的訓練、驗證和測試集。在 5000 張測試影像上,EfficientNetB0+Swin 混合模型取得了 99% 的準確率和 99.44% 的召回率,優於兩個純 Swin 變體,也優於該資料集上先前以 CNN 為主的基線方法。
論文作者認為,將 CNN 的層級特徵與 Swin 的移動視窗自注意力結合,能夠在保持較低計算需求的同時有效檢測 GAN 生成的人臉。該研究以 arXiv:2609.01749v1 預印本形式釋出,投稿時間為 2026 年 9 月 1 日,並線上上舉行的國際會議 IICTDS 2025 上展示。論文共 12 頁、含 2 幅圖和 1 張表,會議論文集即將出版。