Swin と EfficientNet の融合:GANベース顔フォレンジックのための軽量アーキテクチャ
本論文は、GANが生成した合成顔(顔中心のディープフェイクの多くを支える)の検出に適した軽量な手法を調査する。コンパクト/事前学習済みの Swin Transformer と EfficientNet-B0+Swin ハイブリッドを 140K Real and Fake Faces データセット上で評価し、ハイブリッドモデルがテスト画像 5,000 枚で 99% の正解率と 99.44% の再現率を達成したことを示す。
GAN(敵対的生成ネットワーク)をはじめ、拡散モデルや自己回帰モデルといった最新の生成モデルは、本物の写真とほとんど区別がつかない顔画像を生み出せるようになった。そのため、偽造画像を見破ることはますます難しくなり、個人情報の盗用、詐欺、偽情報キャンペーンなどの深刻なリスクを生んでいる。本論文は、顔中心のディープフェイクの多くを支える GAN 生成の合成顔に焦点を当て、画像解析のみによる効率的な検出手法を探る。
従来の検出システムはCNNまたは大域的な Vision Transformer(ViT)に大きく依存している。CNN はテクスチャの局所特徴を識別するのが得意な一方で、より広い文脈の理解には弱い。一方、従来型 ViT は長距離構造の把握には優れるものの、計算資源を多く消費する。そこで著者らは Swin Transformer ベースのアーキテクチャを 3 種類検討した。1 つ目はスクラッチから学習したコンパクトな Swin Transformer、2 つ目は ImageNet-1K で事前学習した Swin-Tiny と Swin-Small を二値分類用に微調整したモデル、3 つ目は EfficientNet-B0 の畳み込み処理と Swin Transformer を組み合わせた新しいハイブリッドモデルである。
評価には 140K Real and Fake Faces データセットを使用した。このデータセットには、StyleGAN が生成した偽の顔と、Flickr および DFDC 由来の本物の顔画像が含まれ、学習・検証・テスト用にバランスよく分割されている。5,000 枚のテスト画像において、EfficientNetB0+Swin ハイブリッドは 99% の正解率と 99.44% の再現率を達成し、Swin Transformer 単体の各変種と、このデータセットで先行する CNN のみのベースラインを上回った。
結果は、階層的な CNN 特徴量とシフト窓付き自己注意(shifted-window self-attention)を組み合わせることで、計算量を抑えつつ GAN 生成の合成顔を効率的に検出できることを示唆している。本論文は 12 ページ・図 2 点・表 1 点から成り、オンライン開催された国際会議 IICTDS 2025 で発表された。プレプリントは arXiv:2609.01749v1 として 2026 年 9 月 1 日に投稿されており、会議録が近刊予定である。