Diff-ID: 拡散モデルによるアイデンティティ一貫性のある顔画像生成とモーフィング
研究者らは、アイデンティティ一貫性のある顔画像を生成するための拡散ベースフレームワークDiff-IDを提案する。ArcFaceとCLIPの埋め込みを統合し、フォトリアリズムを維持しながらアイデンティティを保持し、モーフィングパイプラインを含む。本手法は、アイデンティティ類似度と画質の間で優れたトレードオフを達成する。
近年、生成拡散モデルは顔画像合成に革命をもたらしたが、高解像度出力におけるロバストなアイデンティティ保存は依然として重要な課題である。この問題は、セキュリティシステム、生体認証、プライバシーに敏感なアプリケーションにおいて特に重要であり、アイデンティティの完全性のわずかなずれも信頼と機能性を損なう可能性がある。そこで、本研究ではアイデンティティ一貫性を強制しつつフォトリアリスティックな品質を実現する拡散ベースのフレームワークDiff-IDを提案する。
Diff-IDの中核は、CelebA-HQ、FFHQ、LAION-Faceから合成されたカスタムの21万画像データセットであり、微調整されたBLIPモデルによってキャプションが付与され、トレーニング中のアイデンティティ認識が強化されている。ArcFaceとCLIPの埋め込みは、微調整されたStable Diffusion UNet内のデュアルクロスアテンションアダプタを介して統合される。さらに、アイデンティティ忠実度を強化するために、指数時間ステップ重み付けを用いたArcFaceコサイン類似度に基づく擬似識別器損失を提案する。
保持された顔と未見の顔に対する実験では、Diff-IDは生のArcFace顔類似度でInstantIDを超えないものの、大幅に低いFIDを達成し、評価手法の中でFIQに基づく最良のアイデンティティ-リアリズムトレードオフを示した。FIQはアイデンティティ類似度と知覚的リアリズムを組み合わせた補完的な比率スコアである。また、統一されたDDIMベースのモーフィングパイプラインを提示し、アイデンティティごとの微調整なしで定性的な顔の補間を可能にする。
研究チームは、アイデンティティ保存とフォトリアリズムは個別ではなく共同で評価されるべきであり、高いアイデンティティ類似度だけではリアルな出力を保証しないと主張している。このトレードオフを明確にするために、FSとFIDを主要指標としながら、FIQを補完的な指標として報告している。本研究成果は、安全認証、エンターテインメントメディア、プライバシー保護など様々な分野での応用が期待される。