AI News HubLIVE
站內改寫1 分鐘閱讀

Diff-ID: 基於擴散模型的身份一致性人臉影像生成與變形

研究人員提出了Diff-ID,一種基於擴散模型的框架,用於生成身份一致的人臉影像。它整合了ArcFace和CLIP嵌入,在保持逼真度的同時確保身份一致性,幷包含一個變形管線。該方法在身份相似度和影像質量之間取得了良好的平衡。

來源arXiv Computer Vision作者: Taimoor Rizwan, Sara Atito, Muhammad Awais, Zhenhua Feng, Josef Kittler

近年來,生成式擴散模型在面部影像合成領域取得了革命性進展,但在高解析度輸出中保持身份一致性仍然是一個關鍵挑戰。這一問題在安全系統、生物特徵認證和隱私敏感應用中尤為突出,因為身份完整性的任何偏差都可能削弱信任和功能性。針對這一挑戰,研究人員提出了Diff-ID,一個基於擴散的框架,旨在強制身份一致性同時提供逼真的影像質量。

Diff-ID的核心是一個定製的21萬影像資料集,該資料集從CelebA-HQ、FFHQ和LAION-Face中合成。為了增強訓練過程中的身份意識,研究團隊使用微調的BLIP模型為這些影像生成字幕。框架透過一個雙重交叉注意力介面卡將ArcFace和CLIP嵌入整合到微調的Stable Diffusion UNet中,從而在生成過程中保持身份特徵。為了進一步強化身份保真度,研究團隊提出了一種基於ArcFace餘弦相似度的偽判別器損失,並採用指數時間步加權,以在訓練中更關注難以區分的樣本。

在留出和未見人臉上的實驗表明,儘管Diff-ID在原始ArcFace人臉相似度上未超過InstantID,但它實現了顯著更低的FID(Fréchet Inception Distance),這表明生成影像的整體質量更高。更重要的是,Diff-ID在基於FIQ(人臉影像質量)的身份-逼真度權衡中表現最佳,FIQ是一個結合了身份相似度和感知逼真度的綜合評分。此外,研究人員還展示了一個統一的基於DDIM的變形管線,無需每身份微調即可實現定性的面部插值,擴充套件了框架的應用場景。

該研究強調,身份保持和逼真度應該被聯合評估,而不是孤立進行,因為高身份相似度本身並不能保證逼真輸出。為了明確這一權衡,他們報告了FIQ作為補充比率得分,同時保持FS和FID作為主要指標。這一工作為身份一致性人臉生成提供了新的基準,並對安全認證、娛樂媒體和隱私保護等領域具有重要影響。