Diff-ID: 基于扩散模型的身份一致性人脸图像生成与变形
研究人员提出了Diff-ID,一种基于扩散模型的框架,用于生成身份一致的人脸图像。它集成了ArcFace和CLIP嵌入,在保持逼真度的同时确保身份一致性,并包含一个变形管线。该方法在身份相似度和图像质量之间取得了良好的平衡。
近年来,生成式扩散模型在面部图像合成领域取得了革命性进展,但在高分辨率输出中保持身份一致性仍然是一个关键挑战。这一问题在安全系统、生物特征认证和隐私敏感应用中尤为突出,因为身份完整性的任何偏差都可能削弱信任和功能性。针对这一挑战,研究人员提出了Diff-ID,一个基于扩散的框架,旨在强制身份一致性同时提供逼真的图像质量。
Diff-ID的核心是一个定制的21万图像数据集,该数据集从CelebA-HQ、FFHQ和LAION-Face中合成。为了增强训练过程中的身份意识,研究团队使用微调的BLIP模型为这些图像生成字幕。框架通过一个双重交叉注意力适配器将ArcFace和CLIP嵌入集成到微调的Stable Diffusion UNet中,从而在生成过程中保持身份特征。为了进一步强化身份保真度,研究团队提出了一种基于ArcFace余弦相似度的伪判别器损失,并采用指数时间步加权,以在训练中更关注难以区分的样本。
在留出和未见人脸上的实验表明,尽管Diff-ID在原始ArcFace人脸相似度上未超过InstantID,但它实现了显著更低的FID(Fréchet Inception Distance),这表明生成图像的整体质量更高。更重要的是,Diff-ID在基于FIQ(人脸图像质量)的身份-逼真度权衡中表现最佳,FIQ是一个结合了身份相似度和感知逼真度的综合评分。此外,研究人员还展示了一个统一的基于DDIM的变形管线,无需每身份微调即可实现定性的面部插值,扩展了框架的应用场景。
该研究强调,身份保持和逼真度应该被联合评估,而不是孤立进行,因为高身份相似度本身并不能保证逼真输出。为了明确这一权衡,他们报告了FIQ作为补充比率得分,同时保持FS和FID作为主要指标。这一工作为身份一致性人脸生成提供了新的基准,并对安全认证、娱乐媒体和隐私保护等领域具有重要影响。