AI News HubLIVE
站内改写1 分钟阅读

3D FaceShell:3D面部头像中的属性转移作为VLM防御机制

研究人员提出3D FaceShell框架,通过向3D面部头像添加微妙扰动来误导视觉语言模型推断敏感属性,同时保持视觉身份不变。

来源arXiv Computer Vision作者: Weston Bondurant, Srijan Das, Hieu Le, Stephanie Schuckers

随着3D面部头像在远程呈现、动画和个性化媒体等领域的广泛应用,其隐私保护问题日益突出。这些头像作为可重复使用的数字资产,带来了便利,但也带来了新的风险:视觉语言模型(VLM)能够无需微调,直接从渲染图像中推断出敏感的面部属性,如性别、年龄、种族等。这种能力构成了新的隐私威胁,因为一旦3D头像被共享,任何渲染图都可能被分析以提取高级面部特征。

传统的防御方法大多在2D图像空间操作,例如添加对抗性扰动或进行图像模糊,但这些方法无法解决3D面部表示的语义操纵问题,且往往破坏视觉质量。为了解决这一问题,研究团队提出了3D FaceShell框架,旨在引导VLM对3D模型渲染的面部图像的解释,同时保持几何保真度和面部身份。该框架的核心思想是在原始3D表示上添加一个可学习的高斯壳,产生细微的、空间分布均匀的扰动。这些扰动通过多视图嵌入对齐进行优化,确保在视觉上不易察觉,同时能够在视图一致的情况下重定向VLM的属性推断。

研究者在重建的名人头像和多个黑盒VLM(如CLIP、Flamingo等)上进行了广泛实验。结果表明,3D FaceShell显著提高了属性注入率(即VLM错误地推断出预设属性的比例)和属性失配率(即VLM推断出的属性与真实属性不一致的比例),同时保持了高感知相似度和身份一致性。量化指标显示,扰动后的头像与原始头像在人类视觉评估中几乎没有差异,但VLM对敏感属性的推断准确率大幅下降。

这项工作表明,在不损害人类可识别外观的前提下,操纵VLM对3D面部的语义解释是可行的。3D FaceShell为3D数字资产的隐私保护提供了全新思路,尤其适用于需要长期使用头像的场景,如虚拟会议、社交平台和游戏。未来,该技术可进一步扩展到其他3D表示形式,甚至用于防御更广泛的视觉推理攻击。