AI News HubLIVE
サイト内リライト2 分で読了

3D FaceShell: VLM防御メカニズムとしての3Dフェースアバターにおける属性転送

研究者らは、3D顔アバターに微妙な摂動を加えて視覚言語モデル(VLM)が機密属性を推測するのを誤らせつつ、視覚的アイデンティティを保持するフレームワーク「3D FaceShell」を提案する。

ソースarXiv Computer Vision著者: Weston Bondurant, Srijan Das, Hieu Le, Stephanie Schuckers

フォトリアリスティックな3D顔アバターは、テレプレゼンス、アニメーション、パーソナライズドメディアなどのアプリケーションで再利用可能なデジタル資産として広く利用されるようになっている。これらのアバターは便利な一方で、新たなプライバシーの課題を生み出している。視覚言語モデル(VLM)は、微調整を必要とせずにレンダリング画像から機密属性(性別、年齢、人種など)を推論できるからである。一度3Dアバターが共有されると、そのレンダリング画像は常に解析され、高レベルの顔属性が抽出される可能性がある。

既存の防御策は主に2D画像空間で動作するが、3D顔表現のセマンティック操作には対応しておらず、多くの場合視覚品質を損なう。本研究では、3Dモデルからレンダリングされた顔に対するVLMの解釈を誘導しつつ、幾何学的忠実度と顔の同一性を保持するフレームワーク「3D FaceShell」を提案する。3D FaceShellは、元の3D表現に学習可能なガウスシェルを追加し、複数ビューの埋め込みアラインメントによって最適化された微妙で空間的に分散した摂動を生成する。これらの摂動は視覚的に目立たず、かつVLMベースの属性推論をビュー一貫性のある方法でリダイレクトするのに十分である。

再現された有名人の顔アバターと複数のブラックボックスVLM(CLIP、Flamingoなど)を用いた広範な実験により、3D FaceShellは高い知覚的類似性と同一性一貫性を維持しながら、属性注入率(VLMが指定された属性を誤って推論する割合)と属性不一致率(VLMの推論が真の属性と一致しない割合)を大幅に向上させることが実証された。人間の視覚評価では、摂動後のアバターは元のアバターとほぼ区別がつかないが、VLMによる機密属性の推論精度は著しく低下した。

この結果は、人間が認識可能な外観を損なうことなく、3D顔のVLMレベルのセマンティック解釈を操作できることを示している。3D FaceShellは、バーチャル会議、ソーシャルプラットフォーム、ゲームなど、アバターを長期にわたって使用するシナリオにおいて、3Dデジタル資産のプライバシー保護に新たな道を開く。将来的には、他の3D表現形式への拡張や、より広範な視覚推論攻撃への防御が期待される。