对抗性风格优化:基于GRPO的风格触发优化增强视觉语言模型越狱攻击
研究人员发现多模态大语言模型(MLLMs)在内容理解与安全防御之间存在“风格不一致性”:模型能稳健理解任何视觉风格的内容,但防御机制易被特定风格触发绕过。基于此,他们提出对抗性风格优化(ASO),一种即插即用模块,通过GRPO代理微调图像编辑模型,叠加优化的风格修改以放大现有视觉越狱攻击。实验表明ASO显著提升了最先进攻击的攻击成功率(ASR),证实了风格偏差是红队测试MLLMs的可扩展向量。论文已被CVPR 2026接收为口头报告。
多模态大语言模型(MLLMs)在视觉理解和推理方面取得了显著进展,但其安全性对齐仍然面临越狱攻击的威胁。现有基于内容的越狱方法往往不一致,且对快速演进的MLLMs表现不佳,未能利用非内容层面的漏洞。与传统研究不同,来自Bingjun Luo等人的团队通过实证发现,MLLMs在理解能力与安全能力之间存在一种“风格不一致性”:模型能够稳健地理解任何视觉风格下的内容,但其防御机制却容易被特定的风格触发器绕过。
基于这一发现,研究人员提出了对抗性风格优化(Adversarial Style Optimization, ASO),这是一种即插即用的增强模块,旨在放大现有的视觉越狱攻击。ASO通过微调一个图像编辑模型,将经过优化的风格修改叠加到给定的对抗性图像上。该优化过程由一个基于组相对策略优化(Group Relative Policy Optimization, GRPO)的代理驱动,并辅以分层奖励函数(Structurally-Tiered Reward Function)。该奖励函数结合了用于检测显式拒绝的logit信号和来自强大评判模型的高保真语义评估。具体而言,ASO首先选择一个基础对抗性图像,然后通过GRPO训练一个风格编辑器,使其在保持图像内容不变的前提下,施加能够最大化绕过目标MLLM防御的风格扰动。分层奖励函数确保优化过程既避免直接拒绝(通过logit信号),又保持语义一致性(通过评判模型)。
大量实验在多个主流MLLM(如LLaVA、Qwen-VL、MiniGPT-4)上进行,涵盖了不同的视觉越狱基线方法。结果表明,ASO显著提升了这些攻击的攻击成功率(Attack Success Rate, ASR),在某些情况下提升了超过30个百分点。此外,ASO的增强效果具有可迁移性,即针对一个模型优化的风格触发器也能有效攻击其他模型,这进一步证明了风格偏差是一种可扩展的红队测试向量。研究人员还分析了风格触发器的特性,发现某些视觉风格(如“油画”或“素描”)特别有效,且风格扰动幅度微小,不易被察觉。
该工作不仅揭示了MLLMs安全机制的新弱点,也为未来的防御研究提供了方向。论文代码已开源,并已被CVPR 2026接收为口头报告。这一发现在学术界和工业界引发了广泛关注,因为它指出了当前安全对齐中的一个根本性盲点:模型的内容理解和安全防御在风格维度上存在不对称性。未来,研究团队计划探索基于风格的防御方法,以及如何将ASO扩展到更多模态。