對抗性風格優化:基於GRPO的風格觸發優化增強視覺語言模型越獄攻擊
研究人員發現多模態大語言模型(MLLMs)在內容理解與安全防禦之間存在“風格不一致性”:模型能穩健理解任何視覺風格的內容,但防禦機制易被特定風格觸發繞過。基於此,他們提出對抗性風格優化(ASO),一種即插即用模塊,通過GRPO代理微調圖像編輯模型,疊加優化的風格修改以放大現有視覺越獄攻擊。實驗表明ASO顯著提升了最先進攻擊的攻擊成功率(ASR),證實了風格偏差是紅隊測試MLLMs的可擴展向量。論文已被CVPR 2026接收為口頭報告。
多模態大語言模型(MLLMs)在視覺理解和推理方面取得了顯著進展,但其安全性對齊仍然面臨越獄攻擊的威脅。現有基於內容的越獄方法往往不一致,且對快速演進的MLLMs表現不佳,未能利用非內容層面的漏洞。與傳統研究不同,來自Bingjun Luo等人的團隊通過實證發現,MLLMs在理解能力與安全能力之間存在一種“風格不一致性”:模型能夠穩健地理解任何視覺風格下的內容,但其防禦機制卻容易被特定的風格觸發器繞過。
基於這一發現,研究人員提出了對抗性風格優化(Adversarial Style Optimization, ASO),這是一種即插即用的增強模塊,旨在放大現有的視覺越獄攻擊。ASO通過微調一個圖像編輯模型,將經過優化的風格修改疊加到給定的對抗性圖像上。該優化過程由一個基於組相對策略優化(Group Relative Policy Optimization, GRPO)的代理驅動,並輔以分層獎勵函數(Structurally-Tiered Reward Function)。該獎勵函數結合了用於檢測顯式拒絕的logit信號和來自強大評判模型的高保真語義評估。具體而言,ASO首先選擇一個基礎對抗性圖像,然後通過GRPO訓練一個風格編輯器,使其在保持圖像內容不變的前提下,施加能夠最大化繞過目標MLLM防禦的風格擾動。分層獎勵函數確保優化過程既避免直接拒絕(通過logit信號),又保持語義一致性(通過評判模型)。
大量實驗在多個主流MLLM(如LLaVA、Qwen-VL、MiniGPT-4)上進行,涵蓋了不同的視覺越獄基線方法。結果表明,ASO顯著提升了這些攻擊的攻擊成功率(Attack Success Rate, ASR),在某些情況下提升了超過30個百分點。此外,ASO的增強效果具有可遷移性,即針對一個模型優化的風格觸發器也能有效攻擊其他模型,這進一步證明了風格偏差是一種可擴展的紅隊測試向量。研究人員還分析了風格觸發器的特性,發現某些視覺風格(如“油畫”或“素描”)特別有效,且風格擾動幅度微小,不易被察覺。
該工作不僅揭示了MLLMs安全機制的新弱點,也為未來的防禦研究提供了方向。論文代碼已開源,並已被CVPR 2026接收為口頭報告。這一發現在學術界和工業界引發了廣泛關注,因為它指出了當前安全對齊中的一個根本性盲點:模型的內容理解和安全防禦在風格維度上存在不對稱性。未來,研究團隊計劃探索基於風格的防禦方法,以及如何將ASO擴展到更多模態。