AI News HubLIVE
站內改寫2 分鐘閱讀

對抗性風格最佳化:基於GRPO的風格觸發最佳化增強視覺語言模型越獄攻擊

研究人員發現多模態大語言模型(MLLMs)在內容理解與安全防禦之間存在“風格不一致性”:模型能穩健理解任何視覺風格的內容,但防禦機制易被特定風格觸發繞過。基於此,他們提出對抗性風格最佳化(ASO),一種即插即用模組,透過GRPO代理微調影像編輯模型,疊加最佳化的風格修改以放大現有視覺越獄攻擊。實驗表明ASO顯著提升了最先進攻擊的攻擊成功率(ASR),證實了風格偏差是紅隊測試MLLMs的可擴充套件向量。論文已被CVPR 2026接收為口頭報告。

來源arXiv Computational Linguistics作者: Bingjun Luo, Jialin Guo, Yue Yao, Xinpeng Ding

多模態大語言模型(MLLMs)在視覺理解和推理方面取得了顯著進展,但其安全性對齊仍然面臨越獄攻擊的威脅。現有基於內容的越獄方法往往不一致,且對快速演進的MLLMs表現不佳,未能利用非內容層面的漏洞。與傳統研究不同,來自Bingjun Luo等人的團隊透過實證發現,MLLMs在理解能力與安全能力之間存在一種“風格不一致性”:模型能夠穩健地理解任何視覺風格下的內容,但其防禦機制卻容易被特定的風格觸發器繞過。

基於這一發現,研究人員提出了對抗性風格最佳化(Adversarial Style Optimization, ASO),這是一種即插即用的增強模組,旨在放大現有的視覺越獄攻擊。ASO透過微調一個影像編輯模型,將經過最佳化的風格修改疊加到給定的對抗性影像上。該最佳化過程由一個基於組相對策略最佳化(Group Relative Policy Optimization, GRPO)的代理驅動,並輔以分層獎勵函式(Structurally-Tiered Reward Function)。該獎勵函式結合了用於檢測顯式拒絕的logit訊號和來自強大評判模型的高保真語義評估。具體而言,ASO首先選擇一個基礎對抗性影像,然後透過GRPO訓練一個風格編輯器,使其在保持影像內容不變的前提下,施加能夠最大化繞過目標MLLM防禦的風格擾動。分層獎勵函式確保最佳化過程既避免直接拒絕(透過logit訊號),又保持語義一致性(透過評判模型)。

大量實驗在多個主流MLLM(如LLaVA、Qwen-VL、MiniGPT-4)上進行,涵蓋了不同的視覺越獄基線方法。結果表明,ASO顯著提升了這些攻擊的攻擊成功率(Attack Success Rate, ASR),在某些情況下提升了超過30個百分點。此外,ASO的增強效果具有可遷移性,即針對一個模型最佳化的風格觸發器也能有效攻擊其他模型,這進一步證明了風格偏差是一種可擴充套件的紅隊測試向量。研究人員還分析了風格觸發器的特性,發現某些視覺風格(如“油畫”或“素描”)特別有效,且風格擾動幅度微小,不易被察覺。

該工作不僅揭示了MLLMs安全機制的新弱點,也為未來的防禦研究提供了方向。論文程式碼已開源,並已被CVPR 2026接收為口頭報告。這一發現在學術界和工業界引發了廣泛關注,因為它指出了當前安全對齊中的一個根本性盲點:模型的內容理解和安全防禦在風格維度上存在不對稱性。未來,研究團隊計劃探索基於風格的防禦方法,以及如何將ASO擴充套件到更多模態。

對抗性風格最佳化:基於GRPO的風格觸發最佳化增強視覺語言模型越獄攻擊 | AI News Hub