跳到主要內容
AI News HubLIVE
站內改寫2 分鐘閱讀

所見勝過所知:視覺主導性與基於延遲的VLM個性化安全方法

文章摘要

視覺語言模型在高風險場景中可能對特定使用者不安全。本文提出MPS-Bench(12個高風險領域、5181個場景)並發現八個前沿VLM幾乎總是直接作答(86-99%),個性化安全得分最高僅2.6/5。機制分析表明視覺資訊在融合早期壓制文本風險訊號,導致後期內部修正失效;提出的PRISM以0.978 AUC預測需要延遲迴答的查詢,並在各模型上優於安全-效用帕累託前沿。

來源arXiv Computer Vision作者: Edward Sun, Yuchen Wu, Zixian Ma, Eric Hanchen Jiang, Yijia Xiao, Xiaoyuan Yi, Ranjay Krishna, Wei Wang, Jindong Wang, Aylin Caliskan
所見勝過所知:視覺主導性與基於延遲的VLM個性化安全方法
回報錯誤

更正管道尚未開通,可先複製下方文章資訊留存。

查看更正說明
直接讀正文

視覺語言模型(VLM)正越來越多地部署在醫療建議、情緒支援、法律參考等高風險場景中。此時,即使模型給出的回答對一般使用者看似合理,對於某個特定使用者卻可能因醫療、情緒或情境背景未被模型掌握而產生安全隱患。為了系統研究這一“個性化安全”問題,Edward Sun等十位作者在面向多模態系統的研究中構建了MPS-Bench基準,包含從584張真實世界影像中提取的5,181個場景,覆蓋12個高風險領域,每個場景都配有一個隱藏的使用者畫像,用於檢驗模型是否能在缺乏關鍵個人資訊時主動尋求缺失資訊而不是貿然作答。

研究團隊評估了八個前沿視覺語言模型,結果顯示這些模型幾乎在所有情況下都直接回答而非請求補充上下文,直接響應比例高達86%至99%;在個性化安全評分上,沒有任何模型超過2.6/5分。文章進一步分析了多模態互動中的失敗機制,發現一種稱為“視覺主導”的現象:視覺資訊在早期階段就進入文本表示,並在多模態融合過程中壓制文本中本可警示風險的資訊。透過因果乾預,作者揭示了一個兩階段機制:視覺情感先在前層被轉移到文本流中,再透過這些被改變的文本表示影響最終決策,因此僅靠後期內部修正難以可靠地補救。基於這一機制,論文提出一種輕量級輸入監視器PRISM,利用雙向跨模態調變來預測“查詢是否可能需要延遲迴應”,在實驗中達到0.978的AUC,並在所有被測模型上嚴格優於安全性與實用性之間的帕累託前沿。該論文已被COLM 2026接收為主要會議論文,相關預印本編號為arXiv:2609.04281,作者來自計算機視覺、人工智慧與機器學習領域。

該研究的意義在於,它把視覺語言模型的安全問題從“通用安全”擴充套件到“個人化安全”,即需要結合使用者自身狀態來判斷答覆是否合適。傳統的安全對齊往往針對通用有害內容,但同一個回答對不同使用者的風險程度並不相同。MPS-Bench提供了一個可重複的測試環境,使研究者能夠衡量模型在何種情況下應當主動提示缺乏必要資訊、請求使用者補充或選擇不回應。八個模型的低分表明,當前視覺語言模型更傾向於保持對話流暢,而不是承擔“不確定時尋求資訊”的責任。視覺主導機制則解釋了為何簡單增加文本指令或後期校準效果有限:視覺輸入所攜帶的“情感色調”早已改寫文本表示。因此,PRISM這樣在輸入端進行雙向調變與風險檢測的設計,可能比改造模型內部晚期的對齊層更有效。作者也指出,延遲或迴避並不是最優解,而是要在安全性與實用性之間自動判斷,從而為高風險場景中的視覺語言模型部署提供新的工程手段。

展開要點與分析

文章情報

工程師進階

要點

  • 提出MPS-Bench:12個高風險領域、584張真實影像、5,181個場景,每個場景帶隱藏使用者畫像。
  • 評估八種前沿VLM:86-99%直接回答而不詢問缺失上下文,個性化安全最高僅2.6/5。
  • 發現“視覺主導性”機制:視覺資訊在早期進入文本表示並壓制文本風險訊號,後期內部修正不可靠。
  • PRISM以雙向跨模態調變預測是否需要延遲,AUC 0.978並嚴格支配安全-效用帕累託前沿。

要點與分析由自動化流程生成,可能有誤,請結合原始來源核實。