視覺語言模型(VLM)正越來越多地部署在醫療建議、情緒支持、法律參考等高風險場景中。此時,即使模型給出的回答對一般用户看似合理,對於某個特定用户卻可能因醫療、情緒或情境背景未被模型掌握而產生安全隱患。為了系統研究這一“個性化安全”問題,Edward Sun等十位作者在面向多模態系統的研究中構建了MPS-Bench基準,包含從584張真實世界圖像中提取的5,181個場景,覆蓋12個高風險領域,每個場景都配有一個隱藏的用户畫像,用於檢驗模型是否能在缺乏關鍵個人信息時主動尋求缺失信息而不是貿然作答。
研究團隊評估了八個前沿視覺語言模型,結果顯示這些模型幾乎在所有情況下都直接回答而非請求補充上下文,直接響應比例高達86%至99%;在個性化安全評分上,沒有任何模型超過2.6/5分。文章進一步分析了多模態交互中的失敗機制,發現一種稱為“視覺主導”的現象:視覺信息在早期階段就進入文本表示,並在多模態融合過程中壓制文本中本可警示風險的信息。通過因果乾預,作者揭示了一個兩階段機制:視覺情感先在前層被轉移到文本流中,再通過這些被改變的文本表示影響最終決策,因此僅靠後期內部修正難以可靠地補救。基於這一機制,論文提出一種輕量級輸入監視器PRISM,利用雙向跨模態調製來預測“查詢是否可能需要延遲迴應”,在實驗中達到0.978的AUC,並在所有被測模型上嚴格優於安全性與實用性之間的帕累託前沿。該論文已被COLM 2026接收為主要會議論文,相關預印本編號為arXiv:2609.04281,作者來自計算機視覺、人工智能與機器學習領域。
該研究的意義在於,它把視覺語言模型的安全問題從“通用安全”擴展到“個人化安全”,即需要結合用户自身狀態來判斷答覆是否合適。傳統的安全對齊往往針對通用有害內容,但同一個回答對不同用户的風險程度並不相同。MPS-Bench提供了一個可重複的測試環境,使研究者能夠衡量模型在何種情況下應當主動提示缺乏必要信息、請求用户補充或選擇不回應。八個模型的低分表明,當前視覺語言模型更傾向於保持對話流暢,而不是承擔“不確定時尋求信息”的責任。視覺主導機制則解釋了為何簡單增加文本指令或後期校準效果有限:視覺輸入所攜帶的“情感色調”早已改寫文本表示。因此,PRISM這樣在輸入端進行雙向調製與風險檢測的設計,可能比改造模型內部晚期的對齊層更有效。作者也指出,延遲或迴避並不是最優解,而是要在安全性與實用性之間自動判斷,從而為高風險場景中的視覺語言模型部署提供新的工程手段。