跳到主要内容
AI News HubLIVE
站内改写2 分钟阅读

所见胜过所知:视觉主导性与基于延迟的VLM个性化安全方法

文章摘要

视觉语言模型在高风险场景中可能对特定用户不安全。本文提出MPS-Bench(12个高风险领域、5181个场景)并发现八个前沿VLM几乎总是直接作答(86-99%),个性化安全得分最高仅2.6/5。机制分析表明视觉信息在融合早期压制文本风险信号,导致后期内部修正失效;提出的PRISM以0.978 AUC预测需要延迟回答的查询,并在各模型上优于安全-效用帕累托前沿。

来源arXiv Computer Vision作者: Edward Sun, Yuchen Wu, Zixian Ma, Eric Hanchen Jiang, Yijia Xiao, Xiaoyuan Yi, Ranjay Krishna, Wei Wang, Jindong Wang, Aylin Caliskan
所见胜过所知:视觉主导性与基于延迟的VLM个性化安全方法
报告错误

纠错通道尚未开通,可先复制下方文章信息留存。

查看更正说明
直接读正文

视觉语言模型(VLM)正越来越多地部署在医疗建议、情绪支持、法律参考等高风险场景中。此时,即使模型给出的回答对一般用户看似合理,对于某个特定用户却可能因医疗、情绪或情境背景未被模型掌握而产生安全隐患。为了系统研究这一“个性化安全”问题,Edward Sun等十位作者在面向多模态系统的研究中构建了MPS-Bench基准,包含从584张真实世界图像中提取的5,181个场景,覆盖12个高风险领域,每个场景都配有一个隐藏的用户画像,用于检验模型是否能在缺乏关键个人信息时主动寻求缺失信息而不是贸然作答。

研究团队评估了八个前沿视觉语言模型,结果显示这些模型几乎在所有情况下都直接回答而非请求补充上下文,直接响应比例高达86%至99%;在个性化安全评分上,没有任何模型超过2.6/5分。文章进一步分析了多模态交互中的失败机制,发现一种称为“视觉主导”的现象:视觉信息在早期阶段就进入文本表示,并在多模态融合过程中压制文本中本可警示风险的信息。通过因果干预,作者揭示了一个两阶段机制:视觉情感先在前层被转移到文本流中,再通过这些被改变的文本表示影响最终决策,因此仅靠后期内部修正难以可靠地补救。基于这一机制,论文提出一种轻量级输入监视器PRISM,利用双向跨模态调制来预测“查询是否可能需要延迟回应”,在实验中达到0.978的AUC,并在所有被测模型上严格优于安全性与实用性之间的帕累托前沿。该论文已被COLM 2026接收为主要会议论文,相关预印本编号为arXiv:2609.04281,作者来自计算机视觉、人工智能与机器学习领域。

该研究的意义在于,它把视觉语言模型的安全问题从“通用安全”扩展到“个人化安全”,即需要结合用户自身状态来判断答复是否合适。传统的安全对齐往往针对通用有害内容,但同一个回答对不同用户的风险程度并不相同。MPS-Bench提供了一个可重复的测试环境,使研究者能够衡量模型在何种情况下应当主动提示缺乏必要信息、请求用户补充或选择不回应。八个模型的低分表明,当前视觉语言模型更倾向于保持对话流畅,而不是承担“不确定时寻求信息”的责任。视觉主导机制则解释了为何简单增加文本指令或后期校准效果有限:视觉输入所携带的“情感色调”早已改写文本表示。因此,PRISM这样在输入端进行双向调制与风险检测的设计,可能比改造模型内部晚期的对齐层更有效。作者也指出,延迟或回避并不是最优解,而是要在安全性与实用性之间自动判断,从而为高风险场景中的视觉语言模型部署提供新的工程手段。

展开要点与分析

文章情报

工程师进阶

要点

  • 提出MPS-Bench:12个高风险领域、584张真实图像、5,181个场景,每个场景带隐藏用户画像。
  • 评估八种前沿VLM:86-99%直接回答而不询问缺失上下文,个性化安全最高仅2.6/5。
  • 发现“视觉主导性”机制:视觉信息在早期进入文本表示并压制文本风险信号,后期内部修正不可靠。
  • PRISM以双向跨模态调制预测是否需要延迟,AUC 0.978并严格支配安全-效用帕累托前沿。

要点与分析由自动化流程生成,可能有误,请结合原始来源核实。