视觉语言模型(VLM)正越来越多地部署在医疗建议、情绪支持、法律参考等高风险场景中。此时,即使模型给出的回答对一般用户看似合理,对于某个特定用户却可能因医疗、情绪或情境背景未被模型掌握而产生安全隐患。为了系统研究这一“个性化安全”问题,Edward Sun等十位作者在面向多模态系统的研究中构建了MPS-Bench基准,包含从584张真实世界图像中提取的5,181个场景,覆盖12个高风险领域,每个场景都配有一个隐藏的用户画像,用于检验模型是否能在缺乏关键个人信息时主动寻求缺失信息而不是贸然作答。
研究团队评估了八个前沿视觉语言模型,结果显示这些模型几乎在所有情况下都直接回答而非请求补充上下文,直接响应比例高达86%至99%;在个性化安全评分上,没有任何模型超过2.6/5分。文章进一步分析了多模态交互中的失败机制,发现一种称为“视觉主导”的现象:视觉信息在早期阶段就进入文本表示,并在多模态融合过程中压制文本中本可警示风险的信息。通过因果干预,作者揭示了一个两阶段机制:视觉情感先在前层被转移到文本流中,再通过这些被改变的文本表示影响最终决策,因此仅靠后期内部修正难以可靠地补救。基于这一机制,论文提出一种轻量级输入监视器PRISM,利用双向跨模态调制来预测“查询是否可能需要延迟回应”,在实验中达到0.978的AUC,并在所有被测模型上严格优于安全性与实用性之间的帕累托前沿。该论文已被COLM 2026接收为主要会议论文,相关预印本编号为arXiv:2609.04281,作者来自计算机视觉、人工智能与机器学习领域。
该研究的意义在于,它把视觉语言模型的安全问题从“通用安全”扩展到“个人化安全”,即需要结合用户自身状态来判断答复是否合适。传统的安全对齐往往针对通用有害内容,但同一个回答对不同用户的风险程度并不相同。MPS-Bench提供了一个可重复的测试环境,使研究者能够衡量模型在何种情况下应当主动提示缺乏必要信息、请求用户补充或选择不回应。八个模型的低分表明,当前视觉语言模型更倾向于保持对话流畅,而不是承担“不确定时寻求信息”的责任。视觉主导机制则解释了为何简单增加文本指令或后期校准效果有限:视觉输入所携带的“情感色调”早已改写文本表示。因此,PRISM这样在输入端进行双向调制与风险检测的设计,可能比改造模型内部晚期的对齐层更有效。作者也指出,延迟或回避并不是最优解,而是要在安全性与实用性之间自动判断,从而为高风险场景中的视觉语言模型部署提供新的工程手段。