危险还是异常?评估视觉语言模型对危险与差异的理解
现代安全关键系统依赖人机交互来降低灾难风险。视觉语言模型(VLM)能解释复杂场景,但当前评估常将危险识别视为二元决策(安全/不安全),模糊了真正物理危害与异常场景元素的区别。本研究明确区分危险与异常,分别识别危险和异常状态,评估多个VLM后发现它们常将异常误判为危险,表明模型过度依赖上下文不规则性作为危险代理。明确分离危险与异常提供了更全面的安全推理评估,暴露了二元安全判断可能掩盖的失败模式。相关数据集已在Roboflow公开。
现代安全关键系统,例如灾难响应、自主机器人以及医疗急救等场景,越来越依赖人机交互来有效降低风险并支持决策。在这些高风险环境中,视觉语言模型(VLM)因其能够解读复杂视觉场景并传达安全相关信息而展现出巨大潜力。然而,要确保这些模型在关键时刻做出可靠的安全推理,仍需进行细致的评估。目前,对VLM危险识别能力的评估通常采用二元框架,即简单地将场景分类为“安全”或“不安全”。这种方法存在一个根本性缺陷:它无法区分模型是识别出了真正的物理危险,还是仅仅对场景中的异常或罕见元素做出了反应。例如,一个模型可能将一只出现在室内的猫标记为“不安全”,但猫本身并无危害,只是场景异常。
为弥补这一不足,研究人员引入了一个关键的区分——危险与异常。危险指的是可能直接导致人身伤害或财产损失的物理危害,例如火灾、倒塌结构或泄漏的化学物质;而异常则是指不寻常或意外的场景元素,它们可能完全无害,例如一个倒置的椅子或一只宠物。通过分别识别危险和异常状态,研究团队能够更精确地检验VLM的安全推理能力。他们设计了两组数据集,涵盖多种场景,并采用多种提示策略,对多个最先进的VLM进行了评估。
结果显示,VLM经常将异常元素误判为危险。换句话说,它们倾向于将任何看起来不寻常的事物视为潜在威胁。这种将上下文不规则性作为危险代理的过度依赖,可能导致对实际危险情况的误判或过度反应。例如,模型可能对一个看起来混乱但安全的场景发出警报,而对一个看似正常但实际存在隐患的场景(如微弱烟雾)无动于衷。此外,明确的区分揭示出,在二元安全判断下被掩盖的特定失败模式,例如对看似危险但实际无害的场景反应过度,而对真正危险但场景看似正常的威胁反应不足。研究人员强调,这种失败模式在传统安全评估中容易被忽略,而区分危险与异常有助于暴露这些问题。
这项研究不仅提供了更全面的VLM安全推理评估方法,还为改进模型设计提供了具体方向。例如,可以通过训练数据增强、多任务学习或引入异常检测模块来减少误判。为了促进该领域的进一步研究,研究人员公开了数据集,该数据集可在Roboflow平台上获取,供其他研究者使用。这项研究源自一篇被RO-MAN 2026会议接收的论文,为安全关键系统中VLM的可靠应用奠定了方法论基础。