AI News HubLIVE
站内改写1 分钟阅读

揭示VLM的可解释故障模式

REVELIO框架系统性地发现视觉-语言模型(VLM)在自动驾驶和室内机器人等安全关键应用中的可解释故障模式,通过多样性波束搜索和高斯过程Thompson采样组合搜索,识别出弱空间定位、忽略障碍物等漏洞。

来源arXiv AI作者: Isha Chaudhary, Vedaant V Jain, Kavya Sachdeva, Sayan Ranu, Gagandeep Singh

视觉-语言模型(VLM)因其广泛的推理能力和最小任务特定工程下的泛化能力,正越来越多地应用于安全关键领域,如自动驾驶和室内机器人。然而,这些模型在特定现实情境下可能表现出灾难性故障,即所谓的故障模式。为了系统性地揭示这些故障,来自某研究机构的研究人员提出了REVELIO框架。该框架将故障模式定义为可解释、领域相关概念的组合,例如行人距离或恶劣天气条件,在这些条件下目标VLM持续表现错误。识别此类故障需要搜索指数级庞大的离散组合空间。为此,REVELIO结合了两种搜索策略:多样性感知波束搜索,高效映射故障景观;以及高斯过程Thompson采样,实现对复杂故障模式的更广泛探索。REVELIO的搜索空间由多个概念维度组成,每个维度有多个值,组合爆炸导致传统方法不可行。多样性感知波束搜索通过保持候选解的多样性来高效探索,而高斯过程Thompson采样则利用代理模型引导搜索,从而在更广泛的区域内发现故障模式。研究团队将REVELIO应用于自动驾驶和室内机器人领域,发现了先前未报道的先进VLM漏洞。在驾驶环境中,模型通常表现出弱空间定位能力,未能考虑重大障碍物,导致推荐行为会引发模拟碰撞。例如,一个VLM可能忽略道路上突然出现的障碍物,而推荐加速绕过,这在现实中会造成危险。在室内机器人任务中,VLM要么忽略安全隐患,如掉落的物体或湿滑地面,要么过度保守,产生误报并降低运行效率。通过识别结构化和可解释的故障模式,REVELIO提供了可操作的见解,有助于针对性地改进VLM安全性。该框架的提出为VLM在真实世界应用中的可靠性评估和提升开辟了新途径。论文于2026年5月12日提交至arXiv,主题包括人工智能、机器学习和机器人学。这项工作展示了如何通过系统性方法揭示复杂模型的隐蔽弱点,从而推动更安全的AI部署。