物理AI中的静默故障:自主系统运行时动作授权的文献综述
本文综述了物理AI系统中新兴的安全问题——'静默故障',即黑盒模型看似自信且语义对齐,但产生物理上无效的动作。文章提出了有界问题形式化,定义了静默物理动作失败,并给出了运行时护栏功能的分类法。
近期,一篇来自arXiv的文献综述《物理AI中的静默故障:自主系统运行时动作授权的文献综述》引发了广泛关注。该论文由Barak Or撰写,于2026年5月23日提交,系统梳理了物理AI系统面临的一个安全漏洞:静默故障。
随着机器人基础模型、视觉-语言-动作模型以及基于世界模型的自主系统的发展,物理AI系统能够将多模态观测、语言指令和学习到的世界表征映射为物理上可执行的动作,控制车辆、机器人、无人机和工业机械。这种转变带来了一种传统AI内容审核或经典机器人安全无法完全覆盖的安全问题:黑盒模型可能看似自信、合理且语义一致,但发出的动作却在物理上无效。这种故障被称为“静默故障”,源于传感器漂移、遮挡、状态估计误差、分布偏移、幻觉的可供性(affordances)或错误的物理假设,且通常在底层硬件控制器检测到违规之前就已经发生。
论文指出,尽管在具身基础模型、世界模型、机器人仿真、具身安全基准、安全控制、运行时保证、不确定性估计、验证和护栏评估等领域,模型能力与安全机制各自取得了显著进展,但它们沿着大致分离的技术路径发展。一个反复出现的空白是,没有单一的研究流能够提供黑盒物理AI模型与物理执行之间的完整运行时授权边界。为此,作者发展了一个有界的问题形式化、静默物理动作失败的定义、运行时护栏功能的分类法,以及比较护栏作为物理AI保障机制的评估要求。
该综述涵盖了23页的内容,涉及机器人学和人工智能的交叉领域,为未来安全可靠的物理AI系统设计提供了重要的理论基础和实用指导。研究者们可以借此更清晰地理解当前方法的局限性,并朝着集成运行时认证的方向迈进。