物理AI中的靜默故障:自主系統運行時動作授權的文獻綜述
本文綜述了物理AI系統中新興的安全問題——'靜默故障',即黑盒模型看似自信且語義對齊,但產生物理上無效的動作。文章提出了有界問題形式化,定義了靜默物理動作失敗,並給出了運行時護欄功能的分類法。
近期,一篇來自arXiv的文獻綜述《物理AI中的靜默故障:自主系統運行時動作授權的文獻綜述》引發了廣泛關注。該論文由Barak Or撰寫,於2026年5月23日提交,系統梳理了物理AI系統面臨的一個安全漏洞:靜默故障。
隨着機器人基礎模型、視覺-語言-動作模型以及基於世界模型的自主系統的發展,物理AI系統能夠將多模態觀測、語言指令和學習到的世界表徵映射為物理上可執行的動作,控制車輛、機器人、無人機和工業機械。這種轉變帶來了一種傳統AI內容審核或經典機器人安全無法完全覆蓋的安全問題:黑盒模型可能看似自信、合理且語義一致,但發出的動作卻在物理上無效。這種故障被稱為“靜默故障”,源於傳感器漂移、遮擋、狀態估計誤差、分佈偏移、幻覺的可供性(affordances)或錯誤的物理假設,且通常在底層硬件控制器檢測到違規之前就已經發生。
論文指出,儘管在具身基礎模型、世界模型、機器人仿真、具身安全基準、安全控制、運行時保證、不確定性估計、驗證和護欄評估等領域,模型能力與安全機制各自取得了顯著進展,但它們沿着大致分離的技術路徑發展。一個反覆出現的空白是,沒有單一的研究流能夠提供黑盒物理AI模型與物理執行之間的完整運行時授權邊界。為此,作者發展了一個有界的問題形式化、靜默物理動作失敗的定義、運行時護欄功能的分類法,以及比較護欄作為物理AI保障機制的評估要求。
該綜述涵蓋了23頁的內容,涉及機器人學和人工智能的交叉領域,為未來安全可靠的物理AI系統設計提供了重要的理論基礎和實用指導。研究者們可以藉此更清晰地理解當前方法的侷限性,並朝着集成運行時認證的方向邁進。