物理AIにおけるサイレント障害:自律システムのランタイムアクション承認に関する文献レビュー
本稿は、物理AIシステムにおける新たな安全性問題「サイレント障害」をレビューする。ブラックボックスモデルが自信を持ち、もっともらしく、意味的に整合しているように見えながら、物理的に無効な動作を生成する。著者らは境界のある問題定式化、サイレント物理動作障害の定義、ランタイムガードレール機能の分類法を提案する。
arXivに掲載された文献レビュー『物理AIにおけるサイレント障害:自律システムのランタイムアクション承認に関する文献レビュー』(Barak Or著、2026年5月23日投稿)は、物理AIシステムに潜むセーフティ問題「サイレント障害」を包括的に調査している。
ロボティクス基盤モデル、視覚-言語-行動モデル、世界モデルベースの自律システムが発展するにつれ、物理AIはマルチモーダル観測、言語命令、学習された世界表現を物理的に意味のある行動にマッピングするようになり、車両、ロボット、ドローン、産業機械を制御する。この移行は、従来のAIコンテンツモデレーションや古典的なロボット安全だけでは捉えきれない安全性問題を露呈する。ブラックボックスモデルが自信満々で、もっともらしく、意味的に整合しているように見えながら、物理的に無効な行動を発行する可能性がある。これが「サイレント障害」であり、センサードリフト、オクルージョン、状態推定誤差、分布シフト、幻覚のアフォーダンス、または無効な物理的仮定に起因し、下流のハードウェアコントローラが違反を検出する前に発生する。
本レビューは、具現化された基盤モデル、世界モデル、ロボティクスシミュレーション、具現化安全ベンチマーク、安全制御、ランタイム保証、不確実性推定、検証、ガードレール評価といった分野を横断的に調査。各分野の能力と安全メカニズムはほとんど別々の技術的トラックで進展してきたが、著者はどの単一のストリームもブラックボックス物理AIモデルと物理実行の間の完全なランタイム承認境界を提供していないと指摘する。その分析に基づき、境界のある問題定式化、サイレント物理行動障害の定義、ランタイムガードレール機能の分類法、およびガードレールを物理AI保証メカニズムとして比較するための評価要件を提示している。
この23ページのレビューは、ロボティクスと人工知能の交差点に位置し、将来の安全で信頼性の高い物理AIシステム設計のための重要な理論的基盤と実用的指針を提供する。研究者は、現在のアプローチの限界をより明確に理解し、統合されたランタイム認証へ向けて進むことができる。