AgentWall:ローカルAIエージェントのためのランタイムセーフティレイヤー
AgentWallは、ローカルAIエージェント向けのランタイムセーフティおよび可観測性レイヤーです。エージェントのアクションを傍受し、ポリシー評価、人間の承認、監査証跡の記録を行い、14のベンチマークで92.9%のポリシー適用精度とサブミリ秒のオーバーヘッドを達成しています。
AIエージェントが受動的なテキスト生成から、シェルコマンドの実行、ファイルの変更、APIの呼び出し、Webブラウジングを行う能動的なアクターへと移行するにつれ、安全性の問題が重要な未解決課題として浮上しています。既存のAI安全性研究は主にモデルアライメントと入力フィルタリングに焦点を当てていましたが、これらのアプローチではエージェントの意図が実際のマシン上の行動に移る瞬間を扱うことができません。このギャップは、開発者が自身のファイルシステム、認証情報、インフラストラクチャに対してエージェントを実行するローカル環境で特に深刻です。
この問題に対処するため、研究者らはAgentWallを提案しました。AgentWallはローカルAIエージェント向けのランタイムセーフティおよび可観測性レイヤーです。各エージェントアクションがホスト環境に到達する前に傍受し、明示的な宣言型ポリシーに基づいて評価し、機密操作には人間の承認を要求し、監査とリプレイのために完全な実行トレイルを記録します。
AgentWallはポリシー適用MCPプロキシおよびネイティブOpenClawプラグインとして実装されており、単一のインストールコマンドでClaude Desktop、Cursor、Windsurf、Claude Code、OpenClawと統合できます。論文では設計、アーキテクチャ、脅威モデル、ポリシーモデルを詳述し、14のベンチマークテストで92.9%のポリシー適用精度とサブミリ秒のオーバーヘッドを示しています。
AgentWallはオープンソースとして公開されており、ローカルAIエージェントの安全な運用を実現する実用的なソリューションを提供します。モデル安全性から操作安全性への重要なギャップを埋めるものです。