AgentWall:本地AI代理的執行時安全層
AgentWall是一個針對本地AI代理的執行時安全與可觀測層,能夠攔截代理操作、執行策略檢查、要求人工審批並記錄審計軌跡,在14項基準測試中實現92.9%的策略準確率和亞毫秒級開銷。
隨著AI代理從被動的文本生成器轉變為能夠執行Shell命令、修改檔案、呼叫API和瀏覽網頁的主動行動者,其安全性問題日益凸顯。傳統AI安全研究主要集中在模型對齊和輸入過濾上,但這些方法無法應對代理意圖轉化為實際機器操作的瞬間風險,尤其是在本地環境中,開發者在自己的檔案系統、憑證和基礎設施上執行代理,卻缺乏有效的執行時控制。
針對這一空白,研究人員提出了AgentWall——一個面向本地AI代理的執行時安全與可觀測層。AgentWall的工作原理是在每個代理操作提案到達宿主環境之前進行攔截,然後根據一套顯式宣告的策略進行評估。對於敏感操作,它會要求人工審批;同時記錄完整的執行軌跡,以便後續審計和回放。
AgentWall的實現形式是策略執行的MCP代理和原生OpenClaw外掛,透過單條安裝命令即可整合到Claude Desktop、Cursor、Windsurf、Claude Code和OpenClaw等熱門AI開發工具中。論文詳細介紹了AgentWall的設計、架構、威脅模型和策略模型,並在14項基準測試中展示了其效能:策略執行準確率高達92.9%,而額外開銷僅為亞毫秒級別。
AgentWall現已開源,程式碼託管在GitHub上。這一工具為本地AI代理的安全執行提供了切實可行的解決方案,填補了從模型安全到操作安全之間的關鍵空白。