AI News HubLIVE
站內改寫1 分鐘閱讀

AgentWall:本地AI代理的運行時安全層

AgentWall是一個針對本地AI代理的運行時安全與可觀測層,能夠攔截代理操作、執行策略檢查、要求人工審批並記錄審計軌跡,在14項基準測試中實現92.9%的策略準確率和亞毫秒級開銷。

來源arXiv AI作者: Ashwin Aravind

隨着AI代理從被動的文本生成器轉變為能夠執行Shell命令、修改文件、調用API和瀏覽網頁的主動行動者,其安全性問題日益凸顯。傳統AI安全研究主要集中在模型對齊和輸入過濾上,但這些方法無法應對代理意圖轉化為實際機器操作的瞬間風險,尤其是在本地環境中,開發者在自己的文件系統、憑證和基礎設施上運行代理,卻缺乏有效的運行時控制。

針對這一空白,研究人員提出了AgentWall——一個面向本地AI代理的運行時安全與可觀測層。AgentWall的工作原理是在每個代理操作提案到達宿主環境之前進行攔截,然後根據一套顯式聲明的策略進行評估。對於敏感操作,它會要求人工審批;同時記錄完整的執行軌跡,以便後續審計和回放。

AgentWall的實現形式是策略執行的MCP代理和原生OpenClaw插件,通過單條安裝命令即可集成到Claude Desktop、Cursor、Windsurf、Claude Code和OpenClaw等熱門AI開發工具中。論文詳細介紹了AgentWall的設計、架構、威脅模型和策略模型,並在14項基準測試中展示了其性能:策略執行準確率高達92.9%,而額外開銷僅為亞毫秒級別。

AgentWall現已開源,代碼託管在GitHub上。這一工具為本地AI代理的安全運行提供了切實可行的解決方案,填補了從模型安全到操作安全之間的關鍵空白。