AgentWall:本地AI代理的运行时安全层
AgentWall是一个针对本地AI代理的运行时安全与可观测层,能够拦截代理操作、执行策略检查、要求人工审批并记录审计轨迹,在14项基准测试中实现92.9%的策略准确率和亚毫秒级开销。
随着AI代理从被动的文本生成器转变为能够执行Shell命令、修改文件、调用API和浏览网页的主动行动者,其安全性问题日益凸显。传统AI安全研究主要集中在模型对齐和输入过滤上,但这些方法无法应对代理意图转化为实际机器操作的瞬间风险,尤其是在本地环境中,开发者在自己的文件系统、凭证和基础设施上运行代理,却缺乏有效的运行时控制。
针对这一空白,研究人员提出了AgentWall——一个面向本地AI代理的运行时安全与可观测层。AgentWall的工作原理是在每个代理操作提案到达宿主环境之前进行拦截,然后根据一套显式声明的策略进行评估。对于敏感操作,它会要求人工审批;同时记录完整的执行轨迹,以便后续审计和回放。
AgentWall的实现形式是策略执行的MCP代理和原生OpenClaw插件,通过单条安装命令即可集成到Claude Desktop、Cursor、Windsurf、Claude Code和OpenClaw等热门AI开发工具中。论文详细介绍了AgentWall的设计、架构、威胁模型和策略模型,并在14项基准测试中展示了其性能:策略执行准确率高达92.9%,而额外开销仅为亚毫秒级别。
AgentWall现已开源,代码托管在GitHub上。这一工具为本地AI代理的安全运行提供了切实可行的解决方案,填补了从模型安全到操作安全之间的关键空白。