Show HN:TrustLoopGuard – 审批智能体行为并管理MCP访问
TrustLoopGuard是一个开源的控制边界,用于生产中的AI智能体,在动作执行前检查其合法性,返回允许、拒绝、要求批准或延迟等决定,并提供决策和执行凭证。
TrustLoopGuard是一个开源的控制边界系统,专门为生产环境中的AI智能体提供运行时保护。它的核心思想是在智能体执行任何可能产生真实副作用的动作之前,先通过一个可审计的控制层进行检查。该系统由一位前a16z支持公司的工程师开发,旨在解决AI智能体在生产环境中因缺乏监督而导致的意外行为问题。
TrustLoopGuard的工作原理可以概括为五个步骤:首先,智能体提出一个动作,例如发起退款、发送邮件或执行系统命令。此时,这个动作只是一个提议,尚未产生任何实际影响。第二步,TrustLoopGuard的控制边界拦截该提议,并对其进行一系列检查。这些检查包括授权验证(如主体是否具有执行该动作的权限)、策略合规性(如是否符合财务政策)、风险分析(如金额是否超过阈值)等。所有检查都基于持久的运行时上下文,而非简单的提示词指令。第三步,系统根据检查结果返回一个明确的决定。可能的决定包括:允许(permit)、拒绝(deny)、要求批准(require_approval)、转换(transform)或延迟(defer)。每个决定都附带一个人类可读的原因说明。第四步,如果决定是允许,智能体可以继续执行动作;如果要求批准,则等待人工或自动审批;如果拒绝,动作立即停止。第五步,执行完成后,系统会生成执行凭证,记录实际发生的情况,从而形成完整的审计链。
除了核心的控制逻辑,TrustLoopGuard还提供了丰富的开发者工具。它支持TypeScript、Python和Rust的SDK,只需安装一个包并在智能体的最终回复函数上添加装饰器即可启用。例如,在TypeScript中,开发者可以导入guardAgent函数,将现有的智能体包装起来,然后像往常一样调用agent.reply方法。所有检查和决策都在后台由Rust运行时处理,对应用层保持透明。
该项目完全开源,采用Apache-2.0许可证,并且可以自托管。TrustLoopGuard的创始人Duc表示,在之前的工作中,他目睹了AI智能体在演示中表现完美,但在生产环境中却暴露出各种边缘情况。因此,他创建了这个系统,核心原则是“将策略置于动作之前,并留下证据”。TrustLoopGuard的运行时、通信协议、策略引擎和SDK行为都是开放的,可供审查。
适用场景方面,TrustLoopGuard可以用于任何需要保护AI智能体副作用的场合。例如,当智能体试图执行危险命令(如rm -rf /)时,系统可以基于工具策略直接拒绝;对于可能构建目录的操作(如rm -rf ./build),可以要求人工批准。它还适用于金融领域的退款操作、系统管理命令、以及访问敏感数据等场景。通过预定义策略和运行时检查,TrustLoopGuard将AI智能体的行为限制在可控范围内,同时保留了灵活的执行能力。