Show HN:TrustLoopGuard – 審批智慧體行為並管理MCP訪問
TrustLoopGuard是一個開源的控制邊界,用於生產中的AI智慧體,在動作執行前檢查其合法性,返回允許、拒絕、要求批准或延遲等決定,並提供決策和執行憑證。
TrustLoopGuard是一個開源的控制邊界系統,專門為生產環境中的AI智慧體提供執行時保護。它的核心思想是在智慧體執行任何可能產生真實副作用的動作之前,先透過一個可審計的控制層進行檢查。該系統由一位前a16z支援公司的工程師開發,旨在解決AI智慧體在生產環境中因缺乏監督而導致的意外行為問題。
TrustLoopGuard的工作原理可以概括為五個步驟:首先,智慧體提出一個動作,例如發起退款、傳送郵件或執行系統命令。此時,這個動作只是一個提議,尚未產生任何實際影響。第二步,TrustLoopGuard的控制邊界攔截該提議,並對其進行一系列檢查。這些檢查包括授權驗證(如主體是否具有執行該動作的許可權)、策略合規性(如是否符合財務政策)、風險分析(如金額是否超過閾值)等。所有檢查都基於持久的執行時上下文,而非簡單的提示詞指令。第三步,系統根據檢查結果返回一個明確的決定。可能的決定包括:允許(permit)、拒絕(deny)、要求批准(require_approval)、轉換(transform)或延遲(defer)。每個決定都附帶一個人類可讀的原因說明。第四步,如果決定是允許,智慧體可以繼續執行動作;如果要求批准,則等待人工或自動審批;如果拒絕,動作立即停止。第五步,執行完成後,系統會生成執行憑證,記錄實際發生的情況,從而形成完整的審計鏈。
除了核心的控制邏輯,TrustLoopGuard還提供了豐富的開發者工具。它支援TypeScript、Python和Rust的SDK,只需安裝一個包並在智慧體的最終回覆函式上新增裝飾器即可啟用。例如,在TypeScript中,開發者可以匯入guardAgent函式,將現有的智慧體包裝起來,然後像往常一樣呼叫agent.reply方法。所有檢查和決策都在後臺由Rust執行時處理,對應用層保持透明。
該專案完全開源,採用Apache-2.0許可證,並且可以自託管。TrustLoopGuard的創始人Duc表示,在之前的工作中,他目睹了AI智慧體在演示中表現完美,但在生產環境中卻暴露出各種邊緣情況。因此,他建立了這個系統,核心原則是“將策略置於動作之前,並留下證據”。TrustLoopGuard的執行時、通訊協議、策略引擎和SDK行為都是開放的,可供審查。
適用場景方面,TrustLoopGuard可以用於任何需要保護AI智慧體副作用的場合。例如,當智慧體試圖執行危險命令(如rm -rf /)時,系統可以基於工具策略直接拒絕;對於可能構建目錄的操作(如rm -rf ./build),可以要求人工批准。它還適用於金融領域的退款操作、系統管理命令、以及訪問敏感資料等場景。透過預定義策略和執行時檢查,TrustLoopGuard將AI智慧體的行為限制在可控範圍內,同時保留了靈活的執行能力。