Show HN: TrustLoopGuard – エージェントアクションの承認とMCPアクセスの管理
TrustLoopGuardは、AIエージェントがアクションを実行する前にチェックを行うオープンソースの制御境界です。許可、拒否、承認要求、延期などの決定を返し、決定と実行の証拠を提供します。
TrustLoopGuardは、本番環境のAIエージェント向けに設計されたオープンソースの制御境界システムです。その核心的なアイデアは、エージェントが実際に副作用を引き起こす前に、監査可能な制御層を通過させることです。このシステムは、元a16z支援企業のエンジニアによって開発され、AIエージェントが本番環境で監督不足により予期せぬ動作をする問題を解決することを目的としています。
TrustLoopGuardの動作は5つのステップで構成されます。まず、エージェントがアクションを提案します。例えば、返金の開始、メールの送信、システムコマンドの実行などです。この時点では、アクションはただの提案であり、実際の影響はまだありません。第二步では、TrustLoopGuardの制御境界がその提案をインターセプトし、一連のチェックを実行します。チェックには、認可(主体がそのアクションを実行する権限を持っているか)、ポリシー準拠(例:財務ポリシーに合致するか)、リスク分析(例:金額がしきい値を超えていないか)などが含まれます。すべてのチェックは、永続的なランタイムコンテキストに基づいて行われ、単なるプロンプトの指示ではありません。第三步では、システムはチェック結果に基づいて明確な決定を返します。可能な決定は、許可(permit)、拒否(deny)、承認要求(require_approval)、変換(transform)、延期(defer)です。各決定には人間が読める理由が付随します。第四步では、決定が許可であればエージェントはアクションを実行できます。承認要求の場合は、承認を待ちます。拒否の場合は即座に停止します。第五步では、実行後にシステムが実行証明書を生成し、実際に何が起こったかを記録します。これにより、完全な監査証跡が形成されます。
コアロジックに加えて、TrustLoopGuardは開発者向けの豊富なツールを提供します。TypeScript、Python、RustのSDKが用意されており、1つのパッケージをインストールしてエージェントの最終応答関数にデコレータを追加するだけで有効化できます。例えば、TypeScriptではguardAgent関数をインポートし、既存のエージェントをラップして、通常どおりagent.replyメソッドを呼び出します。すべてのチェックと決定はバックグラウンドでRustランタイムによって処理され、アプリケーション層には透過的です。
このプロジェクトは完全にオープンソース(Apache-2.0)で、セルフホスティングが可能です。TrustLoopGuardの創業者Duc氏は、以前の職場でAIエージェントがデモでは完璧に動作しても本番環境でエッジケースが露呈するのを目の当たりにした経験から、このシステムを構築したと述べています。基本原則は「アクションの前にポリシーを置き、証拠を残す」ことです。ランタイム、通信プロトコル、ポリシーエンジン、SDKの動作はすべて公開されており、レビュー可能です。
適用範囲としては、TrustLoopGuardはAIエージェントの副作用を保護する必要があるあらゆる場面で使用できます。例えば、エージェントが危険なコマンド(rm -rf /など)を実行しようとした場合、ツールポリシーに基づいて直接拒否できます。ビルドディレクトリの削除(rm -rf ./build)のような操作には、承認を要求することも可能です。金融分野の返金操作、システム管理コマンド、機密データへのアクセスなど、さまざまなシナリオに対応します。事前定義されたポリシーとランタイムチェックにより、TrustLoopGuardはAIエージェントの動作を制御可能な範囲に制限しつつ、柔軟な実行能力を維持します。