NEXUS:ツール使用LLMエージェントのための構造化ランタイムセーフティ
NEXUSは、決定論的安全ルール、引数レベルの検査、および調整されたロジスティック回帰リスクスコアを組み合わせ、LLMエージェントのアクションに対して許可、ブロック、確認要求、または修正要求の4つの介入を行う構造化計画セーフティモニターです。複数のベンチマークで優れた性能を示し、レイテンシは0.205ミリ秒です。
大規模言語モデル(LLM)エージェントが自動取引、ソフトウェアデプロイ、機密データアクセスなどの高影響アクションを実行する機会が増えるにつれ、ランタイムセーフティ監視が不可欠になっています。従来のルールベースのセキュリティシステムは、エージェントの行動の多様性と複雑さに対応するには硬直的すぎることが多いです。NEXUS(Neural EXecution Utility and Safety)は、構造化計画セーフティモニターであり、正式な介入ポリシーを適用して、許可、ブロック、確認要求、または修正要求の4つのアクションから選択します。この段階的介入により、必要に応じて危険な操作を阻止しつつ、正当な行動を過度にブロックすることを避けます。
NEXUSは、決定論的安全ルール、引数レベルの検査、および調整されたロジスティック回帰リスクスコアを組み合わせています。決定論的ルールは既知の高リスクパターンを迅速に捕捉し、引数レベルの検査は各関数呼び出しの引数を詳細に検証します。リスクスコアラーはロジスティック回帰モデルを使用して過去のデータから調整され、未知のパターンのリスク評価を行います。このハイブリッドアプローチにより、低リスク操作は直接許可、中リスク操作はユーザー確認要求、高リスク操作はブロックまたは修正要求という段階的エスカレーションを実現します。
性能評価では、NEXUSは複数のベンチマークで強力な結果を示しました。128インスタンスの合成ベンチマークでは、NEXUSのF1スコアは0.949、4クラス介入精度は0.6406であり、ルールのみの介入選択を27.3パーセントポイント上回りました。R-JudgeベンチマークではF1 = 0.861(ルールのみは0.849)と改善し、AgentHarmでは脅威モデルの制限によりルールのみと同等、IPIでは99%の制御許可で0%の攻撃成功率を達成しました。ルールブラインドのNEXUS-Stressベンチマークでは、F1スコア0.881を記録し、細粒度介入ルーティングの難しさが浮き彫りになりました。
効率面では、NEXUSの中央レイテンシは0.205ミリ秒で、典型的なエージェントループへのオーバーヘッドは0.1%未満であり、リアルタイムアプリケーションに適しています。コード、ベンチマーク、および調整済みリスクスコアラーは公開されており、研究者やエンジニアに重要なツールを提供しています。この研究は、LLMエージェントの安全な展開に向けた効率的でスケーラブルなソリューションを提供し、将来のAIシステムで重要な役割を果たすことが期待されます。