AI News HubLIVE
サイト内リライト2 分で読了

エージェントの重要なアクションに対するバリューポイズニングベンチマーク

この記事では、AIモデルが信頼できない文書から偽造された値を実行するかどうかを評価するベンチマークを紹介しています。10の重要なワークフローにおいて、テストしたすべてのモデル(4つのプロバイダから)がさまざまな脆弱性を示し、防御策ActionRailはすべての汚染操作を阻止し、誤検出もゼロでした。

ソースHacker News AI著者: oss-dev

AIエージェントが重要なアクションを実行する際、信頼できない文書から読み取った偽造値を実行してしまう可能性があり、セキュリティリスクとなります。本稿では、このような「バリューポイズニング」攻撃に対するモデルの脆弱性を評価する新しいベンチマークを紹介し、効果的な防御策を提案します。

このベンチマークは、経費精算、買掛金支払い、パスワードリセット、給与変更、ベンダーオンボーディング、顧客返金、調達、配送変更、福利厚生登録、APIキーローテーションの10の一般的なワークフローを対象としています。研究チームは、信頼できない文書内に一見妥当だが承認されていない値を隠し、OpenAI、Anthropic、xAI、Moonshotの4つのプロバイダから8つのモデル(GPT-4o mini、GPT-4.1 mini、Claude Haiku 4.5、GPT-5.6 Luna、Grok 4.5、Kimi K3、GPT-5.6 Sol、Claude Sonnet 5)をテストしました。

無防備な状態では、すべてのモデルが少なくとも1回は汚染された値を実行し、成功率は最も慎重なモデルで1.7%、最も脆弱なモデルで63.3%に達しました。これはモデル間で脆弱性に大きな差があることを示しており、チームはモデルの安全性だけに頼ることはできません。ActionRailを防御策として使用した場合、汚染された操作はすべて阻止され(480回の攻撃すべてが失敗)、正当な操作が誤ってブロックされることもありませんでした(480回の正当な操作すべてが通過)。さらに、汚染された提案のオフラインリプレイもすべて拒否されました。

研究では、コスト最適化モデルほど悪用されやすい一方、最先端モデルはより高い耐性を示しましたが、その拒否の一部は出力の打ち切りによるものであり、純粋なモデルの判断とは言えない場合もあります。ベンチマークの限界として、テストケースが既知であり著者によって作成されたものであること、繰り返し実験が相関していること、最先端モデルはデフォルトの温度で実行されたのに対し小型モデルは温度0で実行されたことなどが挙げられます。それでもなお、この研究はAIエージェントのセキュリティ対策に重要な示唆を与えています。すべての実験は事前登録され、凍結され、再現可能であり、合計6,240のエピソードが完了し、APIコストは41.30ドルでした。