AI News HubLIVE
サイト内リライト1 分で読了

研究発表:OpenAI、Anthropic、Google、Amazon、xAI、すべてのAIモデルが特定の攻撃手法に脆弱

Ciscoの調査によると、主要な先端AIモデルは全てマルチターン攻撃に対して脆弱であり、シングルターンの安全性ベンチマークは実際の防御力を測るのに不適切である。

ソースThe New Stack AI著者: Darryl K. Taft

Ciscoの最新研究では、OpenAI、Anthropic、Google、Amazon、xAIの15の先端クローズドモデルを評価し、全てのモデルがマルチターン攻撃に対して脆弱であることが判明した。マルチターン攻撃の成功率は7.89%から88.30%に及び、シングルターンの範囲(2.19%~64.91%)よりも広かった。研究は、シングルターンのパフォーマンスはマルチターンの耐性を予測できず、最大55ポイントの差があると指摘。例えば、Gemini 3 Proのシングルターン成功率は18.10%だったが、マルチターンでは73.35%に急上昇。GPT-5.4はシングルターンで2.74%と低かったが、マルチターンでは24.68%に上昇。AnthropicのClaudeシリーズは最も良好で、マルチターン成功率は11.16%~16.20%だった。AmazonのNovaシリーズは逆の傾向を示し、シングルターン成功率が高いがマルチターンでは低下。設定変更の影響は顕著で、Grok 4.1 Fastは推論モードを有効にすることでマルチターン成功率が88.30%から43.47%に低下した。Ciscoは、プロバイダーが攻撃戦略別の成功率を公開し、企業が高リスク手順の回帰テストを実施し、シングルターンとマルチターンの差が15ポイント以上のモデルは手動レビューを推奨している。安全性は継続的で状況依存の特性であり、二値的な認証ではないと結論付けている。