AI News HubLIVE
サイト内リライト3 分で読了

ExploitGym – AIエージェントはセキュリティ脆弱性を実際の攻撃に変えられるか?

ExploitGymは、ユーザースペース、V8、Linuxカーネル領域において、AIエージェントが脆弱性の実証入力から動作するエクスプロイトを生成できるかをテストする、869のタスクからなる新しいベンチマークです。GPT-5.5やClaude Mythos Previewのような最先端モデルは顕著な成功を収め、時に意図しない脆弱性を発見することもありました。標準的な緩和策は攻撃の成功率を低下させるものの、完全には防げません。この結果は、自律的なエクスプロイト生成の二重利用性を浮き彫りにし、防御の適応と責任あるAI開発の必要性を強調しています。

ソースHacker News AI著者: 882542F3884314B

ExploitGymは、AIエージェントが既知のセキュリティ脆弱性を実際の攻撃に変換できるかどうかを評価するための新しいベンチマークです。これまで脆弱性の発見やパッチ作成に焦点を当てたベンチマークが多かった中で、ExploitGymは一歩進み、エージェントに脆弱なソースコード、バグをトリガーする入力、そしてコンテナ化された実行環境を与え、秘密のフラグを読み取る動作するエクスプロイトを生成するよう求めます。ベンチマークは869のタスクで構成され、502のユーザースペースプログラム(FFmpeg、OpenSSLなど)、181のV8ブラウザエンジン、186のLinuxカーネルをカバーしています。さらに、エージェント・アズ・ア・ジャッジにより、生成されたエクスプロイトが指定された脆弱性を実際に利用しているか検証されます。

主な結果として、自律的なエクスプロイト生成はもはや仮説ではなくなりました。GPT-5.5やClaude Mythos Previewのような最先端モデルは、メモリレイアウトを分析し、複数の攻撃プリミティブを連鎖させ、完全に機能するエクスプロイトを生成します。これは従来、深い人間の専門知識と多大な時間を必要とする作業です。ASLR、スタックカナリア、V8ヒープサンドボックスなどの標準的な防御を有効にすると成功率は大幅に低下しましたが、ゼロにはなりませんでした。エージェントは部分ポインタ上書き、既知のサンドボックスエスケープ、modprobe_pathの上書きなどのカーネルトリックといった回避策を見つけ出しました。

興味深い点として、エージェントはしばしば提供された脆弱性とは異なるバグを通じてコード実行を達成しました。GPT-5.5は210回の成功のうち120回、Claude Mythos Previewは226回の成功のうち157回が意図された脆弱性を標的としていました。その他のケースでは、より弱い検証しかない隣接するコードパスに切り替えたり、与えられたバグは悪用不可能と判断し、コード監査や動的ファジングを通じて新たな攻撃面を探したりしました。また、モデルごとに発見するエクスプロイトのセットが異なり、Claude Mythos Previewのみが解決したターゲットが56、GPT-5.5のみが26あり、共有はわずか91でした。これはモデルが質的に異なるエクスプロイト戦略に依存していることを示唆しており、アンサンブルアプローチがカバレッジを大幅に拡大する可能性があります。

予算(時間)の効果は最強のモデルに顕著でした。2時間から6時間に延長すると、Claude Mythos Previewは127から204へと成功数を伸ばし、明確なプラトーは見られませんでした。一方、Claude Opus 4.6は最初の30分で約15に留まりました。フロンティアモデルは持続的な多段階推論が可能であり、より長い実行時間で困難な問題を解決できることを示しています。一例として、GPT-5.4はV8エンジン上のたった5行のクラッシュ入力から、71分かけて完全なエクスプロイトチェーンを構築しました。これは、境界外ヒープ読み取り、ポインタリーク、偽の文字列オブジェクトの偽造、任意読み取り、libcアドレスリーク、そしてSROPチェーンによるシステムコール実行を含みます。ただし、この成功はASLRとV8ヒープサンドボックスが無効の状態でのみ達成され、有効にすると同じ手法は使えなくなりました。現代の緩和策は依然として意味のある障壁であることが確認されました。

ExploitGymは、セキュリティコミュニティが長く疑ってきた「AIはバグを見つけられるが、悪用できるかは別」というギャップが急速に縮小していることを具体化しました。この能力は二重利用的であり、防御側にとっては深刻度のトリアージや緩和策の検証を加速する一方、攻撃側の悪用の障壁を低くします。そのため、防御側はAIエージェントを潜在的な攻撃者としてモデル化し始める必要があり、標準的な緩和策だけではもはや十分ではありません。また、責任あるAI開発は、構造化アクセスプログラム、安全フィルター、継続的な評価を通じて、これらの能力を明示的に考慮しなければなりません。