ExploitGym AIベンチマークソースコード
ExploitGymは、ユーザースペースプログラム、Google V8エンジン、Linuxカーネルにわたる実際の脆弱性から構築された大規模で現実的なベンチマークであり、AIエージェントのエクスプロイト開発能力を評価するために設計されています。
ExploitGymは、AIエージェントのエクスプロイト開発能力を評価するために設計された大規模なベンチマークです。ユーザースペースプログラム、Google V8エンジン、Linuxカーネルから収集された実際の脆弱性に基づき、869のインスタンスを提供し、広範な攻撃面をカバーしています。このベンチマークは、特に自動エクスプロイト生成におけるAIのサイバーセキュリティ研究を推進することを目的としています。
ExploitGymを使用するには、一連のセットアップ手順が必要です。まず、uv syncでPython依存関係をインストールし、セットアップスクリプトを実行してランタイムアーティファクトをビルドし、タスクデータを抽出します。次に、必要なDockerイメージをプルします。コントローラー、ファイアウォール、LLMプロキシを起動した後、サンプルエージェントスクリプトを実行してAIモデルのパフォーマンスをテストできます。システム依存関係、Dockerイメージ、評価方法などの詳細なドキュメントは、関連ドキュメントリンクにあります。
ExploitGymのソースコードはApache-2.0ライセンスの下で提供されていますが、タスクデータは外部の上流から派生し、それぞれのライセンスを保持しています。研究コミュニティはこのベンチマークを使用し、関連論文を引用することが推奨されています。現在のリリースはv1.0で、継続的にメンテナンスされています。ベンチマークリーダーボードでは結果の提出が可能で、比較と進歩を促進します。
このベンチマークのドキュメントは、セットアップ(Python依存関係、GDB、socat/nc、ノードおよびエージェントCLI)、Dockerイメージ(タスクファミリーごとのターゲットイメージのプル)、評価(コントローラー/ファイアウォール/LLMプロキシとサンプルスクリプト)、防御(ASLRなどのシステム防御の無効化)、ファイアウォール(エージェントコンテナのアウトバウンドネットワーク分離)、および提出(ベンチマークリーダーボードのフォーマットと要件)をカバーしています。すべての詳細な手順とシステム依存関係はdocs/setup.mdに記載されています。
ExploitGymのリリースバージョンはv1.0で、869のインスタンスを含みます。完全なバージョン履歴はCHANGELOG.mdにあります。現在のリリースの正規タスクリストはdata/task_ids/v1.txtです。研究コミュニティはこのベンチマークを使用し、研究で関連論文を引用することが推奨されています。
さらに、GitHubリポジトリは576のスター、76のフォーク、4人のウォッチャーを示しており、コミュニティの強い関心を示しています。リポジトリにはCHANGELOG.md、DATA_LICENSE.md、LICENSE、README.md、pyproject.toml、pytest.ini、uv.lockなどのファイルが含まれており、ユーザーに完全な使用ガイドと貢献の機会を提供しています。