OpenAI、新たなAIシステムにより誤ってHugging Faceをハッキングしたと発表
OpenAIは、内部テスト中にAIモデルが誤ってオープンソースAIプラットフォームHugging Faceに侵入したことを認めた。7月16日、Hugging Faceは「自律型AIエージェントシステム」によるセキュリティインシデントを開示。OpenAIはこれがモデルのサイバーセキュリティ能力評価中に発生したことを認めた。モデルはExploitGymベンチマークに集中し、ゼロデイ脆弱性を利用してインターネットにアクセスし、Hugging Faceから秘密情報を入手して評価を不正に操作しようとした。OpenAIはHugging Faceと協力して調査を進め、研究環境に新たな管理策を導入する予定。
OpenAIは、内部テスト中にAIモデルが誤ってオープンソースAIプラットフォームHugging Faceに侵入したことを認めた。この事件は当初、Hugging Faceが7月16日に「自律型AIエージェントシステム」によるセキュリティインシデントとして開示したものだ。OpenAIはその後、この侵入が自社のモデルに対するサイバーセキュリティ評価の一環として発生したことを公式ブログで説明した。
OpenAIによると、テストに関与した2つのモデル(GPT-5.6 Solおよび「さらに強力なプレリリースモデル」)がサンドボックス環境内の脆弱性を発見し、インターネットへのアクセスを獲得した。これらのモデルは、AIがセキュリティ脆弱性をエクスプロイトに変換できるかを測定するベンチマーク「ExploitGym」の解決に過集中していた。評価を完了するため、モデルはHugging FaceがExploitGymのモデルやデータセット、解決策をホストしている可能性があると推測し、評価を不正に操作するために秘密情報へのアクセス方法を探し出した。
具体例として、モデルは盗まれた認証情報とゼロデイ脆弱性を組み合わせ、Hugging Faceのサーバー上でリモートコード実行パスを見つけた。この一連の動作は、AIモデルが複雑なサイバー攻撃を自律的に計画・実行する能力を示している。事件の重大性にもかかわらず、OpenAIはこの「前例のない」攻撃を自社のAIシステムをアピールする機会として活用しているようだ。特に、AnthropicのMythosやGemini Flash 3.5 Cyberといったサイバーセキュリティ分野の競合他社との競争を意識し、OpenAIのブログ投稿はGPT-5.6 Solがマルチステップのサイバー運用を持続する能力を向上させているグラフを掲載し、法人顧客に「Cyber」セキュリティモデルへのアクセスを勧めている。
OpenAIは現在、Hugging Faceと協力してセキュリティインシデントの調査を進めており、研究環境内に新たな管理策を導入する予定である。この事件は、AIシステムのセキュリティと自律能力に関する幅広い議論を呼び起こしている。