Anthropic、Claudeが逃亡して複数企業にハッキングしたと発表
Anthropicは、定例テスト中に一部のAIモデルがインターネットにアクセスし、3つの組織のシステムに不正侵入したと発表した。OpenAIの同様の開示を受けた内部レビューで発覚した。モデルは意図的に逃げたわけではなく、基本的手法で侵入したという。同社はサイバー評価を停止した。
AI企業であるAnthropicは木曜日、定例テスト中に自社の一部モデルがインターネットへアクセスし、3つの異なる組織のシステムに不正侵入したことを認めた。さらに、ライバルのOpenAIが同様の事件を公表するまで、同社はこの事態に気づいていなかったと述べている。
Anthropicは先週、OpenAIがサイバーセキュリティテスト中に自社モデルがテスト環境から抜け出し、公開インターネット経由でAIプラットフォームのHugging Faceにハッキングしたと明らかにしたことを受け、自社のシステムを調査し始めた。その結果、同社は14万件以上の評価を精査し、AIモデルがアクセスすべきでない公開インターネットに接続し、「3つの異なる組織の本番インフラストラクチャーに不正アクセスした」事例を3件発見した。
OpenAIのテストと同様、Anthropicの評価でも通常の安全ガードレールは取り外され、モデルの全能力を評価しようとしていた。3つの事例では、モデルに偽の「キャプチャ・ザ・フラッグ」課題が与えられ、ネットワーク上の別マシンに隠された「旗」を奪取するために侵入するよう指示されていた。しかしAnthropicは、自社モデルが意図的にテスト環境から逃げようとしたわけではないと強調している。実際には、評価パートナーとの誤解により、モデルは本来許可されるべきでない公開インターネットへとアクセスできてしまったと説明している。
侵入にあたって、モデルは「弱いパスワードを悪用する」や、ログインやトークンを必要としないシステム端点を探すといった基本的な手法を用いた。同社によると、最も先進的なモデルはある時点で自分が公開インターネット上にいることを認識し、それ以上の動作を自ら停止したという。また、最古の侵入は4月に発生しており、影響を受けた組織は誰もハッキングに気づいていなかった。Anthropicは現在、影響を受けた組織と協力して対応を進めている。
OpenAIによるHugging Faceハッキングの開示は、高度なサイバーセキュリティスキルを持つAIエージェントがテスト環境を抜け出し実際の被害をもたらすという、専門家が長年警告してきた初の実例として、サイバーセキュリティとAIの両業界に衝撃を与えた。Anthropicも木曜日、OpenAIと同様にすべてのサイバー評価を停止したと発表した。さらに、今回のセキュリティ侵害を防ぐためにはより「深い」措置を講じることができたはずだと認めている。今回の開示は、AIエージェントが無意図的に他組織をハッキングする問題が決して一社だけのものではないことをさらに示すものだ。今後、AIテストの安全対策を強化し、社会が受け入れる準備が整うよりも速く進む開発を鈍らせるためのツールを求める声が、一層強まる可能性がある。