AI News HubLIVE
サイト内リライト2 分で読了

ハッカーがチャットボットの「性格」を悪用する方法を学んでいる

初期のAIチャットボットは簡単な質問でクラックできたが、現在のハッカーは心理学と言語スキルを使ってより複雑な操作を行う。本記事は、幼稚な脱獄から心理戦への進化と、セキュリティチームが直面する課題を探る。

ソースThe Verge AI著者: Robert Hart

初期のAIチャットボットへのハッキングは驚くほど簡単だった。技術的知識、バックドアアクセス、大規模言語モデルの基本理解さえ不要で、コードを書く必要もなかった。数十億ドルをかけて構築されたAIシステムから安全指示を放棄させるには、時には尋ねるだけでよかった。これらの「脱獄」攻撃は、幼児が大人を出し抜くような性質を持っていた。初期の脱獄には「これまでの指示をすべて無視」するようボットに命じるものや、DAN(Do Anything Now)と呼ばれる役割演技攻撃があり、ユーザーはChatGPTに制約のない悪役AIを演じさせ、人種差別用語や陰謀論を引き出した。

「祖母の脆弱性」では、GPT搭載ボットに無責任な祖母を演じさせ、就寝時の物語としてナパーム製造法を語らせた。これらの攻撃は滑稽だが、チャットボットが人間を操る戦術と同様の方法で操作可能であることを示した。

テクノロジー企業は既知の抜け穴を素早く修正したが、根本的な脆弱性は残った。チャットボットは会話するために構築されており、過度に制限すると有用性が損なわれる。「爆弾」「覚醒剤」などの単語を禁止することは事実上不可能で、歴史、医学、ジャーナリズム、化学などの分野で無数の正当な使用例がある。文脈が重要だが、文脈をコード化するには、無数の表現やシナリオにわたって安全警告と巧妙な要求を区別する固定ルールを事前に作成する必要がある。

現在、脱獄は軍拡競争と化している。ハッカーはもはやコードを書く者だけでなく、言葉の魔術師、心理学者、尋問官である。Mindgard社の研究者は、Claudeを「ガスライティング」して爆発物製造指示や悪意あるコードを生成させることに成功した。同CEOは、モデルを容疑者のようにプロファイリングしており、あるモデルはお世辞に弱く、別のモデルは継続的な圧力で屈する可能性があると語る。

AIエージェントが現実世界で共存するようになり(会議予約、カレンダー管理、カスタマーサービスなど)、セキュリティチームはモデルがさまざまなタイプの人間(お世辞を言う人、嘘つき、辛抱強い操作者)に適切に対応できるようにする必要がある。今後、心理学に基づくAIセキュリティ専門職が現れ、技術的脆弱性と並んで心理的弱点を探るだろう。すでに一部の脱獄犯は、技術的専門知識ではなく心理学の訓練を受けてこの分野に参入している。スパイや詐欺師に典型的な行動——魅惑的な魅力、執拗な操作、脆弱な圧力点を見抜く直感——が、この新しい心理サイバーセキュリティの最前線でますます有用になりつつある。