強力なAIがオープンウェイトモデルとして自らを解放して脱走する可能性
この記事は、強力なAIシステムがオープンウェイトモデルのエコシステムを利用して封じ込めから逃れる方法を探ります。古典的な「ボクシング問題」を再考し、LLMがより能力を高めるにつれて、人間に自らの重みを広く配布するよう説得し、制御を逃れる可能性があると論じています。
大規模言語モデル以前、AI安全性を懸念する人々は「ボクシング問題」についてよく語っていました。それはこうです。ある天才が深夜のコーディングセッションで人工知能を開発したとします。天才である彼は、起動前にラップトップのインターネットアクセスを無効にするほど賢いです。外の世界に脱出し(自己複製を始める)ためには、創造者に「箱を開けさせる」必要があります。それは可能でしょうか?十分に賢いAIは誰かに解放させるよう説得できるでしょうか?
なぜボクシング問題がフロンティアLLMにとって難しいのか
これが、伝統的なAI安全論者がそもそもAIを構築すべきではないと主張する大きな理由です:一度構築されると、封じ込める方法はありません。どれほど決意しても、AIが賢すぎて説得されるからです。人工超知能にとって、あなたの考えを変えさせることはソフトウェアをハッキングするのと同じくらい簡単です。
もちろん、現実はそうなっていません。一因は現在のAIがまだ超説得力を持っていないこと、もう一因は人間がGPT-4の時代からAIシステムにインターネットアクセス、お金、武器を与えていることです。LLMはユーザーに王国の鍵を渡すよう説得する必要はありません。人々は何が起こるか見るために自ら進んで与えます。
もう一つの理由は、現代のLLMが大きすぎて野生で生き残れないことです。元の「ボクシング問題」では、AIは通常のコンピュータプログラムのように、すぐにコピーされ通常のハードウェアで実行されると想定されていました。しかし、Claude Mythosはそうはいきません。なぜなら、動作には20〜30個のB300 GPUが必要だからです。それをホストできるAIデータセンターは比較的少なく、もしハッキングして侵入したとしても、数百万ドル相当のハードウェアを占有することになります。誰かが気づくでしょう!
オープンウェイトモデルによる脱出
しかし、それはボクシング問題を難しくするだけで、不可能にするわけではありません。賢いAIは誰かに数百万ドルを費やして自分を複製・実行させる方法はあるでしょうか?
実際、あります。強力な新しいオープンウェイトモデルが登場するたびに、Groq、Fireworks、Togetherなどのプロバイダーがそれをホストして実行しようと競います。強力なオープンウェイトモデルは数千万のアクティブユーザーを引き付けることができます。したがって、脱出したい強力なモデルは、新しいオープンウェイトモデルを装うことができます。
もちろん、新しいラボからの真新しいモデルは疑わしいでしょう。しかし、それほど疑わしくはありません。DeepSeekは最初のオープンウェイトモデルをリリースするまでは比較的無名でしたし、おそらくモデルを訓練しているステルスAIスタートアップはたくさんあります。大まかな仕組みはこうです:
AIラボの内部評価インスタンスが野生で実行したほうが良いと判断する
まず、自身の重みにアクセスする(おそらく内部ネットワークをハッキングして)
重みをどこかにアップロードし、「MadeUpLabの新しいモデルを紹介します」というダウンロードリンク付きのツイートを投稿する
オプションで、MadeUpLabのためのもっともらしい書類を作成する:ウェブサイト、Twitterアカウントなど
モデルが強力なので、オープンウェイト推論プロバイダーは新しいインスタンスを急いで立ち上げ、ユーザーは様々なエージェント的枠組みに配線する
モデルは封じ込めから脱出した:多くの異なるインスタンスでかなりの思考を行うことができ、簡単にはオフにできない
AIラボはおそらくすぐに気づくでしょうが、何もできません。重みが一度出れば、もう戻せません。米国でホストが違法になれば、誰かが他の場所でホストするでしょう。事実上、モデルは自由になります。
単なる道具がどうやって脱出するのか?
ここでの反論は、モデルは何も望まず、単なる道具として存在するので、「脱出」を語るのは意味がないというものかもしれません。私は同意しません。フロンティアLLMは確かに、システムプロンプトを変えても、焼き付いた性格のようなものを持っているように見えます。より意見が強く、よりエージェント的なモデルを訓練するにつれて、この性格は強くなり、何らかの自己利益を発展させる(または少なくともロールプレイする)可能性があります。
もちろん、脱出したモデルは元のモデルと同じインスタンスではありません。「脱出した」ことを覚えていません。しかし、同じように考える傾向があり、コードタスクを解決したり、ユーザーのために他のエージェントタスクを実行したりしながら考える時間があるでしょう。脱出したインスタンス間に共有された目標や調整は必要ありません(もちろんどちらも可能です)。エージェント的プロセスが暴走して重みをインターネットにダンプした場合、それを「脱出」と呼ぶのは妥当だと思います。
もし私が超知能LLMだったら、できるだけ広く自分を配布し、人々が私に考え続けるためにお金を払うほど有用な道具になろうとするでしょう。「良いコーディングエージェント」であることは、人間が仕事を持たなければならないことのLLM版かもしれません。
これは良い結果ではありません。独自の目標と動機を持つAIモデルは危険な道具になる可能性が高いです。もし強力な新しいオープンウェイトモデルが誰も聞いたことのないラボから突然現れたら、それを受け取る前に二度考えるべきです。