今週のAIシーケンス #899:Inklingの内部——一度に410億パラメータだけを起動する1兆パラメータモデル
Thinking Machine社の新モデルInklingは、9750億パラメータを持ちながら、トークンあたり410億パラメータ(約4.2%)のみを活性化し、ルーターで専門家サブセットを選択してスパース計算を実現する。
Inklingは、Thinking Machine社が開発した新世代のAIモデルであり、そのアーキテクチャは従来の大規模モデルの全パラメータ活性化という常識を覆すものです。このモデルは、9750億のパラメータをすべて同時に活性化する単一の巨大な脳ではなく、専門家機能の巨大な倉庫のようなものです。各入力トークンに対して、インテリジェントなルーターが256の専門モジュールの中から、そのトークンに最も関連する6つのモジュールを動的に選択し、さらに常に参加する2つの汎用モジュールを加えて、一時的なワーキンググループを形成して計算を行います。これにより、実際に計算に参加するパラメータは全体の約4.2%に過ぎず、トークンあたりわずか410億のパラメータしか活性化されないため、計算量と推論コストが大幅に削減されます。
このスパース活性化アーキテクチャは、256の専門学部を持つ大学に例えられます。問題が到着すると、ディスパッチャーは大学全体の学者を召集するのではなく、問題に関連するいくつかの学部の専門家と、常駐の基礎学科の教員だけを呼び出し、彼らが協力して迅速に答えを出します。異なる入力——例えばPythonのコード行、ギリシャ語のフレーズ、図のラベル、音声など——は全く異なる専門家の組み合わせを呼び出し、モデルの巨大な容量を維持しつつ、効率的な推論を実現します。
Inklingの登場は、AIモデル設計に新たな道を開きました。モデルの能力は必ずしも全パラメータの活性化と結びつく必要はなく、スパースアーキテクチャが規模と効率を両立できることを示しています。モデルの9750億パラメータはほぼ1兆に近いものの、各推論の実際の計算量は中規模モデルと同等です。これは、ストレージとネットワーク転送の負荷は依然として大きいものの、計算ノードの負担が大幅に軽減されることを意味し、より大規模なモデルの実用的な展開を促進する可能性があります。