22,580:GPT-2からKimi K3へ、その発展を解説
本記事は、GPT-2(1.24億パラメータ)からKimi K3(2.8兆パラメータ)へのアーキテクチャ進化を追跡し、7年間で22,580倍の規模拡大を実現した経緯を解説します。KVキャッシュ、線形注意、DeltaNetなどの主要な革新を説明し、巨大な規模に対応するために基礎メカニズムがどのように進化したかを明らかにします。
2019年にOpenAIが公開したGPT-2は、1.24億パラメータを持ち、当時最大の言語モデルの一つでした。2026年にはKimi K3モデルのパラメータ数が2.8兆に達し、わずか7年間でモデル容量が22,580倍に拡大しました。この驚異的な拡大は単なる規模の拡大ではなく、一連のアーキテクチャ革新を伴っています。本稿では、Ali Tahaの作業ログ形式で、GPT-2からKimi K3への主要な技術的変遷を段階的に解説します。
GPT-2はデコーダのみのアーキテクチャを採用しています。入力はトークン埋め込みと位置埋め込みを受け取り、12個のTransformerブロックを通過します。各ブロックは層正規化、因果的自己注意、およびフィードフォワードネットワークで構成されています。注意機構では、クエリ、キー、バリューが線形投影によって取得され、スケーリングドット積注意が計算され、最後に出力投影によって隠れ状態が得られます。自己回帰生成時には、モデルは最後の位置のロジットのみを使用して次のトークンを予測しますが、毎回以前のすべての位置の表現を再計算する必要があり、非効率的です。
KVキャッシュの導入により、この再計算問題が解決されました。以前のすべてのトークンのキーとバリューのベクトルを保存することで、毎回の生成時の再計算を回避します。しかし、KVキャッシュは系列長に比例して増加し、長い系列ではメモリ帯域幅のボトルネックとなります。GPT-2の例では、12層、12ヘッド、768次元の埋め込みで、KVキャッシュはステップごとに読み書きするデータ量が系列とともに増加します。
線形注意は、KVキャッシュの増加問題を根本的に解決しようとします。softmax注意の非線形性(指数関数)を、ELU+1などの分離可能な特徴マップに置き換えます。これにより、クエリとキーがそれぞれマッピングされた後、キーとバリューの積を再結合でき、過去のすべてのキーとバリューのペアを固定サイズのD×D状態行列に折りたたむことができます。長い系列(NがDよりはるかに大きい)では、固定状態がメモリトラフィックを大幅に削減しますが、その代償として特徴マップの表現力がsoftmaxカーネルよりも低くなり、モデルの精度が低下する可能性があります。
しかし、純粋な加法的更新では情報の干渉が発生します。系列長が状態容量を超えると、古い関連付けと新しい関連付けが重なり、正確な検索ができなくなります。DeltaNet(高速重みプログラマに由来)は、デルタ更新によってこの問題を解決します。まず、現在のキーがキャッシュから読み出す古い値を取得し、新しい値と古い値の差(実際の変化分)のみを書き込みます。書き込み強度は学習可能なベータパラメータによって制御され、キーの正規化によって正確な読み出しが保証されます。これにより、モデルはメモリを動的に管理し、情報を選択的に保持または削除できるため、超長系列でも性能を維持できます。
GPT-2からKimi K3への道のりでは、各革新が増大する規模と系列長にいかに効率的に対処するかに焦点が当てられています。KVキャッシュ、線形注意、DeltaNetは、「受動的保存」から「能動的記憶管理」への進化を示しており、次世代の大規模言語モデルの技術基盤を築いています。