スケーリング則は深層学習における最も重要な経験的発見の一つです。その核心は単純ですが強力です。訓練損失LはモデルサイズN、データセットサイズD、計算量Cの増加に伴って予測可能なべき乗則で減少し、対数グラフ上では直線となります。スケーリング則は本質的に、計算、損失、モデルサイズ、データの関係を記述するフレームワークであり、最も重要な点は限られた計算リソースをNとDに最適に配分する方法です。
この予測可能性により、スケーリング則は実際の応用で非常に価値が高くなります。一般的なワークフローは、少数の小規模実行でスケーリング則をフィッティングし、外挿によって大規模モデルに必要なトークン数や計算量を見積もることです。
初期の探求:機械学習損失の予測可能性 スケーリング則が主流になる以前から、汎化誤差のスケールに伴う予測可能性が研究されていました。Amariら(1992)はベイズアプローチと焼きなまし近似を用いて4種類の学習曲線を導出しました。決定論的学習アルゴリズムでノイズのないデータの場合、誤差はcD^{-1}に比例します。複数の等価解がある場合はcD^{-2}に比例し、学習が速くなります。ノイズのあるデータではcD^{-1/2}に比例します。確率的学習アルゴリズムでノイズのあるデータではε~cD^{-1}+Eとなり、Eはそれ以上削減できない不可避誤差です。すべての曲線はべき乗則ε~cD^α+Eに従います。
Hestnessら(2017)は、ニューラル機械翻訳、画像分類、言語モデリング、音声認識の4領域で経験的パターンを観察しました。汎化誤差は複数の要因に対してべき乗則でスケールし、モデルの改善は誤差曲線をシフトさせるが指数は変えず、アーキテクチャはオフセットEを変えるが指数αは変えず、べき乗則の傾きはモデルアーキテクチャではなく問題領域の特性であることを発見しました。
Rosenfeldら(2020)は誤差をモデルサイズNとデータサイズDの結合関数としてモデル化し、L̂(D,N)≈A/N^α+B/D^β+Eの形式を提案しました。彼らは小規模設定でパラメトリックモデルをフィッティングし、より大規模な領域への外挿に成功しました。
データ無限領域のスケーリング則:Kaplanら Kaplanら(2020)は言語モデリングコミュニティにスケーリング則の概念を普及させました。彼らは交差エントロピーテスト損失LがモデルサイズN(埋め込み層を除く)、データセットサイズD、訓練計算量Cのそれぞれに対してべき乗則でスケールすることを発見しました。主な発見は以下の通りです。損失はN、D、Cそれぞれと独立にべき乗則に従う。大きなモデルはサンプル効率が高い。アーキテクチャの詳細よりも単純な規模が重要である。固定計算予算では、非常に大きなモデルを収束前に訓練を停止する方が、小さなモデルを収束まで訓練するより効率的である。彼らは結合依存性をL̂(N,D)=[(a/N)^{α/β}+b/D]^βと表現し、過学習の程度は主に比率N^{α/β}/Dに依存することを示しました。Kaplanらは計算最適配分としてN_opt∝C^{0.73}を導き、モデルサイズをデータより速く成長させるべきと結論付けました。
また、Transformerの各コンポーネントに対するパラメータ数と計算量の推定式を提供し、トークンあたりの訓練FLOPsが約6N、総訓練計算量C≈6NDであることを示しました。
Chinchillaスケーリング則 Chinchilla論文(Hoffmannら、2022)は、より慎重な実験計画で固定計算予算下での最適モデルサイズNとトークン数Dの関係を再検討し、Kaplanらとは異なる結論に達しました。中心課題はFLOPs制約下でデータ量とモデルパラメータ数をどうトレードオフするかです。Chinchillaチームは三つの手法で最適配分を予測し、いずれもよりバランスのとれたスケーリング、すなわちモデルサイズと訓練トークンをほぼ同程度に増やすべきだと示しました。彼らの最適モデルChinchilla(70Bパラメータ、1.4Tトークン)は多くのベンチマークでより大規模なモデルを凌駕し、それまでの大規模モデルが著しく訓練不足であったことを明らかにしました。
議論と結論 スケーリング則は深層学習実践のための重要なツールですが、いくつかの未解決問題が残っています。極端な規模でもべき乗関係は持続するのか?「最適」の根底にある仮定は何か?マルチモーダルや強化学習などの新しいパラダイムにスケーリング則をどう拡張するか?いずれにせよ、スケーリング則は深層学習モデルの振る舞いを体系的に理解するための強固な基盤を提供し、大規模AIシステムの設計決定に影響を与え続けています。