縮放定律是深度學習中最重要的實證發現之一。其核心觀察簡單而有力:訓練損失L隨模型規模N、資料集大小D和計算量C的增加以可預測的冪律形式下降,在對數座標圖上呈現為直線。縮放定律本質上是一個描述計算、損失、模型規模和資料之間關係的框架,關鍵在於如何在N和D之間最優分配寶貴的計算資源。
這種可預測性使縮放定律在實踐中極具價值。常見的工作流程是:在少量小規模執行中擬合縮放定律,然後外推以估計更大模型的Token和計算需求。
早期探索:機器學習損失的預測性 在縮放定律成為主流概念之前,研究者已開始探索泛化誤差隨規模變化的可預測性。Amari等人(1992)使用貝葉斯方法和退火近似推導了四種學習曲線型別:確定性演算法無非噪聲資料時誤差與D^{-1}成正比;多等效解時誤差與D^{-2}成正比;有噪聲時與D^{-1/2}成正比;隨機演算法有噪聲時誤差為cD^{-1}+E,其中E是不可約損失。所有曲線均遵循冪律:ε ~ cD^α + E。
Hestness等人(2017)最早進行實證研究,在神經機器翻譯、影像分類、語言建模和語音識別四個領域觀察到重複模式:泛化誤差隨多種因素呈冪律縮放;模型改進會平移誤差曲線但不改變指數;架構改變偏移量E但不改變指數α;冪律斜率是問題域屬性而非模型架構特徵。
Rosenfeld等人(2020)進一步將誤差建模為模型規模N和資料大小D的聯合函式,提出L̂(D,N) ≈ A/N^α + B/D^β + E,其中A、B、α、β為標量常數。他們透過在小規模配置上擬合引數模型,成功外推至更大規模。
資料無限區域的縮放定律:Kaplan等人 Kaplan等人(2020)在語言建模社群推廣了縮放定律概念。他們發現交叉熵測試損失L分別隨模型規模N(不含嵌入層)、資料集大小D和訓練計算量C呈冪律關係。關鍵發現包括:損失與N、D、C各自獨立遵循冪律;較大模型樣本效率更高;架構細節不如純粹規模重要;在固定計算預算下,訓練非常大的模型並在收斂前停止比訓練小模型至收斂更高效。他們給出的聯合依賴形式為L̂(N,D) = [(a/N)^{α/β} + b/D]^β,並得出過擬合程度主要取決於比例N^{α/β}/D。Kaplan等人得出計算最優分配為N_opt ∝ C^{0.73},建議模型規模增長快於資料集。
他們還提供了引數和計算量的估算方法,並推匯出每個Token的訓練FLOPs約為6N,總訓練計算量C≈6ND。
Chinchilla縮放定律 Chinchilla論文(Hoffmann等人,2022)以更謹慎的實驗設計重新研究固定計算預算下的最優模型規模和Token數量,得出了與Kaplan等人不同的結論。核心問題是:在FLOPs約束下,如何權衡資料量和模型引數?Chinchilla團隊提出了三種方法預測最優分配,均指向更均衡的縮放:模型規模和訓練Token應大致等比例增長。他們的最優模型Chinchilla(70B引數,1.4T Token)在大量基準測試中超越更大模型,證明大規模模型此前普遍訓練不足。
討論與結論 縮放定律是深度學習實踐的關鍵工具,但仍有多個開放問題:冪律關係在極端規模下是否持續?什麼是“最優”的底層假設?如何將縮放定律擴充套件至多模態、強化學習等新正規化?無論如何,縮放定律為系統化理解深度學習模型的行為提供了堅實基礎,並持續影響著大規模AI系統的設計決策。