データスケーリングを予測寄与スペクトルの漸進的カバレッジとして捉える
本論文は、データスケーリング則がトークン頻度の裾野だけでなく、潜在的な予測寄与スペクトルの漸進的カバレッジによって支配されるという仮説を提案する。接尾辞オートマトンを用いたテキストコーパスの表現に基づき、大域KL予測寄与スペクトルを定義し、その裾野の傾きが12の実コーパスにおいて固定小規模GPT学習器の経験的スケーリング指数と強く相関することを示す。さらに、観測された過剰損失をスペクトルの残差裾質量にマッチングすることで、各訓練サイズNに対する実効打ち切りランクK(N)を定義し、log Kとlog Nがほぼ線形関係にあることを発見した(生スペクトルR²約0.96、平滑化スペクトルR²約0.90)。
新しい研究論文が、データスケーリング則の背後にあるメカニズムとして、モデルが予測寄与スペクトルを漸進的にカバーしていくプロセスを提案している。これは従来のトークン頻度の裾野効果だけでは説明できない現象を捉えるものである。本論文はZihui Songら5名の著者によるもので、arXivにプレプリントとして公開されている(ID: 2605.20196)。研究者らは、テキストコーパスの接尾辞オートマトン表現を用い、データに内在する大域KL予測寄与スペクトルを定義した。このスペクトルでは、各状態がその経験質量と大域的な次のトークンのベースラインからのKL偏差に応じて寄与する。12の実コーパスを分析した結果、スペクトルの裾野の傾きが、固定された小規模GPT学習器の経験的データスケーリング指数と高い相関を示すことが明らかになった。これは、スペクトルとスケーリング挙動の間に強い関連があることを示す最初の証拠である。さらに研究チームは、実効打ち切りランクK(N)の概念を導入した。これは、観測された過剰損失を大域KLスペクトルの残差裾質量にマッチングすることで、各訓練サイズNに対して定義される。実験の結果、log Kとlog Nはほぼ線形関係にあり、生スペクトルでは決定係数R²約0.96、平滑化スペクトルでは約0.90という高い適合度を示した。この結果は、「訓練規模が予測状態スペクトルを通じて有効フロンティアを前進させ、残差裾質量が残りの過剰損失を追跡する」という単純なメカニズムを強く支持するものである。本手法は、深層学習においてデータ規模がモデル性能にどのように影響するかについて新たな理論的視点を提供し、データ選択や訓練戦略の設計に重要な示唆を与える可能性がある。