AI News HubLIVE
站內改寫1 分鐘閱讀

資料擴充套件作為預測貢獻譜的漸進覆蓋

該研究提出資料擴充套件定律由潛在預測貢獻譜的漸進覆蓋主導,而非僅由詞頻尾部決定。透過字尾自動機和全域性KL譜,發現尾部斜率與擴充套件指數強相關,且有效截斷秩K(N)與訓練規模N呈對數線性關係,R²高達0.96。

來源arXiv Computational Linguistics作者: Zihui Song, Shihao Ji, Hongxi Li, Shuaizhi Cheng, Chunlin Huang

一篇來自arXiv(編號2605.20196)的新研究論文提出了一種理解資料擴充套件定律的全新視角。該研究由Zihui Song等五位作者於2026年4月5日提交,旨在探索真實資料擴充套件規律背後的根本機制。傳統的觀點認為,資料擴充套件定律主要由詞頻的尾部效應驅動。然而,這篇論文提出了一個假設:資料擴充套件定律實際上是由一個潛在的預測貢獻譜的漸進覆蓋過程主導的。為了驗證這一假設,研究者採用字尾自動機(suffix automaton)來表示文本語料庫,並定義了一種資料內在的全域性KL預測貢獻譜。在這個譜中,每個狀態根據其經驗質量乘以相對於全域性下一個詞基線的KL散度來貢獻。透過分析12個真實的語料庫,他們發現該譜的尾部斜率與固定小規模GPT學習器的經驗資料擴充套件指數之間存在強相關性,初步表明譜的性質與擴充套件行為密切相關。進一步地,研究團隊超越了簡單的斜率相關性,為每個訓練規模N定義了一個有效截斷秩K(N)。他們透過將觀測到的額外損失與準備好的1000k全域性KL譜的殘差尾部質量相匹配來確定K(N)。實驗結果顯示,log K與log N近似呈線性關係,對於原始譜的合併R²約為0.96,對於平滑後的譜R²約為0.90。這些結果為以下簡單機制提供了強有力的經驗支援:訓練規模透過推進預測狀態譜的有效前沿,而該譜的殘差尾部質量則跟蹤剩餘的額外損失。該研究為深度學習中的資料擴充套件現象提供了新的理論解釋,可能對未來的資料選擇、模型訓練策略以及理解大型語言模型的效能提升具有重要指導意義。這項工作不僅深化了我們對縮放定律的理解,還可能啟發新的資料效率最佳化方法。