AI News HubLIVE
站内改写1 分钟阅读

数据扩展作为预测贡献谱的渐进覆盖

该研究提出数据扩展定律由潜在预测贡献谱的渐进覆盖主导,而非仅由词频尾部决定。通过后缀自动机和全局KL谱,发现尾部斜率与扩展指数强相关,且有效截断秩K(N)与训练规模N呈对数线性关系,R²高达0.96。

来源arXiv Computational Linguistics作者: Zihui Song, Shihao Ji, Hongxi Li, Shuaizhi Cheng, Chunlin Huang

一篇来自arXiv(编号2605.20196)的新研究论文提出了一种理解数据扩展定律的全新视角。该研究由Zihui Song等五位作者于2026年4月5日提交,旨在探索真实数据扩展规律背后的根本机制。传统的观点认为,数据扩展定律主要由词频的尾部效应驱动。然而,这篇论文提出了一个假设:数据扩展定律实际上是由一个潜在的预测贡献谱的渐进覆盖过程主导的。为了验证这一假设,研究者采用后缀自动机(suffix automaton)来表示文本语料库,并定义了一种数据内在的全局KL预测贡献谱。在这个谱中,每个状态根据其经验质量乘以相对于全局下一个词基线的KL散度来贡献。通过分析12个真实的语料库,他们发现该谱的尾部斜率与固定小规模GPT学习器的经验数据扩展指数之间存在强相关性,初步表明谱的性质与扩展行为密切相关。进一步地,研究团队超越了简单的斜率相关性,为每个训练规模N定义了一个有效截断秩K(N)。他们通过将观测到的额外损失与准备好的1000k全局KL谱的残差尾部质量相匹配来确定K(N)。实验结果显示,log K与log N近似呈线性关系,对于原始谱的合并R²约为0.96,对于平滑后的谱R²约为0.90。这些结果为以下简单机制提供了强有力的经验支持:训练规模通过推进预测状态谱的有效前沿,而该谱的残差尾部质量则跟踪剩余的额外损失。该研究为深度学习中的数据扩展现象提供了新的理论解释,可能对未来的数据选择、模型训练策略以及理解大型语言模型的性能提升具有重要指导意义。这项工作不仅深化了我们对缩放定律的理解,还可能启发新的数据效率优化方法。