AI News HubLIVE
站内改写1 分钟阅读

始终学习,始终混合:高效且简单的数据混合新方法

OP-Mix是一种统一的数据混合算法,适用于整个语言模型训练生命周期,能以极低的计算量实现接近最优的混合策略。它利用低秩适配器模拟候选混合,无需单独的代理模型。

来源arXiv Computational Linguistics作者: Michael Y. Hu, Apurva Gandhi, Kyunghyun Cho, Tal Linzen, Pratyusha Sharma

数据混合是语言模型训练中一个至关重要的环节。在预训练阶段,数据组成直接影响模型质量;在持续学习和适应过程中,混合策略决定了模型保留哪些知识、获取哪些新知识。然而,现有的数据混合方法大多只针对单一训练阶段设计:有的依赖与特定阶段绑定的小型代理模型,有的假设领域集合固定不变,而持续学习领域甚至缺乏系统的理论指导。这种碎片化的方法无法应对语言模型训练整个生命周期中反复出现的数据混合问题。

针对这一瓶颈,来自纽约大学的研究团队提出了一种名为OP-Mix(On-Policy Mix)的统一数据混合算法。该算法的核心创新在于,无需单独训练代理模型,而是通过在当前正在训练的模型上并行训练多个低秩适配器(LoRA),然后插值这些适配器的参数来低成本模拟不同数据混合方案的效果。这样,数据混合的搜索始终基于模型当前的实时学习动态,从而避免了代理模型与目标模型之间的失配问题。

OP-Mix在预训练、持续中训练和持续指令微调三个典型场景中均进行了实验验证。在预训练阶段,与完全不进行数据混合相比,OP-Mix使平均困惑度降低了6.3%,接近理论最优混合策略。在持续学习任务中,OP-Mix的表现与完全重训练以及基于策略的蒸馏方法相当,但计算量分别减少了66%和95%。这证明了OP-Mix在保持高性能的同时,大幅降低了计算开销。

更重要的是,OP-Mix挑战了语言模型训练的传统观念:训练不再是一系列截然分立的阶段,而是一个从数据中不断学习的连续过程。这一视角的转变可能对未来语言模型的训练范式产生深远影响。该研究由Michael Y. Hu、Apurva Gandhi、Kyunghyun Cho、Tal Linzen和Pratyusha Sharma共同完成,论文于2026年5月13日提交至arXiv。