AI News HubLIVE
站内改写1 分钟阅读

DomainPilot:基于领域级损失引导的两阶段数据混合优化,实现高效语言模型微调

DomainPilot 提出一种两阶段数据混合优化框架,通过领域级损失监控和定标定律引导,在不增加数据量或训练成本的情况下提升 LLM 微调性能。

来源arXiv Machine Learning作者: He Zhang

大型语言模型(LLM)的训练效果从根本上受限于训练数据的质量与组成。现有的动态数据调度方法在工业规模的预训练和监督微调(SFT)中面临关键瓶颈:数据选择在TB级语料上产生昂贵的O(N)开销;混合优化方案引入严重的I/O瓶颈或需要训练辅助参考模型;样本级重加权策略依赖于混合了噪声、难度和新颖性的损失信号。

针对这些问题,研究者提出了DomainPilot,一个领域级损失引导的两阶段数据混合优化框架。DomainPilot引入了令牌级领域损失监控,能够在不中断数据流水线的情况下捕获训练过程中每个领域的学习动态。基于这些信号,首先通过Scaling Law引导的粗优化阶段拟合领域特定的收敛曲线,得出混合调整的原则性先验;随后进入Mixing Law引导的细优化阶段,通过受控扫描实验建模跨领域交互效应,进一步优化混合比例。整个机制通过基于补丁的架构实现,仅需约30行框架特定的适配器代码即可注入到现有训练框架(如MindSpeed/Megatron-LM)中。

研究者以Qwen3-1.7B模型在SFT阶段验证了DomainPilot的有效性。与原始数据混合相比,优化后的混合在MMLU-Redux上提升+2%,在AIME24上提升+1.8%,在LiveCodeBench v5上提升+3.8%,在BFCL v3上提升+3.6%,且未增加总数据量或训练成本。这些结果表明,领域级训练信号为混合优化提供了一种高效、轻量的替代方案,避免了昂贵的数据选择或辅助模型训练。DomainPilot的代码已基于arXiv:2607.22769发布。

该框架的关键创新在于其两阶段优化策略:第一阶段利用Scaling Law预测各领域随数据量增加的学习收敛行为,从而确定一个合理的初始混合比例;第二阶段则通过Mixing Law捕捉领域间的相互影响,例如数学代码领域的数据可能对推理能力产生协同效应。这种分而治之的方法使得优化过程既有效率又有理论依据。实验结果表明,即使在1.7B参数的模型中,领域级信号也能带来显著收益,暗示在更大模型上可能获得更大幅度的提升。