AI News HubLIVE
站内改写1 分钟阅读

超越模式寻求强化学习:扩散语言模型的轨迹平衡后训练

现有扩散语言模型后训练方法多采用奖励最大化目标,导致轨迹锁定问题,即概率质量过度集中于少数去噪路径,降低了重复采样时对正确解的覆盖。本文提出TraFL(轨迹流平衡),通过轨迹平衡目标将策略训练至奖励倾斜的分布,并锚定到冻结参考模型,结合扩散兼容的序列级替代和学习提示相关归一化。在数学推理和代码生成基准上,TraFL是唯一在所有设置中均优于基础模型的方法,且改进随采样预算增加而持续,并泛化至留出评估。

来源arXiv Machine Learning作者: Saba Ahmadi, Prasanna Parthasarathi, Yufei Cui

扩散语言模型(Diffusion Language Model, DLM)作为自回归模型的一种有前途的替代方案,近年来受到了广泛关注。然而,在DLM的后训练阶段,现有方法大多沿用传统的奖励最大化目标,这导致了一个被称为“轨迹锁定”(trajectory locking)的关键失败模式。具体而言,当模型通过奖励驱动的更新进行优化时,概率质量会过度集中在少数几条去噪路径上,从而在重复采样时显著降低了对其他潜在正确解的覆盖能力。这种模式崩溃问题严重限制了DLM在实际应用中的表现。

为了解决这一问题,来自研究团队的Saba Ahmadi等人提出了一种新的后训练方法——TraFL(Trajectory Flow baLancing,轨迹流平衡)。TraFL的核心思想是引入一个轨迹平衡目标,该目标将策略训练至一个奖励倾斜的目标分布,同时通过锚定到一个冻结的参考模型来防止过度优化。这种方法巧妙地避免了单纯追求奖励最大化所导致的模式崩溃。为了使该技术适用于扩散语言模型,研究人员还设计了扩散兼容的序列级替代目标以及一个学习得到的提示相关归一化项,从而确保了方法的实用性和稳定性。

在数学推理和代码生成等标准基准测试中,TraFL展现出了显著的性能优势。实验结果表明,TraFL是唯一一种在每种基准长度设置下都优于基础模型的后训练方法,并且其性能提升随着采样预算的增加而持续扩大。更令人印象深刻的是,这些改进能够很好地泛化到留出评估集上:在Minerva Math基准中,TraFL的性能始终保持在基础模型之上,而在LiveCodeBench的每个难度等级上,它都成为表现最强的方法。

这项研究为扩散语言模型的后训练开辟了新的方向,通过平衡轨迹分布而非盲目追求高奖励,有效提升了模型的探索能力和最终性能。未来,这一方法有望被进一步扩展至更广泛的应用场景,为语言模型的训练和优化提供新的思路。