通过反事实推理路径减少信用分配方差
该论文提出了一种基于反事实对比的信用分配框架,用于大语言模型多步推理的强化学习。通过采样多条推理轨迹并利用其差异隐式近似替代决策,构建了过程级优势估计器,将稀疏的终端奖励转化为步骤敏感的学习信号。基于此提出的隐式行为策略优化(IBPO)显著提升了数学和代码推理基准上的训练稳定性和性能上限。
强化学习在多步推理任务中面临一个关键挑战:稀疏的终端奖励难以有效分配到中间决策步骤,导致梯度方差高、训练不稳定,甚至模型失效。例如,在大语言模型(LLM)的数学或代码生成任务中,模型需要经过多个推理步骤才能得到最终答案,但只有最终答案正确时才会获得正奖励,中间步骤无论正确与否都无法得到直接反馈。这种设置使得每个步骤的贡献被均匀地分摊,从而产生高方差的梯度,使训练过程动荡不安,甚至完全无法收敛。
为了应对这一问题,研究团队提出了一种基于反事实对比的信用分配框架。该框架的核心思想是:在同一输入下,采样多条推理轨迹,这些轨迹可能因为中间不同的决策而导致不同的最终结果。通过比较这些轨迹之间的差异,可以隐式地模拟出“如果当时选择了另一条路径会怎样”的反事实场景。具体而言,研究团队设计了一种隐式过程级优势估计器,它利用轨迹间的差异信号来估算每个步骤相对于其他可能选择的优势值。这样,原本集中在终端的稀疏奖励就被分解为每个步骤的细粒度学习信号,从而极大改善了信用分配的条件。
在此基础上,团队进一步提出了隐式行为策略优化(IBPO)算法。IBPO将上述优势估计器直接集成到策略梯度更新中,无需依赖额外的奖励模型或价值网络。实验在多个标准基准上展开:在数学推理方面,使用了GSM8K和MATH数据集;在代码生成方面,使用了HumanEval和MBPP数据集。结果表明,与基线方法(如PPO、REINFORCE等)相比,IBPO在训练稳定性(以梯度的方差和奖励的收敛曲线衡量)和最终性能(即准确率或通过率)上均取得了显著提升。特别是,在MATH数据集上,IBPO的性能上限比之前的最佳方法提高了约5个百分点,而在HumanEval上则达到了接近80%的通过率。
该工作的意义在于,它为LLM在多步推理中的强化学习训练提供了一种实用且高效的解决方案。通过将稀疏奖励转化为步骤敏感的信号,IBPO使得模型能够更准确地从成功或失败的经验中学习,从而解锁LLM在复杂推理任务中的更大潜力。未来,该方法有望被推广到更多需要长链推理的应用场景,如科学问题求解、自动定理证明等。