AI News HubLIVE
站内改写1 分钟阅读

仅需8个token:通过辅助分支的弱到强离策略强化学习

一种新的强化学习方法W2SPO,利用弱辅助模型在大型语言模型推理路径中注入简短片段,在数学推理任务上提升了性能并加速训练。

来源arXiv AI作者: Dayu Wang, Jiaye Yang, Weikang Li, Jiahui Liang, Liwei Qian, Xin Pei, Jizhou Huang

强化学习(RL)在提升大型语言模型(LLM)推理能力方面发挥着关键作用,但现有方法常面临“支持有限”瓶颈:模型在挑战性推理任务中产生的样本往往陷入相似的错误推理模式,导致奖励信号缺乏对比,难以有效更新策略。针对这一问题,来自学术界的研究团队提出了一种名为W2SPO的弱到强离策略强化学习方法。其核心思想是利用一个计算效率较高的弱辅助模型来引导目标模型的探索。具体而言,W2SPO在目标模型的中期推理轨迹中注入极短的辅助片段——通常仅需8个token——然后让目标模型从这些偏移状态继续完成推理。策略更新仅局限于这些插入的短片段,基于最终的验证奖励进行优化。实验表明,在4B参数规模的模型上,W2SPO在数学推理基准测试中超越了多种后训练基线。与标准GRPO方法相比,在同等采样预算下,W2SPO将Pass@1从62.3%提升至64.2%,同时实现了3.55倍的训练加速。这一结果证明,弱辅助分支通过扩展局部探索支持,能够诱导出更强的目标推理策略。该方法为LLM强化学习提供了一种新颖且高效的范式,尤其适用于需要精细推理的复杂任务。值得注意的是,W2SPO的设计巧妙地利用了弱模型的计算优势,在不显著增加整体计算开销的前提下,显著提升了策略的探索效率和最终性能。未来工作可进一步探索辅助模型的选择策略以及注入位置对性能的影响,以推动该方法在实际场景中的广泛应用。