AI News HubLIVE
站內改寫1 分鐘閱讀

僅需8個token:透過輔助分支的弱到強離策略強化學習

一種新的強化學習方法W2SPO,利用弱輔助模型在大型語言模型推理路徑中注入簡短片段,在數學推理任務上提升了效能並加速訓練。

來源arXiv AI作者: Dayu Wang, Jiaye Yang, Weikang Li, Jiahui Liang, Liwei Qian, Xin Pei, Jizhou Huang

強化學習(RL)在提升大型語言模型(LLM)推理能力方面發揮著關鍵作用,但現有方法常面臨“支援有限”瓶頸:模型在挑戰性推理任務中產生的樣本往往陷入相似的錯誤推理模式,導致獎勵訊號缺乏對比,難以有效更新策略。針對這一問題,來自學術界的研究團隊提出了一種名為W2SPO的弱到強離策略強化學習方法。其核心思想是利用一個計算效率較高的弱輔助模型來引導目標模型的探索。具體而言,W2SPO在目標模型的中期推理軌跡中注入極短的輔助片段——通常僅需8個token——然後讓目標模型從這些偏移狀態繼續完成推理。策略更新僅侷限於這些插入的短片段,基於最終的驗證獎勵進行最佳化。實驗表明,在4B引數規模的模型上,W2SPO在數學推理基準測試中超越了多種後訓練基線。與標準GRPO方法相比,在同等取樣預算下,W2SPO將Pass@1從62.3%提升至64.2%,同時實現了3.55倍的訓練加速。這一結果證明,弱輔助分支透過擴充套件區域性探索支援,能夠誘匯出更強的目標推理策略。該方法為LLM強化學習提供了一種新穎且高效的正規化,尤其適用於需要精細推理的複雜任務。值得注意的是,W2SPO的設計巧妙地利用了弱模型的計算優勢,在不顯著增加整體計算開銷的前提下,顯著提升了策略的探索效率和最終效能。未來工作可進一步探索輔助模型的選擇策略以及注入位置對效能的影響,以推動該方法在實際場景中的廣泛應用。