AI News HubLIVE
サイト内リライト1 分で読了

わずか8トークン:補助分岐による弱から強へのオフポリシー強化学習

弱い補助モデルを使用してLLMの推論経路に短いセグメントを注入する新しい強化学習手法W2SPOは、数学的推論タスクで性能を向上させ、トレーニングを高速化します。

ソースarXiv AI著者: Dayu Wang, Jiaye Yang, Weikang Li, Jiahui Liang, Liwei Qian, Xin Pei, Jizhou Huang

強化学習(RL)は大規模言語モデル(LLM)の推論能力を向上させる標準的な手法となっていますが、既存の手法には「サポート制限」というボトルネックがあります。難しい推論タスクでは、モデルが生成するサンプルが意味的に冗長になり、同じ誤った「推論の盆地」に収束してしまい、ポリシー更新に十分な報酬コントラストが得られません。この問題を解決するために、研究チームはW2SPOという弱から強へのオフポリシーRL手法を提案しました。この手法では、計算効率の高い弱い補助モデルを使用して、ターゲットモデルの中間軌道に短い補助セグメント(わずか8トークン)を注入し、その分岐状態からターゲットモデルが推論を完了します。ポリシーの更新は、最終的な検証可能な報酬に基づいて、これらの挿入された短いセグメントに限定されます。実験では、4Bスケールのモデルにおいて、W2SPOは数学的推論ベンチマークで他のポストトレーニングベースラインを上回る性能を示しました。同じサンプリング予算のバニラGRPOと比較して、Pass@1を62.3%から64.2%に向上させ、3.55倍のトレーニング高速化を達成しました。これらの結果は、弱い補助分岐が局所的な探索サポートを拡張することで、より強力なターゲット推論ポリシーを誘導できることを示唆しています。W2SPOは、弱モデルの計算効率を活用しながら、全体の計算コストを大幅に増加させることなく、ポリシーの探索効率と最終性能を著しく向上させます。今後の研究では、補助モデルの選択戦略や注入位置が性能に与える影響をさらに探求し、実際のシナリオでの応用を促進することが期待されます。