AI News HubLIVE
サイト内リライト1 分で読了

メタ学習による報酬形成:人間のフィードバックからの強化学習

新しいフレームワークMeRLaは、タスク認識型の報酬形成関数をメタ学習することで、RLHFの報酬モデルを改善し、アライメントとパフォーマンスを向上させます。LLaMA-3-8Bでの実験では、PPOやDPOなどの既存手法に比べて大幅な改善を示し、トレーニングの不安定性が41%減少しました。

ソースarXiv Machine Learning著者: Yunpeng Chu

人間のフィードバックからの強化学習(RLHF)は、大規模言語モデル(LLM)を人間の嗜好に合わせるための標準的な手法です。しかし、従来のRLHFは静的でタスクに依存しない報酬モデルに依存しており、学習信号が疎になり、アライメントの質が制限されるという問題があります。この課題に対処するため、研究者らはMeRLa(メタ学習による報酬形成)を提案しました。これは、RLHFトレーニングの前に補助タスクでタスク認識型の形成関数をメタ学習する新しいフレームワークです。

MeRLaの中心的なアイデアは、学習された形成関数を用いて複合報酬を生成することです。この報酬はポリシーの最適性を維持しつつ、タスク固有の学習信号を提供します。メタ目的関数は、タスク識別、エントロピー正則化、およびポテンシャルベースの保存を組み合わせて、安定した収束を保証します。また、理論的な分析により、ポリシー不変性が証明され、表現ドリフト感度が考察され、エントロピー最大化によるインセンティブの不整合が形式的に解決されています。

実験では、LLaMA-3-8Bモデルを用いて4つのベンチマークで評価が行われました。結果は、MeRLaがPPO、DPO、GRPO、DAPOなどの既存手法に一貫して勝ることを示しました。特に、AlpacaEval 2.0で90.8%の長さ制御勝率、MT-Benchで9.14のスコアを達成し、トレーニングの不安定性を41%削減しました。さらに、MeRLaはプロセスベースやルーブリックベースの拡張報酬と組み合わせてもその利点を維持します。MeRLaは、RLHFの報酬モデリングに新たな視点を提供し、LLMのアライメント効率と効果を向上させる可能性を秘めています。