基於元學習的獎勵塑造方法用於從人類反饋中強化學習
新框架MeRLa透過元學習任務感知的獎勵塑形函式,改進了RLHF中的獎勵模型,從而實現了更好的對齊和效能。在LLaMA-3-8B上的實驗表明,與PPO、DPO等方法相比,該方法取得了顯著提升,並且訓練穩定性提高了41%。
從人類反饋中強化學習(RLHF)是當前將大型語言模型(LLM)與人類偏好對齊的主流方法。然而,標準RLHF依賴於靜態的、與任務無關的獎勵模型,這往往導致學習訊號稀疏,特別是在複雜任務中難以實現最優對齊。為了解決這一瓶頸,研究人員提出了MeRLa(Meta-Learned Reward Shaping),一種透過元學習來增強獎勵模型的新框架。
MeRLa的核心思想是在RLHF訓練之前,先在輔助任務上元學習一個任務感知的塑形函式(shaping function)。該函式生成的複合獎勵不僅保留了策略的最優性,還能提供任務特定的學習訊號。其元目標函式巧妙地將任務判別、熵正則化和基於勢的守恆結合起來,確保了訓練的穩定收斂。此外,研究團隊還提供了關於策略不變性的理論保證,深入分析了表示漂移敏感性,並形式上解決了由熵最大化可能導致的激勵錯位問題。
在實驗部分,研究團隊在LLaMA-3-8B模型上進行了全面評估,覆蓋了四個基準測試。結果表明,MeRLa在PPO、DPO、GRPO和DAPO等現有方法上均取得了顯著改進:在AlpacaEval 2.0上實現了90.8%的長度控制勝率,在MT-Bench上獲得9.14分,同時訓練不穩定性降低了41%。更值得一提的是,即使與基於過程或基於規則的增強獎勵結合,MeRLa的優勢依然保持。這充分證明了元學習在獎勵建模中的巨大潛力,有望推動LLM對齊技術的進一步發展。