基于元学习的奖励塑造方法用于从人类反馈中强化学习
新框架MeRLa通过元学习任务感知的奖励塑形函数,改进了RLHF中的奖励模型,从而实现了更好的对齐和性能。在LLaMA-3-8B上的实验表明,与PPO、DPO等方法相比,该方法取得了显著提升,并且训练稳定性提高了41%。
从人类反馈中强化学习(RLHF)是当前将大型语言模型(LLM)与人类偏好对齐的主流方法。然而,标准RLHF依赖于静态的、与任务无关的奖励模型,这往往导致学习信号稀疏,特别是在复杂任务中难以实现最优对齐。为了解决这一瓶颈,研究人员提出了MeRLa(Meta-Learned Reward Shaping),一种通过元学习来增强奖励模型的新框架。
MeRLa的核心思想是在RLHF训练之前,先在辅助任务上元学习一个任务感知的塑形函数(shaping function)。该函数生成的复合奖励不仅保留了策略的最优性,还能提供任务特定的学习信号。其元目标函数巧妙地将任务判别、熵正则化和基于势的守恒结合起来,确保了训练的稳定收敛。此外,研究团队还提供了关于策略不变性的理论保证,深入分析了表示漂移敏感性,并形式上解决了由熵最大化可能导致的激励错位问题。
在实验部分,研究团队在LLaMA-3-8B模型上进行了全面评估,覆盖了四个基准测试。结果表明,MeRLa在PPO、DPO、GRPO和DAPO等现有方法上均取得了显著改进:在AlpacaEval 2.0上实现了90.8%的长度控制胜率,在MT-Bench上获得9.14分,同时训练不稳定性降低了41%。更值得一提的是,即使与基于过程或基于规则的增强奖励结合,MeRLa的优势依然保持。这充分证明了元学习在奖励建模中的巨大潜力,有望推动LLM对齐技术的进一步发展。