弱到强的在策略蒸馏:用弱模型提升强模型
本文提出弱到强在策略蒸馏(W2S-OPD),一种通过多个弱模型构建代理教师来提升强学生模型的新框架。该方法在数学和代码基准测试中优于传统在策略蒸馏,甚至允许学生超越领域专家。
在大型语言模型(LLM)的能力迁移中,在策略蒸馏(OPD)是一种有效范式,它使学生在自己的生成序列上对齐教师的token级分布。然而,现有方法通常假设教师至少与学生能力相当,这限制了在缺乏更强教师时的应用场景。例如,当需要蒸馏一个前沿模型时,往往不存在更大的教师模型;而整合多个领域专家又需要昂贵的训练成本。本文提出弱到强在策略蒸馏(W2S-OPD),一种简单而有效的框架,通过从多个比学生更小的弱模型中进行蒸馏来提升强学生的能力。
W2S-OPD的核心思想是在logit空间中利用对比对(一个正模型和一个负模型)构建一个代理教师。这两个模型都比学生小且易于获得,它们的logit差值可以隔离出特定的能力方向。将该差值加到学生自己的基模型上,就得到一个耦合了该方向且与学生在分布上相近的代理教师。然后,学生通过最小化自己生成序列上的逐token反向KL散度来蒸馏这个代理教师。
研究团队实例化了三种对比对:一是后强化学习专家与其强化学习前初始化的对比,隔离强化学习灌输的技能;二是较大基模型与较小基模型的对比,隔离规模带来的能力;三是带有正确提示与错误提示的小基模型对比,隔离指向解决方案的实例级方向。在四个数学基准(如GSM8K、MATH等)和三个代码基准(如HumanEval、MBPP等)上的实验表明,W2S-OPD不仅优于标准OPD,还能使学生超越领域专家,甚至在所有监督源都比学生弱的情况下仍能持续提升学生性能。分析显示,不同对比对产生不同信号:RL后和提示对比强调推理框架,而规模对比强调解题过程。该方法的代码已在GitHub上开源,为LLM蒸馏提供了新的思路。