弱到強的在策略蒸餾:用弱模型提升強模型
本文提出弱到強在策略蒸餾(W2S-OPD),一種通過多個弱模型構建代理教師來提升強學生模型的新框架。該方法在數學和代碼基準測試中優於傳統在策略蒸餾,甚至允許學生超越領域專家。
在大型語言模型(LLM)的能力遷移中,在策略蒸餾(OPD)是一種有效範式,它使學生在自己的生成序列上對齊教師的token級分佈。然而,現有方法通常假設教師至少與學生能力相當,這限制了在缺乏更強教師時的應用場景。例如,當需要蒸餾一個前沿模型時,往往不存在更大的教師模型;而整合多個領域專家又需要昂貴的訓練成本。本文提出弱到強在策略蒸餾(W2S-OPD),一種簡單而有效的框架,通過從多個比學生更小的弱模型中進行蒸餾來提升強學生的能力。
W2S-OPD的核心思想是在logit空間中利用對比對(一個正模型和一個負模型)構建一個代理教師。這兩個模型都比學生小且易於獲得,它們的logit差值可以隔離出特定的能力方向。將該差值加到學生自己的基模型上,就得到一個耦合了該方向且與學生在分佈上相近的代理教師。然後,學生通過最小化自己生成序列上的逐token反向KL散度來蒸餾這個代理教師。
研究團隊實例化了三種對比對:一是後強化學習專家與其強化學習前初始化的對比,隔離強化學習灌輸的技能;二是較大基模型與較小基模型的對比,隔離規模帶來的能力;三是帶有正確提示與錯誤提示的小基模型對比,隔離指向解決方案的實例級方向。在四個數學基準(如GSM8K、MATH等)和三個代碼基準(如HumanEval、MBPP等)上的實驗表明,W2S-OPD不僅優於標準OPD,還能使學生超越領域專家,甚至在所有監督源都比學生弱的情況下仍能持續提升學生性能。分析顯示,不同對比對產生不同信號:RL後和提示對比強調推理框架,而規模對比強調解題過程。該方法的代碼已在GitHub上開源,為LLM蒸餾提供了新的思路。