AI News HubLIVE
站內改寫2 分鐘閱讀

序列知識 #898:軌跡即教師:將推理蒸餾到小模型

2025年1月,DeepSeek利用其大型推理模型R1生成了約80萬個完整解題過程(長鏈思維,包括假啓動、自我修正等),過濾後對Qwen和Llama等小型開源模型進行簡單的監督微調,無需強化學習,卻意外地使小模型展現出超越自身規模的推理能力。這挑戰了此前認為序列級模仿不適用於推理蒸餾的觀點。

來源TheSequence作者: Jesus Rodriguez

2025年1月,DeepSeek公司發佈了一項引人注目的研究成果。他們利用其大型推理模型DeepSeek R1,生成了大約80萬個完整的解題過程——這些過程以冗長而曲折的思維鍊形式呈現,包含假啓動、自我修正以及偶爾的“等等,讓我重新考慮”等步驟。在過濾出正確且可讀的軌跡後,DeepSeek團隊採取了最樸實無華的方法:對這些軌跡進行簡單的監督微調。他們選擇了幾個現成的開源模型,包括1.5B、7B、14B和32B參數的Qwen系列,以及8B和70B參數的Llama系列。值得注意的是,整個過程沒有使用強化學習、反向KL散度、在線策略採樣或教師作為評判者等方法,僅僅是基於教師模型輸出的下一個詞預測訓練。

結果令人震驚。蒸餾後的32B模型開始解決那些它本不具備能力的競賽數學題。7B模型則自發地開始驗證自己的推理過程,並在推理中產生分支——這些湧現行為並未被直接訓練。這些小型密集模型突然具備了推理能力,其表現堪比十倍於自身規模的大模型。

這一結果看似與先前關於推理蒸餾的理論相悖。在《序列知識》系列中,我們曾詳細論證了從正向KL散度到反向KL散度的艱難遷移,並指出不能簡單模仿教師的軌跡,因為學生模型在推理時永遠不會處於教師模型的狀態中。因此,當看到這項十年中最重要的推理蒸餾成果恰恰是簡單的序列級模仿時,許多人的第一反應是不解。

然而,這個問題的答案遠比“模仿有效”或“模仿無效”更加深刻。關鍵在於“軌跡”而非“答案”。教師模型生成的完整推理鏈提供了比最終答案更豐富的信號,包括解決問題的過程、自我糾錯的模式以及邏輯演進的路徑。學生模型通過學習這些軌跡,實際上學會了如何思考,而不僅僅是輸出結果。此外,儘管學生模型在推理過程中可能偏離教師分佈,但通過大規模、多樣化的軌跡數據,學生模型仍然能夠有效泛化。

這項研究不僅重新定義了推理蒸餾的實踐方法,也提醒我們:在AI領域,有時最樸素的方法反而帶來最驚人的突破。對研究人員而言,它意味着在追求複雜算法之前,一個簡單但數據豐富的基線可能已經足夠強大。對應用開發者而言,這意味着他們可以更輕鬆地將大型模型的能力遷移到小型、高效的部署模型中。

總之,DeepSeek R1的蒸餾實驗證明了“軌跡即教師”這一理念的威力,為未來更高效、更小型的推理模型開闢了新的道路。