AI News HubLIVE
站内改写2 分钟阅读

序列知识 #898:轨迹即教师:将推理蒸馏到小模型

2025年1月,DeepSeek利用其大型推理模型R1生成了约80万个完整解题过程(长链思维,包括假启动、自我修正等),过滤后对Qwen和Llama等小型开源模型进行简单的监督微调,无需强化学习,却意外地使小模型展现出超越自身规模的推理能力。这挑战了此前认为序列级模仿不适用于推理蒸馏的观点。

来源TheSequence作者: Jesus Rodriguez

2025年1月,DeepSeek公司发布了一项引人注目的研究成果。他们利用其大型推理模型DeepSeek R1,生成了大约80万个完整的解题过程——这些过程以冗长而曲折的思维链形式呈现,包含假启动、自我修正以及偶尔的“等等,让我重新考虑”等步骤。在过滤出正确且可读的轨迹后,DeepSeek团队采取了最朴实无华的方法:对这些轨迹进行简单的监督微调。他们选择了几个现成的开源模型,包括1.5B、7B、14B和32B参数的Qwen系列,以及8B和70B参数的Llama系列。值得注意的是,整个过程没有使用强化学习、反向KL散度、在线策略采样或教师作为评判者等方法,仅仅是基于教师模型输出的下一个词预测训练。

结果令人震惊。蒸馏后的32B模型开始解决那些它本不具备能力的竞赛数学题。7B模型则自发地开始验证自己的推理过程,并在推理中产生分支——这些涌现行为并未被直接训练。这些小型密集模型突然具备了推理能力,其表现堪比十倍于自身规模的大模型。

这一结果看似与先前关于推理蒸馏的理论相悖。在《序列知识》系列中,我们曾详细论证了从正向KL散度到反向KL散度的艰难迁移,并指出不能简单模仿教师的轨迹,因为学生模型在推理时永远不会处于教师模型的状态中。因此,当看到这项十年中最重要的推理蒸馏成果恰恰是简单的序列级模仿时,许多人的第一反应是不解。

然而,这个问题的答案远比“模仿有效”或“模仿无效”更加深刻。关键在于“轨迹”而非“答案”。教师模型生成的完整推理链提供了比最终答案更丰富的信号,包括解决问题的过程、自我纠错的模式以及逻辑演进的路径。学生模型通过学习这些轨迹,实际上学会了如何思考,而不仅仅是输出结果。此外,尽管学生模型在推理过程中可能偏离教师分布,但通过大规模、多样化的轨迹数据,学生模型仍然能够有效泛化。

这项研究不仅重新定义了推理蒸馏的实践方法,也提醒我们:在AI领域,有时最朴素的方法反而带来最惊人的突破。对研究人员而言,它意味着在追求复杂算法之前,一个简单但数据丰富的基线可能已经足够强大。对应用开发者而言,这意味着他们可以更轻松地将大型模型的能力迁移到小型、高效的部署模型中。

总之,DeepSeek R1的蒸馏实验证明了“轨迹即教师”这一理念的威力,为未来更高效、更小型的推理模型开辟了新的道路。