更好的开始,更好的结束:引导式迭代自我推理蒸馏用于压缩推理
本文提出BIRD,一种两阶段自我推理蒸馏方法,通过先采样简洁解并进行提示切换SFT,然后应用在线逆KL蒸馏,显著提升了大语言模型在长链推理中的效率。在Qwen3-8B上,MATH-500准确率从86.2%提升至92.0%,同时响应长度从3099降至1115 tokens。
大型推理模型通常依赖长链思维(CoT)来解决复杂问题,但大量的计算资源被浪费在冗余推导、重复自我验证和无关绕路上。现有的在线自我蒸馏方法通过让学生模型在自身生成前缀上匹配简洁版本来降低计算成本。然而,这些方法存在一个初始化瓶颈:由于监督信号仅应用于已访问的前缀,从冗长的基模型开始训练会将KL散度损失置于充满噪声、冗余或偏离正确方向的上下文之中。在这种情况下,简洁的教师模型只能提供局部修正,学生模型仍会探索高效推理器应避免的轨迹。
为了解决这一问题,来自多个机构的研究人员提出了BIRD(引导式迭代自我推理蒸馏),这是一种两阶段自我推理蒸馏方法。在第一阶段,BIRD从基模型中采样简洁解,仅保留答案正确的轨迹,并执行轻量级的提示切换SFT步骤。这些轨迹在简洁指令下生成,但在原始任务提示下学习,从而将指令诱导的简洁性转化为默认推理行为。第一阶段结束后,模型已经具备了生成更简洁推理路径的能力。
第二阶段,从这一预热模型开始,BIRD应用在线逆KL蒸馏,使用简洁的自教师模型在更干净、信息量更大的前缀上进行训练。这使得模型能够进一步压缩推理链,同时保持甚至提升准确性。
在Qwen3系列模型上的实验验证了BIRD的有效性。以Qwen3-8B为例,在MATH-500基准测试上,准确率从86.2%提升至92.0%,同时平均响应长度从3099 tokens减少至1115 tokens,大幅降低了计算开销。在AIME基准测试上也取得了类似的改善。这些结果强调了前缀支持作为高效推理蒸馏核心因素的重要性。BIRD不仅提升了计算效率,还保持了模型的推理质量,为未来在资源受限场景下部署大型推理模型提供了新的思路。该论文由Leichao Dong等人于2026年7月17日提交至arXiv,属于计算与语言(cs.CL)领域。研究团队通过实验证明,相比于简单的提示工程或冷启动在线蒸馏,BIRD在多个基准上均表现出更优的准确率-效率折中。这一工作为推理模型的压缩和高效部署提供了实用方案,尤其适用于需要快速响应的应用场景。