AI News HubLIVE
站内改写1 分钟阅读

分布校正的离线数据蒸馏用于大型语言模型

本文提出了一种分布校正的离线推理蒸馏框架,用于将大型语言模型的推理能力迁移至小模型。该方法在保持离线蒸馏高效率的同时,通过自适应调整教师监督信号以匹配学生模型的在线分布,有效缓解了训练与推理之间的分布漂移问题。在多个数学推理基准测试中,该方法显著提升了推理准确率和稳定性。

来源arXiv Computational Linguistics作者: Yumeng Zhang, Zhengbang Yang, Yevin Nikhel Goonatilake, Zhuangdi Zhu

来自Yumeng Zhang等人的最新研究提出了一个名为“分布校正离线数据蒸馏”的框架,旨在解决大型语言模型(LLM)知识蒸馏中的关键挑战。该研究已被提交至arXiv(编号2605.14071),并于2026年5月13日发布。

背景与问题 将强大的大型语言模型(如GPT-4)的推理能力蒸馏到较小的模型中,对于资源受限场景具有重要意义。然而,现有方法面临根本性权衡:离线蒸馏使用教师模型生成的推理轨迹进行训练,虽然效率高且质量好,但学生模型在训练时使用教师前缀,而在推理时使用自身生成的前缀,导致分布漂移和错误累积。另一方面,在线策略蒸馏虽能匹配推理分布,但需要昂贵的在线采样,且早期训练生成低质量轨迹。

方法创新 该研究提出的框架完全基于离线数据,但通过自适应加权教师监督信号来纠正分布漂移。具体而言,它动态强调那些与学生在线模型当前分布更一致的教师示例,从而在不牺牲数据效率的前提下弥合训练与推理间隙。该方法无需任何在线交互,仅通过精心设计的权重分配优化离线训练。

实验结果 在数学推理基准GSM8K、MATH、MATH500以及更具挑战性的竞赛级任务(如AMC、AIME、OlympiadBench)上,该框架相比先前离线蒸馏算法取得了更高的推理准确率,并生成了更稳定的推理轨迹。此外,模型仍保持了良好的指令遵循能力。研究表明,轻量级的分布校正训练能显著强化离线推理蒸馏,无需在线生成。

意义与影响 这项工作的意义在于,它为离线蒸馏提供了一种实用且经济的改进方案,特别适合无法负担在线采样成本的部署场景。通过纠正分布漂移,该方法在不增加额外成本的情况下提升了蒸馏效果,有望推动小型模型在数学推理等复杂任务中的应用。