AI News HubLIVE
站内改写1 分钟阅读

FlowLM:通过扩散到流的适配实现少步语言建模

FlowLM通过高效微调将预训练的扩散语言模型转换为流匹配模型,仅需少量训练周期即可实现高质量少步生成,性能媲美甚至超越2000步扩散采样。实验表明,预测干净数据作为训练目标能更有效引导采样过程。

来源arXiv Computational Linguistics作者: Runzhe Zhang, Letian Chen, Wenpeng Zhang, Zhouhan Lin, Peilin Zhao

在人工智能领域,文本生成模型的发展一直备受关注。扩散模型在生成高质量文本方面表现出色,但其采样过程通常需要数千步才能获得令人满意的结果,这在实际应用中带来了较高的计算成本和延迟。为了克服这一瓶颈,来自研究团队的Runzhe Zhang等五位学者提出了一种名为FlowLM的新方法,通过将预训练的扩散语言模型高效微调为流匹配模型,实现了少步生成,同时保持了与2000步扩散采样相媲美甚至更优的质量。

FlowLM的核心思想是将扩散模型中弯曲的采样轨迹重新对齐为直线流。在扩散模型中,噪声到数据的转换路径通常是弯曲的,这导致采样需要大量步骤。而流匹配模型通过直接学习从噪声到数据的直路径,使得模型能够在极少数步骤内完成高质量生成。研究团队通过高效的微调策略,将预训练的扩散语言模型转换为流匹配模型,仅需少量训练周期即可达到出色的性能。

实验结果表明,经过微调的FlowLM在性能上表现惊艳。与从零开始训练的流匹配模型相比,微调后的FlowLM达到性能饱和所需的训练周期仅为其一半。更重要的是,两种方法都大幅超越了原始的扩散模型。这一结果验证了从预训练扩散模型出发进行微调的有效性,同时也表明了流匹配范式在少步生成中的巨大潜力。

此外,研究团队还探索了更有效的流匹配训练目标。他们发现,直接预测干净数据(clean data)作为训练目标,能够持续引导采样过程朝着真实数据分布前进,从而提升生成质量。这一发现为流匹配模型的训练提供了新的方向,并有望进一步提高少步生成的质量。

该论文共计26页,包含11张图表,于2026年4月6日提交至arXiv。研究人员表示,相关工作代码和资源也将在后续发布。FlowLM的提出为高效文本生成开辟了新路径,尤其适用于需要快速响应的场景,如对话系统、实时内容生成等。随着少步生成技术的进步,我们有望看到更多基于流匹配的高效语言模型应用于实际产品中。