AI News HubLIVE
站内改写2 分钟阅读

多掩码扩散语言模型用于少步生成

提出多掩码扩散模型(MultiMDM),通过引入多个掩码状态解决传统掩码扩散模型在少步生成中终端熵为零的问题,实现高质量少步文本生成。

来源arXiv Computational Linguistics作者: Sijin Chen, Yinuo Ren, Heyang Zhao, Ziheng Cheng, Quanquan Gu, Lexing Ying

近日,一篇题为《多掩码扩散语言模型用于少步生成》的论文被COLM 2026接收。该研究针对掩码扩散模型(MDM)在少步生成中的局限性,提出了一种创新的多掩码扩散模型(MultiMDM)。

传统MDM在正向扩散过程中,所有轨迹最终都坍缩到一个单一的全掩码状态,这导致终端熵为零,无法有效支持一致性风格的少步生成。尽管近期有基于均匀状态扩散的少步替代方案避免了这一问题,但它们难以区分干净令牌和噪声,从而损害了建模质量和训练效率。

MultiMDM的核心思想是在正向过程中为每个干净令牌首先推向一个指定的掩码,然后逐渐在多个掩码之间混合。这样一来,反向过程就获得了“草稿”能力:先预测一个指定的掩码,再细化出干净的令牌。研究团队推导出了一个闭式的证据下界(ELBO)训练目标,该目标支持从预训练的MDM进行持续训练。此外,他们还提出了一种纯离散状态的一致性蒸馏方案,通过共享的Gumbel耦合来降低路径熵。

实验在预训练和蒸馏两个场景下进行,结果表明MultiMDM为原则性的少步生成提供了有效基础。该成果被认为推动了语言生成模型在效率和质量上的平衡发展。

具体而言,研究人员首先在标准语言建模基准上进行了预训练实验,比较了MultiMDM与传统MDM以及均匀状态扩散模型的性能。结果显示,在相同步数下,MultiMDM生成的文本质量显著优于传统MDM,并且接近或超越了均匀状态扩散模型的表现。更重要的是,在少步生成(例如2步或4步)场景中,MultiMDM的优势尤为突出,因为其保留了掩码结构的优势,同时避免了终端熵为零的问题。

在蒸馏实验中,研究团队利用一致性蒸馏技术将MultiMDM教师模型的知识迁移到学生模型中,进一步提升了推理速度。共享Gumbel耦合的引入使得蒸馏过程更加稳定,并减少了路径熵,从而提高了蒸馏模型的生成质量。

这项研究的意义在于,它为少步生成提供了一种新的原则性框架,有望在实时应用场景中大幅降低推理成本,同时保持生成文本的高质量。未来,MultiMDM可以扩展到其他模态,如图像和音频生成,为扩散模型在效率与质量之间的权衡提供新的思路。