AI News HubLIVE
站内改写2 分钟阅读

DC-Leap:通过草稿引导的连续跳跃解码实现dLLM的无训练加速

DC-Leap是一种无需训练即可加速扩散大语言模型(dLLM)推理的框架。它通过动态连续验证和草稿引导解码克服了由联合概率依赖误差(JPDE)引起的过度保守置信阈值问题,在保持生成质量的同时实现显著加速。实验表明,在MBPP长序列生成任务上速度提升可达53.19倍,结合KV-Cache后可达105.02倍。

来源arXiv AI作者: Yanhua Jiao, Tianyi Wu, Xiaoxi Sun, Yulin Li, HuiLing Zhen, Libo Qin, Baotian Hu, Zhuotao Tian, Min Zhang

扩散大语言模型(dLLM)在生成质量上表现出色,但其推理效率长期受限于并行解码策略中的过度保守置信阈值。这些阈值源于联合概率依赖误差(Joint Probability Dependence Error, JPDE),该误差迫使模型在解码过程中对每个新token要求极高的置信度,以防错误累积,从而导致冗余的去噪迭代和次优的推理速度。针对这一瓶颈,来自研究团队的最新论文《DC-Leap: Training-Free Acceleration of dLLMs via Draft-Guided Contiguous Leaping Decoding》提出了一种无需训练的加速框架DC-Leap,旨在在不牺牲生成质量的前提下显著提升dLLM的推理效率。

DC-Leap的核心创新体现在两个关键机制上:动态连续验证(Dynamic Contiguous Verification)和草稿引导解码(Draft-Guided Decoding)。动态连续验证策略在并行解码过程中引入严格有序的因果约束,通过逐步验证token之间的依赖关系来有效消除JPDE的影响。与传统的固定置信阈值不同,这一机制能够在中等置信度区域进行可靠加速,从而避免了因过度保守导致的性能损失。实验表明,该策略在保持与基线方法相媲美的生成质量的同时,大幅减少了不必要的去噪迭代次数。

草稿引导解码机制则进一步提升了加速效果。该机制利用一个草稿模型向前跳跃多个token,为后续生成提供前瞻性上下文。这种方法不仅扩展了模型的上下文窗口,还保留了双向注意力在推理过程中的结构优势,确保了生成内容的一致性和连贯性。通过将草稿模型与主模型协同工作,DC-Leap能够在不增加训练成本的情况下实现高效的并行解码。

研究团队在多个标准基准上进行了全面实验。结果显示,DC-Leap在长序列生成任务中表现尤为突出。例如,在MBPP数据集上,DC-Leap实现了最高53.19倍的加速;当与KV-Cache技术结合时,加速比进一步提升至105.02倍,且生成质量与基线方法相比几乎没有损失。这些数据充分证明了DC-Leap在dLLM加速方面的巨大潜力。

目前,研究者已将DC-Leap的代码开源在GitHub上(https://github.com/ffh-wyls/DC-Leap),供社区验证和进一步开发。这一工作为dLLM的高效推理提供了一种新颖且实用的解决方案,有望推动该模型在资源受限环境中的部署。未来,研究人员计划将DC-Leap扩展到其他类型的扩散模型,并探索其在实时应用中的可能。