神经形态扩散语言模型:通过稀疏性和块去噪解决计算和内存瓶颈
自回归大语言模型推理效率低,掩码扩散模型部分解决了内存受限问题。本文提出神经形态MDLM(N-MDLM),结合块扩散和脉冲神经形态计算,进一步提高吞吐量和能效。块扩散增加每次参数访问生成的令牌数,脉冲诱导的稀疏性通过跳过非活动通道减少参数流量。实验表明,N-MDLM在计算受限平台上也能显著提升能效和吞吐量。
来源arXiv Computational Linguistics作者: Dengyu Wu, Clement Ruah, Jiechen Chen, Bipin Rajendran, Osvaldo Simeone
自回归(AR)大语言模型(LLM)在推理时存在固有的低效问题:每生成一个令牌都需要访问全部模型参数,这导致操作强度低、能耗高。掩码扩散语言模型(MDLM)通过允许每次参数访问生成多个令牌,部分缓解了内存受限场景下的这一限制。然而,在当前拥有大量片内内存的现代计算平台上,MDLM的改进效果有限。
为了解决这个问题,本研究提出了一种名为神经形态MDLM(N-MDLM)的新模型。该模型将块扩散与基于脉冲的神经形态计算相结合,以协同提升吞吐量和能效。块扩散通过每次参数访问生成多个令牌来增加令牌吞吐量,而脉冲诱导的稀疏性则通过跳过非活动通道来减少有效的参数流量和计算量。为了深入分析稀疏性与扩散之间的协同效应,研究者开发了一个令牌级的类光晕(roofline)模型,该模型能够捕捉块并行生成和脉冲稀疏性对解码效率的综合影响。
实验在翻译任务上进行,结果表明,得益于脉冲诱导的稀疏性,N-MDLM即使在计算受限的平台上也能实现能效和吞吐量的大幅提升。相比之下,传统MDLM在这种平台上相比自回归模型并没有改善。这项工作为高效语言模型推理提供了新的神经形态计算方向,有望推动未来AI加速器架构的优化。