AI News HubLIVE
站內改寫1 分鐘閱讀

神經形態擴散語言模型:透過稀疏性和塊去噪解決計算和記憶體瓶頸

自迴歸大語言模型推理效率低,掩碼擴散模型部分解決了記憶體受限問題。本文提出神經形態MDLM(N-MDLM),結合塊擴散和脈衝神經形態計算,進一步提高吞吐量和能效。塊擴散增加每次引數訪問生成的令牌數,脈衝誘導的稀疏性透過跳過非活動通道減少引數流量。實驗表明,N-MDLM在計算受限平臺上也能顯著提升能效和吞吐量。

來源arXiv Computational Linguistics作者: Dengyu Wu, Clement Ruah, Jiechen Chen, Bipin Rajendran, Osvaldo Simeone

自迴歸(AR)大語言模型(LLM)在推理時存在固有的低效問題:每生成一個令牌都需要訪問全部模型引數,這導致操作強度低、能耗高。掩碼擴散語言模型(MDLM)透過允許每次引數訪問生成多個令牌,部分緩解了記憶體受限場景下的這一限制。然而,在當前擁有大量片內記憶體的現代計算平臺上,MDLM的改進效果有限。

為了解決這個問題,本研究提出了一種名為神經形態MDLM(N-MDLM)的新模型。該模型將塊擴散與基於脈衝的神經形態計算相結合,以協同提升吞吐量和能效。塊擴散透過每次引數訪問生成多個令牌來增加令牌吞吐量,而脈衝誘導的稀疏性則透過跳過非活動通道來減少有效的引數流量和計算量。為了深入分析稀疏性與擴散之間的協同效應,研究者開發了一個令牌級的類光暈(roofline)模型,該模型能夠捕捉塊並行生成和脈衝稀疏性對解碼效率的綜合影響。

實驗在翻譯任務上進行,結果表明,得益於脈衝誘導的稀疏性,N-MDLM即使在計算受限的平臺上也能實現能效和吞吐量的大幅提升。相比之下,傳統MDLM在這種平臺上相比自迴歸模型並沒有改善。這項工作為高效語言模型推理提供了新的神經形態計算方向,有望推動未來AI加速器架構的最佳化。