跳到主要內容
AI News HubLIVE
站內改寫2 分鐘閱讀

多令牌殘差預測

文章摘要

多令牌殘差預測(MRP)是一種針對擴散語言模型的輕量級模組,透過預測相鄰去噪步驟之間的殘差而非完整分佈,實現了在靜態和動態兩種推理場景下的效能提升。靜態模式下可實現無質量損失的加速(高達1.56倍),動態模式下可恢復因激進閾值解碼而損失的高達+16個百分點的準確率。

多令牌殘差預測
回報錯誤

更正管道尚未開通,可先複製下方文章資訊留存。

查看更正說明
直接讀正文

多令牌殘差預測(Multi-token Residual Prediction, MRP)是一項由Modal Research與紐約大學上海分校HeavyBall Research合作提出的創新技術,旨在最佳化擴散語言模型(DLM)的推理效率。該研究發表於一篇部落格文章,詳細介紹了MRP的設計原理、實驗結果及其在兩種推理場景下的雙重應用。

MRP的核心思想源於對多令牌預測(MTP)的改進。在自迴歸模型中,MTP透過輕量級模組從主幹網路的隱藏狀態預測多個後續令牌,結合推測解碼實現加速。然而,直接將該方法應用於擴散語言模型時遇到了困難:簡單的蒸餾頭在預測多個步驟後精度急劇下降。例如,在SDAR-4B模型上,直接MTP在第一步達到84.8%的GSM8K準確率,但到第四步時已降至1.9%。

研究團隊發現,問題在於完整分佈預測的難度。他們轉而預測相鄰去噪步驟之間的殘差,即當前步驟分佈與下一步分佈之間的差異。由於擴散過程的馬爾可夫性質,每一步只改變少量位置,因此殘差訊號複雜度低,容易學習。基於這一洞察,他們設計了MRP模組:一個輕量級3層Transformer,附加在凍結的DLM主幹上,讀取主幹隱藏狀態並預測殘差對數機率,然後將其加到主幹的原始輸出上。訓練目標採用殘差版本的KL散度,僅在仍掩碼的位置上最小化預測與真實分佈的差異。

實驗表明,MRP在靜態和動態兩種推理場景中均表現出色。在靜態模式下,即每步去掩碼固定數量的令牌,MRP可用作推測解碼的草稿模型,實現無損加速。在SGLang實現中,SDAR-8B模型在GSM8K上達到90.4%準確率和1.40倍吞吐量提升。若採用直接解碼(跳過驗證),速度提升可達1.89倍,同時僅帶來微小質量損失。在動態模式下,即基於置信度閾值批次化去掩碼,MRP可恢復因低閾值而過度揭露令牌導致的準確率損失。例如,在τ=0.5時,SDAR-1.7B模型在GSM8K上的準確率從41.6%提升至59.1%(+17.5點)。

MRP的另一個優勢是靈活性:使用者可根據應用需求在無損加速與有損高速之間自由選擇。這一控制權對於擁有自主推理棧的開發者尤為重要,因為封閉API通常固定了解碼策略。研究團隊已在SDAR-1.7B、4B和8B模型上進行了廣泛驗證,覆蓋GSM8K、MATH500、HumanEval和MBPP等基準,並提供了開原始碼和SGLang實現。

展開要點與分析

文章情報

工程師進階

要點

  • MRP透過預測殘差而非完整分佈,使小型模組能夠準確預測多個去噪步驟。
  • 在靜態去噪中,MRP支援無損推測解碼和有損直接解碼,速度提升可達1.89倍。
  • 在動態去噪中,MRP透過重新評估低閾值下過早揭示的令牌,將質量損失恢復最多+16點。
  • MRP在SDAR-1.7B/4B/8B模型上經過驗證,在GSM8K、MATH500等基準測試中表現優異。

要點與分析由自動化流程生成,可能有誤,請結合原始來源核實。