多令牌殘差預測(Multi-token Residual Prediction, MRP)是一項由Modal Research與紐約大學上海分校HeavyBall Research合作提出的創新技術,旨在最佳化擴散語言模型(DLM)的推理效率。該研究發表於一篇部落格文章,詳細介紹了MRP的設計原理、實驗結果及其在兩種推理場景下的雙重應用。
MRP的核心思想源於對多令牌預測(MTP)的改進。在自迴歸模型中,MTP透過輕量級模組從主幹網路的隱藏狀態預測多個後續令牌,結合推測解碼實現加速。然而,直接將該方法應用於擴散語言模型時遇到了困難:簡單的蒸餾頭在預測多個步驟後精度急劇下降。例如,在SDAR-4B模型上,直接MTP在第一步達到84.8%的GSM8K準確率,但到第四步時已降至1.9%。
研究團隊發現,問題在於完整分佈預測的難度。他們轉而預測相鄰去噪步驟之間的殘差,即當前步驟分佈與下一步分佈之間的差異。由於擴散過程的馬爾可夫性質,每一步只改變少量位置,因此殘差訊號複雜度低,容易學習。基於這一洞察,他們設計了MRP模組:一個輕量級3層Transformer,附加在凍結的DLM主幹上,讀取主幹隱藏狀態並預測殘差對數機率,然後將其加到主幹的原始輸出上。訓練目標採用殘差版本的KL散度,僅在仍掩碼的位置上最小化預測與真實分佈的差異。
實驗表明,MRP在靜態和動態兩種推理場景中均表現出色。在靜態模式下,即每步去掩碼固定數量的令牌,MRP可用作推測解碼的草稿模型,實現無損加速。在SGLang實現中,SDAR-8B模型在GSM8K上達到90.4%準確率和1.40倍吞吐量提升。若採用直接解碼(跳過驗證),速度提升可達1.89倍,同時僅帶來微小質量損失。在動態模式下,即基於置信度閾值批次化去掩碼,MRP可恢復因低閾值而過度揭露令牌導致的準確率損失。例如,在τ=0.5時,SDAR-1.7B模型在GSM8K上的準確率從41.6%提升至59.1%(+17.5點)。
MRP的另一個優勢是靈活性:使用者可根據應用需求在無損加速與有損高速之間自由選擇。這一控制權對於擁有自主推理棧的開發者尤為重要,因為封閉API通常固定了解碼策略。研究團隊已在SDAR-1.7B、4B和8B模型上進行了廣泛驗證,覆蓋GSM8K、MATH500、HumanEval和MBPP等基準,並提供了開原始碼和SGLang實現。