跳到主要內容
AI News HubLIVE
站內改寫2 分鐘閱讀

透過推測解碼實現最先進的推理延遲

文章摘要

Modal與Decagon合作,利用推測解碼將推理延遲降低100毫秒,超越了專有推理提供商。本文詳細介紹了透過最佳化通訊延遲、主機開銷、預填充延遲和解碼延遲來實現低延遲的完整策略,並重點展示了為特定應用定製推測模型(DFlash技術)如何帶來顯著效能提升。

透過推測解碼實現最先進的推理延遲
回報錯誤

更正管道尚未開通,可先複製下方文章資訊留存。

查看更正說明
直接讀正文

Modal 本週正式推出 Auto Endpoints,該服務在保持基礎設施可擴充套件性與魯棒性的同時,提供了業界領先的推理效能。其核心技術是推測解碼,特別適用於延遲敏感的應用場景。

推理延遲主要由四部分構成:客戶端與伺服器之間的通訊延遲、主機與通訊開銷、預填充延遲以及解碼延遲。其中,解碼階段往往是最大的瓶頸,因為每個解碼步驟都需要一次完整的前向傳播,從 GPU 視訊記憶體載入模型權重到 SM SRAM。針對這些延遲來源,Modal 團隊採用了系統化的最佳化策略:使用 Modal 伺服器縮短通訊距離,採用低開銷的推理引擎(如 SGLang),利用 FA4 等高效核心加速預填充,以及透過推測解碼加速解碼階段。

推測解碼的核心思想是讓一個快速的推測模型生成多個候選令牌,然後由目標模型並行驗證。儘管有時會浪費計算資源,但由於 GPU 在未使用推測解碼時並未充分利用算術頻寬,這種方法仍能帶來顯著加速。加速效果與接受長度(平均每次接受的推測令牌數)成正比。

為了最大化接受長度,關鍵在於為特定應用定製推測模型。Modal 與 Decagon 合作,針對其語音 AI 代理產品進行了最佳化。Decagon 的語音系統需要將自然語言指令精確對映為系統操作,同時要求極低的端到端延遲。透過綜合運用上述最佳化,Modal 將推理延遲從約 290 毫秒(p50)降至約 190 毫秒,比最好的專有推理提供商還快 60 毫秒以上。

其中最大的收益來自採用定製推測模型。Modal 團隊採用了 Z Lab 的 DFlash 技術,該技術利用目標模型的鍵值投影減少計算冗餘,並支援並行生成推測令牌。與 Z Lab 和 SGLang 合作,他們釋出了高效能開源實現和預訓練推測模型,例如針對 Qwen 3.5 397B-A17B 的推測器比多令牌預測(MTP)提升超過 50%。

此外,Modal 採用“中間訓練”方法:使用任務特定的合成資料微調通用推測模型,避免直接使用使用者敏感資料,同時有效提升目標任務效能。例如,對於結構化輸出任務,可透過填充合理內容生成大量合成資料來訓練推測器。還需監控過擬合,確保模型能泛化到生產環境。

總之,透過系統最佳化各延遲環節,特別是利用先進的推測解碼技術,Modal 實現了超越專有提供商的推理效能,為 AI 代理等延遲敏感應用提供了有力支撐。

展開要點與分析

文章情報

工程師進階

要點

  • Modal Auto Endpoints透過推測解碼實現低延遲推理,關鍵最佳化是使用Blackwell GPU、SGLang引擎和Modal伺服器。
  • 推測解碼透過並行處理多個推測令牌來減少解碼階段延遲,且效率主要取決於接受長度。
  • 定製推測模型(如基於DFlash技術)可以大幅提升接受長度,從而顯著降低端到端延遲。
  • 透過使用合成資料微調通用推測模型,無需暴露使用者資料即可適應特定任務。

要點與分析由自動化流程生成,可能有誤,請結合原始來源核實。