跳到主要內容
AI News HubLIVE
站內改寫2 分鐘閱讀

通過推測解碼實現最先進的推理延遲

文章摘要

Modal與Decagon合作,利用推測解碼將推理延遲降低100毫秒,超越了專有推理提供商。本文詳細介紹了通過優化通信延遲、主機開銷、預填充延遲和解碼延遲來實現低延遲的完整策略,並重點展示了為特定應用定製推測模型(DFlash技術)如何帶來顯著性能提升。

通過推測解碼實現最先進的推理延遲
報告錯誤

更正渠道尚未開通,可先複製下方文章資訊留存。

查看更正說明
直接讀正文

Modal 本週正式推出 Auto Endpoints,該服務在保持基礎設施可擴展性與魯棒性的同時,提供了業界領先的推理性能。其核心技術是推測解碼,特別適用於延遲敏感的應用場景。

推理延遲主要由四部分構成:客户端與服務器之間的通信延遲、主機與通信開銷、預填充延遲以及解碼延遲。其中,解碼階段往往是最大的瓶頸,因為每個解碼步驟都需要一次完整的前向傳播,從 GPU 顯存加載模型權重到 SM SRAM。針對這些延遲來源,Modal 團隊採用了系統化的優化策略:使用 Modal 服務器縮短通信距離,採用低開銷的推理引擎(如 SGLang),利用 FA4 等高效內核加速預填充,以及通過推測解碼加速解碼階段。

推測解碼的核心思想是讓一個快速的推測模型生成多個候選令牌,然後由目標模型並行驗證。儘管有時會浪費計算資源,但由於 GPU 在未使用推測解碼時並未充分利用算術帶寬,這種方法仍能帶來顯著加速。加速效果與接受長度(平均每次接受的推測令牌數)成正比。

為了最大化接受長度,關鍵在於為特定應用定製推測模型。Modal 與 Decagon 合作,針對其語音 AI 代理產品進行了優化。Decagon 的語音系統需要將自然語言指令精確映射為系統操作,同時要求極低的端到端延遲。通過綜合運用上述優化,Modal 將推理延遲從約 290 毫秒(p50)降至約 190 毫秒,比最好的專有推理提供商還快 60 毫秒以上。

其中最大的收益來自採用定製推測模型。Modal 團隊採用了 Z Lab 的 DFlash 技術,該技術利用目標模型的鍵值投影減少計算冗餘,並支持並行生成推測令牌。與 Z Lab 和 SGLang 合作,他們發佈了高性能開源實現和預訓練推測模型,例如針對 Qwen 3.5 397B-A17B 的推測器比多令牌預測(MTP)提升超過 50%。

此外,Modal 採用“中間訓練”方法:使用任務特定的合成數據微調通用推測模型,避免直接使用用户敏感數據,同時有效提升目標任務性能。例如,對於結構化輸出任務,可通過填充合理內容生成大量合成數據來訓練推測器。還需監控過擬合,確保模型能泛化到生產環境。

總之,通過系統優化各延遲環節,特別是利用先進的推測解碼技術,Modal 實現了超越專有提供商的推理性能,為 AI 代理等延遲敏感應用提供了有力支撐。

展開要點與分析

文章情報

工程師進階

要點

  • Modal Auto Endpoints通過推測解碼實現低延遲推理,關鍵優化是使用Blackwell GPU、SGLang引擎和Modal服務器。
  • 推測解碼通過並行處理多個推測令牌來減少解碼階段延遲,且效率主要取決於接受長度。
  • 定製推測模型(如基於DFlash技術)可以大幅提升接受長度,從而顯著降低端到端延遲。
  • 通過使用合成數據微調通用推測模型,無需暴露用户數據即可適應特定任務。

要點與分析由自動化流程生成,可能有誤,請結合原始來源核實。