Modal 本週正式推出 Auto Endpoints,該服務在保持基礎設施可擴展性與魯棒性的同時,提供了業界領先的推理性能。其核心技術是推測解碼,特別適用於延遲敏感的應用場景。
推理延遲主要由四部分構成:客户端與服務器之間的通信延遲、主機與通信開銷、預填充延遲以及解碼延遲。其中,解碼階段往往是最大的瓶頸,因為每個解碼步驟都需要一次完整的前向傳播,從 GPU 顯存加載模型權重到 SM SRAM。針對這些延遲來源,Modal 團隊採用了系統化的優化策略:使用 Modal 服務器縮短通信距離,採用低開銷的推理引擎(如 SGLang),利用 FA4 等高效內核加速預填充,以及通過推測解碼加速解碼階段。
推測解碼的核心思想是讓一個快速的推測模型生成多個候選令牌,然後由目標模型並行驗證。儘管有時會浪費計算資源,但由於 GPU 在未使用推測解碼時並未充分利用算術帶寬,這種方法仍能帶來顯著加速。加速效果與接受長度(平均每次接受的推測令牌數)成正比。
為了最大化接受長度,關鍵在於為特定應用定製推測模型。Modal 與 Decagon 合作,針對其語音 AI 代理產品進行了優化。Decagon 的語音系統需要將自然語言指令精確映射為系統操作,同時要求極低的端到端延遲。通過綜合運用上述優化,Modal 將推理延遲從約 290 毫秒(p50)降至約 190 毫秒,比最好的專有推理提供商還快 60 毫秒以上。
其中最大的收益來自採用定製推測模型。Modal 團隊採用了 Z Lab 的 DFlash 技術,該技術利用目標模型的鍵值投影減少計算冗餘,並支持並行生成推測令牌。與 Z Lab 和 SGLang 合作,他們發佈了高性能開源實現和預訓練推測模型,例如針對 Qwen 3.5 397B-A17B 的推測器比多令牌預測(MTP)提升超過 50%。
此外,Modal 採用“中間訓練”方法:使用任務特定的合成數據微調通用推測模型,避免直接使用用户敏感數據,同時有效提升目標任務性能。例如,對於結構化輸出任務,可通過填充合理內容生成大量合成數據來訓練推測器。還需監控過擬合,確保模型能泛化到生產環境。
總之,通過系統優化各延遲環節,特別是利用先進的推測解碼技術,Modal 實現了超越專有提供商的推理性能,為 AI 代理等延遲敏感應用提供了有力支撐。