AI News HubLIVE
站內改寫3 分鐘閱讀

如何為Kimi K3構建Day-0 API

Baseten 為 Kimi K3 提供了 Day-0 支援,這是一個 2.8T 引數的新前沿開放模型。本文介紹了在釋出日前執行該模型所需的技術工作,包括硬體配置、權重載入、推理引擎整合、質量驗證、效能最佳化和規模化部署。

Baseten 已在其 Model APIs 上為 Kimi K3 提供 Day-0 支援。Kimi K3 是一個全新的 2.8T 引數開放前沿模型,由 Moonshot AI 開發。感謝 Moonshot AI 提前分享權重,以及 Inferact 和 RadixArk 團隊在整個開發過程中的合作。

Kimi K3 今日在 Baseten Model APIs 上可用,支援視覺輸入和完整的 1M 令牌上下文視窗。作為一個 2.8T 引數的模型,它比任何之前的開放模型都大得多,給構建高效能推理 API 帶來了許多挑戰。新的架構技術使 Kimi K3 能夠超越此前開放前沿模型的萬億引數閾值:Kimi Delta Attention (KDA) 和 Attention Residuals (AttnRes) 作為 Kimi 架構的可擴充套件骨幹;極稀疏的專家,每次僅啟用 896 個專家中的 16 個,透過 Stable LatentMoE 組織;以及用於處理影像輸入並將視覺資訊對映到潛在空間的新視覺編碼器。

里程碑 1:生成第一個令牌

在獲得 Moonshot AI 團隊提前訪問 Kimi K3 權重後,首要任務是讓模型執行起來。生成第一個令牌需要:配置硬體——考慮到 Kimi K3 的大小,我們決定在 NVIDIA GB300 NVL72 系統上執行模型;載入權重——在 MXFP4 格式下,Kimi K3 權重超過 1.4TB;啟動推理引擎——我們與 vLLM 和 SGLang 團隊合作,執行預釋出版本的推理引擎。通常,在構建 Day-0 API 時,早期步驟是將權重轉換為 NVFP4 以提高效能。但 Kimi K3 使用原生 MXFP4 權重和 MXFP8 啟用,我們可以直接使用這些權重。

我們與 Inferact(vLLM)和 RadixArk(SGLang)緊密合作。在 Baseten Inference Stack 上執行 Kimi K3 之前,我們需要與領先的開源推理引擎建立基線。為模型新增對推理引擎的支援並非易事,需要實現核心建模程式碼、為 KDA 等新架構最佳化核心,以及構建從前端(如分詞和工具呼叫)到後端的相容性。vLLM 的早期訪問映象幫助我們建立了基本功能完整性、透過初步評估並設定基線效能目標。SGLang 的早期訪問映象為 Kimi K3 的快速可靠服務提供了參考。

里程碑 2:驗證推理引擎

Kimi K3 是有史以來最智慧的開放模型,必須在推理中真正實現這種智慧。質量驗證可以在不同嚴格級別上進行。簡單的完整性檢查(如使用已知提示呼叫模型或執行輕量級基準)在開發過程中是有用的檢查點。但釋出公共 API 需要更嚴格的基準測試。Moonshot AI 團隊運營的 Kimi Vendor Verifier 幫助推理提供商確保準確、高保真地服務模型權重。透過 Kimi Vendor Verifier 是我們的重要早期里程碑。在服務模型時有很多出錯的機會,但大多數質量問題,尤其是工具呼叫和其他結構化模型行為,源於推理伺服器前端。

里程碑 3:找到正確的配置

推理引擎提供各種配置選項來調整效能。我們發現正確的配置需要對張量並行 (TP) 和專家並行 (EP) 設定、注意力資料並行 (ADP) 切換、批次大小、推測解碼器草稿長度、線性層快取間隔、路由引數和推理引擎設定進行掃描。執行 Kimi K3 需要八個 NVIDIA GB300 GPU 才能將巨大的模型權重灌入 VRAM。然而,GB300 以四個為一組,但 GB300 NVL72 系統具有足夠快的節點間互連,因此我們可以跨節點執行 TP 和 EP。

里程碑 4:最佳化效能

一旦模型在最佳化配置上執行,就有大量推理工程技術可以顯著改善延遲和吞吐量。我們關注推測(使用小草稿模型預測多個令牌)、分離(將預填充和解碼分離到不同工作節點)和快取(分配記憶體以儲存 KV 快取和 KDA 狀態)。一項新穎的最佳化在於分詞器——對於 Kimi K3 這樣的長輸入序列和高 KV 快取複用率的模型,分詞時間可能變得重要。我們構建了一個自定義分詞器,對於長輸入序列,比 tiktoken 快最多 18 倍。

里程碑 5:規模化部署

對 Kimi K3 的行業熱情高漲,釋出時需求巨大。在 GB300 NVL72 系統上,一個節點是 4 個 GPU,因此有 18 個節點。Kimi K3 例項佔用 2 個節點(8 個 GPU);每個 NVL72 機架可執行 9 個副本。我們在多個區域和雲提供商中服務該模型。字首快取命中率是單個副本吞吐量的最關鍵因素,因此我們的 KV 感知路由系統(使用 NVIDIA Dynamo 工具包構建)確保能夠將請求路由到具有熱快取的副本。

在 Baseten 上使用 Kimi K3 構建

我們很高興透過 Model APIs 提供 Day-0 訪問,並期待繼續最佳化該模型的實現,以達到效能和可靠性的最高標準。Moonshot AI 團隊的 Kimi K3 公告包括多種有趣的測試,如編碼任務、研究任務和代理任務。7 月 28 日星期二上午 11 點(太平洋時間),我們將與 Baseten 的前沿部署工程負責人 Joey Zwicker 和 Philip Kie 舉辦關於 Kimi K3 用例的高管簡報會。