AI News HubLIVE
站內改寫2 分鐘閱讀

月之暗面Kimi K3現已在Modal上可用

月之暗面釋出了2.8萬億引數的多模態模型Kimi K3,並可在Modal上以每秒460個token的速度執行。該模型採用混合專家架構,支援100萬token上下文視窗和原生視覺。Modal提供了自定義DFlash推測解碼器,大幅提升推理速度。

月之暗面(Moonshot)今日釋出了Kimi K3,一個擁有2.8萬億引數的多模態模型,具備100萬token的上下文視窗和原生視覺能力。該模型現已在Modal平臺上可用,釋出當天即可達到每秒460個token的推理速度。

Modal與月之暗面及vLLM合作,實現了釋出當天的零日支援。使用者可以透過基於token計費的共享API使用K3,也可以選擇專用Auto Endpoint以獲得獨立容量。此外,Modal還提供了一個針對K3架構定製訓練的DFlash推測解碼器。

Kimi K3是目前最強開源模型之一,在Artificial Analysis的智慧指數中排名第四,總分186,其所在層級原本由閉源模型主導。它是一個混合專家(MoE)變換器模型:總引數2.8萬億,每token啟用16個專家(總共896個),上下文視窗達到100萬token,並原生支援視覺。K3專為長週期自主任務設計,月之暗面在內部測試中使用了早期版本進行大部分核心最佳化工作。Kimi Delta Attention(KDA)在序列長度增長時降低了注意力計算成本,而注意力殘差機制允許更深層網路回溯早期注意力輸出,而非僅依賴上一層,這兩項技術共同使K3的擴充套件效率相比K2提高了約2.5倍。

然而,執行這樣一個大模型並非易事。月之暗面在架構上投入了大量精力解決這一問題:從SFT階段開始就進行量化感知訓練,採用MXFP4權重和MXFP8啟用,使模型能在多種硬體上執行;同時重新平衡專家並行,以保持大規模吞吐。當KDA被證明會破壞傳統字首快取時,他們編寫了新的實現並提前貢獻給vLLM。這些幕後工作使得一個3萬億引數級別的開源模型得以提供服務。

Modal進一步最佳化了端點效能,為K3提供了定製DFlash推測解碼器的零日支援。由於K3每任務生成大量token,使用者等待時間主要花在解碼階段,而推測解碼能夠加速這一過程。在自主工作負載中,不使用DFlash時每GPU約50 token/秒,每分鐘0.8百萬token;使用後提升至100 token/秒,每分鐘約1百萬token,每個使用者上限超過200 token/秒。

K3配備了一個MTP(多token預測)頭用於推測解碼,但實踐中發現MTP更適合作為訓練最佳化手段,而專門的推測模型如DFlash能顯著加速生產推理。DFlash一次處理整個塊,根據目標模型特徵進行推測,且沒有額外開銷。DFlash訓練主要是一個資料生成問題,使用32個B300節點,其中28個執行K3(TP8)產生隱藏狀態,4個節點用於訓練推測模型。

Kimi K3現可透過Modal的OpenAI相容共享API(基於token計費)或專用Auto Endpoint使用。Modal提供標準優惠:每月30美元免費計算額度,使用者可免費使用K3共享API。