AI News HubLIVE
站內改寫2 分鐘閱讀

月之暗面Kimi K3現已在Modal上可用

月之暗面發佈了2.8萬億參數的多模態模型Kimi K3,並可在Modal上以每秒460個token的速度運行。該模型採用混合專家架構,支持100萬token上下文窗口和原生視覺。Modal提供了自定義DFlash推測解碼器,大幅提升推理速度。

月之暗面(Moonshot)今日發佈了Kimi K3,一個擁有2.8萬億參數的多模態模型,具備100萬token的上下文窗口和原生視覺能力。該模型現已在Modal平台上可用,發佈當天即可達到每秒460個token的推理速度。

Modal與月之暗面及vLLM合作,實現了發佈當天的零日支持。用户可以通過基於token計費的共享API使用K3,也可以選擇專用Auto Endpoint以獲得獨立容量。此外,Modal還提供了一個針對K3架構定製訓練的DFlash推測解碼器。

Kimi K3是目前最強開源模型之一,在Artificial Analysis的智能指數中排名第四,總分186,其所在層級原本由閉源模型主導。它是一個混合專家(MoE)變換器模型:總參數2.8萬億,每token激活16個專家(總共896個),上下文窗口達到100萬token,並原生支持視覺。K3專為長週期自主任務設計,月之暗面在內部測試中使用了早期版本進行大部分內核優化工作。Kimi Delta Attention(KDA)在序列長度增長時降低了注意力計算成本,而注意力殘差機制允許更深層網絡回溯早期注意力輸出,而非僅依賴上一層,這兩項技術共同使K3的擴展效率相比K2提高了約2.5倍。

然而,運行這樣一個大模型並非易事。月之暗面在架構上投入了大量精力解決這一問題:從SFT階段開始就進行量化感知訓練,採用MXFP4權重和MXFP8激活,使模型能在多種硬件上運行;同時重新平衡專家並行,以保持大規模吞吐。當KDA被證明會破壞傳統前綴緩存時,他們編寫了新的實現並提前貢獻給vLLM。這些幕後工作使得一個3萬億參數級別的開源模型得以提供服務。

Modal進一步優化了端點性能,為K3提供了定製DFlash推測解碼器的零日支持。由於K3每任務生成大量token,用户等待時間主要花在解碼階段,而推測解碼能夠加速這一過程。在自主工作負載中,不使用DFlash時每GPU約50 token/秒,每分鐘0.8百萬token;使用後提升至100 token/秒,每分鐘約1百萬token,每個用户上限超過200 token/秒。

K3配備了一個MTP(多token預測)頭用於推測解碼,但實踐中發現MTP更適合作為訓練優化手段,而專門的推測模型如DFlash能顯著加速生產推理。DFlash一次處理整個塊,根據目標模型特徵進行推測,且沒有額外開銷。DFlash訓練主要是一個數據生成問題,使用32個B300節點,其中28個運行K3(TP8)產生隱藏狀態,4個節點用於訓練推測模型。

Kimi K3現可通過Modal的OpenAI兼容共享API(基於token計費)或專用Auto Endpoint使用。Modal提供標準優惠:每月30美元免費計算額度,用户可免費使用K3共享API。

月之暗面Kimi K3現已在Modal上可用 | AI News Hub