Kimi K3 技術部落格:開放前沿智慧
Kimi 推出其最強模型 K3,擁有 2.8 萬億引數,採用 Kimi Delta Attention 和 Attention Residuals 架構,支援原生視覺和百萬 token 上下文。這是全球首個開放的 3T 級模型,在長時間編碼、知識工作和推理方面表現出色。儘管整體效能仍落後於最強大的專有模型,但在多項評估中超越其他測試模型。
Kimi 今天正式釋出其最強模型 Kimi K3,這是一款擁有 2.8 萬億引數的前沿人工智慧模型。Kimi K3 基於 Kimi Delta Attention(KDA)和 Attention Residuals(AttnRes)架構構建,具備原生視覺能力和百萬 token 的上下文視窗。作為全球首個開放的 3T 級模型,K3 專為長時間編碼、知識工作和推理等前沿智慧任務設計。
儘管整體效能仍略遜於最強大的專有模型(如 Claude Fable 5 和 GPT 5.6 Sol),Kimi K3 在內部評估套件中展現了前沿級別的效能,持續優於其他測試模型。目前,Kimi K3 已在 Kimi.com、Kimi Work、Kimi Code 和 Kimi API 上線,預設使用最大思考努力模式,後續將引入低和高努力模式。模型權重將於 2026 年 7 月 27 日全面開源,技術報告屆時也將釋出。
在架構創新方面,Kimi K3 透過 KDA 和 AttnRes 改善了資訊在序列長度和模型深度上的流動。同時,採用混合專家(MoE)模型,啟用 896 個專家中的 16 個,結合 Stable LatentMoE 框架,整體擴充套件效率相比 Kimi K2 提升約 2.5 倍。
Kimi K3 在編碼方面表現突出,能進行長時間工程會話,導航大型程式碼庫,並編排終端工具。其視覺與程式碼結合的能力在遊戲開發、前端設計和 CAD 等領域表現出色。案例包括:GPU 核心最佳化中與 Fable 5 競爭;自主開發 MiniTriton 編譯器,效能媲美 Triton;構建 3D 開放世界遊戲;在 48 小時內自主設計晶片,支援其自身架構的 nano 模型;以及從文獻到程式碼的科研工作流,如重現天體物理中的 I-Love-Q 關係。
在知識工作方面,Kimi K3 可生成互動式研究報告,如對 42 年 ASIC 行業的研究,涉及大量資料檢索和視覺化。Kimi Work 還引入了 Widgets 和 Dashboard 功能,使互動更加視覺化且持久。在影片編輯方面,K3 能建立 3Blue1Brown 風格的動畫,並編輯自己的預告片。
技術上,Kimi K3 採用量化感知訓練,支援 MXFP4 權重和 MXFP8 啟用。訓練採用完全平衡的專家並行方法,推薦在 64 個以上加速器的超節點配置下部署。針對 KDA 的預填充快取問題,Kimi 已向 vLLM 社群貢獻了實現方案。
Kimi K3 現已透過多種渠道可用:iOS、Android 和鴻蒙系統的 Kimi 應用;Windows 和 Apple Silicon Mac 的 Kimi Work 桌面應用;終端中的 Kimi Code;以及 Kimi API 平臺,定價為快取命中輸入每百萬 token 0.30 美元,快取未命中輸入每百萬 token 3.00 美元,輸出每百萬 token 15.00 美元。企業版提供資料隱私和成員管理功能。