Kimi K3 開放權重模型:中國最大的人工智慧押注記憶體而非算力
月之暗面釋出Kimi K3,一個擁有2.8萬億引數的開放權重模型,採用混合專家架構、量化訓練和Delta注意力機制,以記憶體池化策略應對美國晶片限制。儘管引數龐大,但模型透過降低計算需求來適配受限硬體,實際部署仍需資料中心級基礎設施,且軟體生態尚未完全就緒。
月之暗面於7月16日釋出了Kimi K3開放權重模型,其2.8萬億引數立即成為焦點。這是目前最大的開放權重模型,將模型規模推升至3T級別。然而,引數數量只是K3最引人注目的部分,卻最不能解釋其執行原理。
K3的設計核心在於用記憶體換計算。美國晶片出口管制限制了中國獲取先進計算晶片,月之暗面透過架構創新來繞過這一限制。主要技術包括混合專家(MoE)架構:模型分為896個專家模組,每次只呼叫16個,計算量大幅下降,但所有2.8萬億引數仍需駐留記憶體。為此,月之暗面採用了量化感知訓練,將引數精度從16位降至4位,使模型大小從5.6TB縮減至約1.4TB。此外,Kimi Delta注意力機制針對長文本處理的記憶體瓶頸進行最佳化,支援百萬token上下文,配合快取程式碼顯著降低推理成本。
月之暗面建議K3在64個或更多加速器上執行,類似於華為的CloudMatrix方案。這表明真正的突破口在於透過大量普通晶片聚合記憶體,而非依賴高階計算晶片。然而,這些晶片是否基於國產矽尚不明確——測試使用了NVIDIA H200和未具名的“替代GPU”。美國已透過法案限制中國透過雲租用海外算力,而中國在記憶體領域的技術差距比計算領域更大。2025年8月的貿易談判中,中國請求放寬高頻寬記憶體限制,而非光刻機或臺積電服務,這凸顯了記憶體瓶頸的關鍵性。
對企業而言,K3的開放權重意味著可以自主部署,但代價高昂。模型權重約1.4TB,需要資料中心級基礎設施。大多數企業可能選擇租賃專用算力,這雖然能遵守資料主權法規,但無法擺脫對基礎設施提供商的依賴。軟體生態尚未就緒,主流開源推理工具尚不支援K3的架構創新,實際可用時間可能晚於7月27日的權重發布日。
定價方面,K3輸入token每百萬3美元,輸出每百萬15美元,高於前代和部分競品,但低於Fable 5。初始僅支援最大推理模式,後續將推出低推理模式。企業需按任務總成本預算。
效能上,K3在Arena前端程式碼測試中排名第一,但月之暗面承認整體效能仍落後於Claude Fable 5和GPT 5.6 Sol,並列出三點侷限:生成質量可能不穩定、意圖模糊時可能自主決策、使用者體驗有差距。此外,SWE馬拉松評估中Fable 5曾觸發35%的後備模式,可能影響得分。所有基準測試結果需等權重公開後獨立驗證。
美國銀行分析師指出,K3表明在算力受限下,大規模預訓練結合架構創新仍能帶來躍升。開放權重模型的使用量正在快速增長,但K3能否成為主流取決於其實際部署成本和效能表現。