AI News HubLIVE
站內改寫2 分鐘閱讀

Kimi K3 完全開發者指南

Kimi K3 是 Moonshot AI 推出的 2.8 萬億引數開源權重模型,也是首個 3 萬億引數級別的開源模型。本文介紹其架構亮點、Together AI 上的呼叫方式、推理強度、視覺輸入、結構化輸出、工具呼叫與動態工具載入等關鍵開發要點。

Kimi K3 是 Moonshot AI 目前最強的模型,也是世界上第一個進入 3 萬億引數級別的開源權重模型。它擁有 2.8 萬億引數,是迄今最大的開源權重模型,目標是為長期編碼、端到端知識工作和深度推理等前沿任務提供支援。Together AI 正與 Moonshot 團隊直接合作,在美國基礎設施上提供該模型,支援完整的 1M 上下文、自動字首快取和 OpenAI 相容 API。

在架構層面,K3 引入了兩項關鍵更新:Kimi Delta Attention(KDA)是一種混合線性注意力機制,為超長上下文的注意力擴充套件提供了高效基礎;Attention Residuals(AttnRes)則跨網路深度選擇性地檢索表示,而非均勻累積。Moonshot 還透過 Stable LatentMoE 框架進一步推進了專家混合稀疏性:模型共有 896 個專家,每個 token 只啟用約 16 個,即約 2% 的專家。為了在這種稀疏度下穩定訓練,團隊加入了 Quantile Balancing(基於路由器分數分位數分配專家)、Per-Head Muon(獨立最佳化注意力頭)、Sigmoid Tanh Unit(改進啟用控制)和 Gated MLA(增強注意力選擇性)等支援技術。

在 Together AI 上呼叫 K3 非常簡單。安裝 together>=2.0.0 後,設定 TOGETHER_API_KEY,即可透過 client.chat.completions.create 傳送訊息。頂級欄位 reasoning_effort 支援 low、high、max 三檔,預設 max,也可以透過 reasoning={'enabled': False} 關閉思考,此時不會計費思考 token。流式響應會區分 reasoning_content(思考過程)與最終答案的 content 增量。

視覺方面,K3 支援透過 URL 或 base64 傳入多張圖片。雖然沒有圖片數量上限,但整個請求體需小於 100 MB;官方建議圖片解析度不超過 4K(4096x2160),更高的解析度只會增加處理時間和 token 消耗。結構化輸出可使用 response_format 搭配 json_schema 和 strict: true,也可以使用更寬鬆的 json_object 模式;注意要留足 max_tokens,因為思考過程會先於 schema 約束 token 輸出。

工具呼叫遵循標準 OpenAI 迴圈:宣告 tools,模型返回 tool_calls 後追加完整的助手訊息,再為每次呼叫追加帶匹配 tool_call_id 的 tool 訊息,然後再次呼叫。可用 tool_choice='required' 強制首輪呼叫工具,之後再切回 'auto',切換不會使字首快取失效。K3 還支援動態工具載入:將帶有 tools 欄位且無 content 的系統訊息放入訊息歷史,即可從該位置起啟用對應工具;這種宣告只對當次請求有效,伺服器不會保留,因此需要自己保留該訊息以維持工具可用性和快取字首。對於大型工具目錄,推薦先宣告一個 search_tools 函式,首輪強制檢索,再按需注入匹配的工具定義,最後讓模型直接呼叫。

此外,Together 支援完整的 1M 上下文,上下文快取是自動的。將系統提示等長字首保持在訊息開頭,可以提高快取命中率;修改或刪除較早位置的動態宣告可能影響後續快取命中。在實際生產中,還應在對話開始前就決定 reasoning_effort 的檔位,以便在質量與成本之間取得平衡。