AI News HubLIVE
站內改寫2 分鐘閱讀

Kimi K3 完全開發者指南

Kimi K3 是 Moonshot AI 推出的 2.8 萬億參數開源權重模型,也是首個 3 萬億參數級別的開源模型。本文介紹其架構亮點、Together AI 上的調用方式、推理強度、視覺輸入、結構化輸出、工具調用與動態工具加載等關鍵開發要點。

Kimi K3 是 Moonshot AI 目前最強的模型,也是世界上第一個進入 3 萬億參數級別的開源權重模型。它擁有 2.8 萬億參數,是迄今最大的開源權重模型,目標是為長期編碼、端到端知識工作和深度推理等前沿任務提供支持。Together AI 正與 Moonshot 團隊直接合作,在美國基礎設施上提供該模型,支持完整的 1M 上下文、自動前綴緩存和 OpenAI 兼容 API。

在架構層面,K3 引入了兩項關鍵更新:Kimi Delta Attention(KDA)是一種混合線性注意力機制,為超長上下文的注意力擴展提供了高效基礎;Attention Residuals(AttnRes)則跨網絡深度選擇性地檢索表示,而非均勻累積。Moonshot 還通過 Stable LatentMoE 框架進一步推進了專家混合稀疏性:模型共有 896 個專家,每個 token 只激活約 16 個,即約 2% 的專家。為了在這種稀疏度下穩定訓練,團隊加入了 Quantile Balancing(基於路由器分數分位數分配專家)、Per-Head Muon(獨立優化注意力頭)、Sigmoid Tanh Unit(改進激活控制)和 Gated MLA(增強注意力選擇性)等支持技術。

在 Together AI 上調用 K3 非常簡單。安裝 together>=2.0.0 後,設置 TOGETHER_API_KEY,即可通過 client.chat.completions.create 發送消息。頂級字段 reasoning_effort 支持 low、high、max 三檔,默認 max,也可以通過 reasoning={'enabled': False} 關閉思考,此時不會計費思考 token。流式響應會區分 reasoning_content(思考過程)與最終答案的 content 增量。

視覺方面,K3 支持通過 URL 或 base64 傳入多張圖片。雖然沒有圖片數量上限,但整個請求體需小於 100 MB;官方建議圖片分辨率不超過 4K(4096x2160),更高的分辨率只會增加處理時間和 token 消耗。結構化輸出可使用 response_format 搭配 json_schema 和 strict: true,也可以使用更寬鬆的 json_object 模式;注意要留足 max_tokens,因為思考過程會先於 schema 約束 token 輸出。

工具調用遵循標準 OpenAI 循環:聲明 tools,模型返回 tool_calls 後追加完整的助手消息,再為每次調用追加帶匹配 tool_call_id 的 tool 消息,然後再次調用。可用 tool_choice='required' 強制首輪調用工具,之後再切回 'auto',切換不會使前綴緩存失效。K3 還支持動態工具加載:將帶有 tools 字段且無 content 的系統消息放入消息歷史,即可從該位置起啓用對應工具;這種聲明只對當次請求有效,服務器不會保留,因此需要自己保留該消息以維持工具可用性和緩存前綴。對於大型工具目錄,推薦先聲明一個 search_tools 函數,首輪強制檢索,再按需注入匹配的工具定義,最後讓模型直接調用。

此外,Together 支持完整的 1M 上下文,上下文緩存是自動的。將系統提示等長前綴保持在消息開頭,可以提高緩存命中率;修改或刪除較早位置的動態聲明可能影響後續緩存命中。在實際生產中,還應在對話開始前就決定 reasoning_effort 的檔位,以便在質量與成本之間取得平衡。