在AWS上部署Kimi K3
本文介紹了在AWS上部署Moonshot AI的2.8萬億參數開源MoE模型Kimi K3的兩種方法:使用Amazon SageMaker HyperPod或Amazon EKS。需要p6-b300實例(8塊B300 GPU)和預留容量,通過vLLM提供OpenAI兼容的推理端點。
開源權重模型已變得足夠強大,能夠處理多步驟代理工作流、高級推理和長週期編碼等複雜任務。然而,隨着模型能力的提升,其規模也不斷增長,託管數萬億參數架構需要專用基礎設施、高端GPU計算和優化的服務框架。2026年7月27日,Moonshot AI發佈了Kimi K3,這是一個2.8萬億參數的混合專家(MoE)模型,代表了首個達到3萬億參數級別的開源權重系統。Kimi K3提供前沿智能水平,同時公開其權重,使組織能夠在其自有基礎設施上自行託管這個最強大的模型之一。
本文介紹了在AWS上使用兩種方法部署Kimi K3:Amazon SageMaker HyperPod和Amazon Elastic Kubernetes Service(Amazon EKS)集羣。
關於Kimi K3
Kimi K3基於差異化架構構建,包括Kimi Delta Attention(KDA)、門控多頭潛在注意力(MLA)和穩定潛在MoE框架。該模型將其2.8萬億參數分佈在896個專家中,每個token僅激活16個。這意味着任何單次前向傳播中激活約1040億參數,相較於前代Kimi K2,擴展效率提升了2.5倍。
關鍵屬性:總參數2.8萬億,每token激活參數1040億,架構為MoE,專家數896(每token激活16個),上下文窗口100萬token,原生多模態(文本+視覺),發佈日期2026年7月27日。
Kimi K3擅長長週期編碼任務、代理工作流和複雜推理。它支持原生工具調用、結構化輸出和用於多步驟問題解決的始終開啓思考模式。
模型可用性和格式
Kimi K3的開源權重可在Hugging Face上獲取,模型標識符為moonshotai/Kimi-K3。權重以MXFP4(微縮放浮點4位)格式分發,在模型質量和大規模推理部署的內存效率之間提供了有效平衡。
考慮到模型的架構和規模,服務Kimi K3需要專為Kimi K3設計的vLLM Day-0推理容器。目前,vLLM提交位於vllm/vllm-openai:kimi-k3。vLLM原生支持MoE架構、張量並行和MXFP4量化格式,是推薦的服務引擎。
基礎設施要求
部署如此規模的模型需要大量GPU計算。Kimi K3需要p6-b300實例(ml.p6-b300.48xlarge),該實例提供8個NVIDIA B300 Blackwell Ultra GPU,並配備高效張量並行推理所需的高帶寬互連。
AWS提供兩種主要機制來獲取此容量:Flexible Training Plans(用於SageMaker HyperPod)提供可分配給HyperPod集羣的預留容量;Capacity Blocks允許在指定時間段內預留EC2 GPU實例,而無需長期承諾。
選項1:在Amazon SageMaker HyperPod上部署
Amazon SageMaker HyperPod與Inference Operator提供了部署Kimi K3的最簡單路徑。Inference Operator在集羣創建時自動安裝,抽象了容器編排、模型加載和端點管理的複雜性。
先決條件:創建SageMaker HyperPod集羣(選擇EKS編排)並通過Flexible Training Plan預留p6-b300容量。
部署模型:應用以下InferenceEndpointConfig清單,指定模型ID、vLLM鏡像、參數和8個GPU資源。Inference Operator處理模型下載、容器調度、健康檢查和端點就緒。
選項2:在Amazon EKS上部署
對於希望管理自有Kubernetes基礎設施的團隊,可以在獨立Amazon EKS集羣上部署Kimi K3,並通過EC2 Capacity Blocks預留GPU容量。關鍵步驟包括:使用Terraform模塊配置EKS集羣、創建Capacity Block預留、安裝GPU驅動和設備插件、部署vLLM推理服務器、暴露推理端點以及驗證。
調用端點
部署後,Kimi K3端點暴露OpenAI兼容的聊天補全API。可使用OpenAI Python SDK或curl命令調用,示例代碼已提供。
清理
為避免持續費用,在不再需要時刪除創建的資源。對於SageMaker HyperPod,刪除InferenceEndpointConfig並刪除集羣;對於EKS,刪除部署並釋放預留。
結論
Kimi K3代表了開源權重模型能力的新前沿,AWS提供了基礎設施和託管服務以大規模部署它。無論選擇簡化的HyperPod Inference Operator路徑還是自管理EKS集羣的靈活性,p6-b300 GPU實例、vLLM服務和MXFP4量化權重的組合都提供了內置健康檢查、自動恢復和端點就緒驗證的部署方案。