在AWS上部署Kimi K3
本文介绍了在AWS上部署Moonshot AI的2.8万亿参数开源MoE模型Kimi K3的两种方法:使用Amazon SageMaker HyperPod或Amazon EKS。需要p6-b300实例(8块B300 GPU)和预留容量,通过vLLM提供OpenAI兼容的推理端点。
开源权重模型已变得足够强大,能够处理多步骤代理工作流、高级推理和长周期编码等复杂任务。然而,随着模型能力的提升,其规模也不断增长,托管数万亿参数架构需要专用基础设施、高端GPU计算和优化的服务框架。2026年7月27日,Moonshot AI发布了Kimi K3,这是一个2.8万亿参数的混合专家(MoE)模型,代表了首个达到3万亿参数级别的开源权重系统。Kimi K3提供前沿智能水平,同时公开其权重,使组织能够在其自有基础设施上自行托管这个最强大的模型之一。
本文介绍了在AWS上使用两种方法部署Kimi K3:Amazon SageMaker HyperPod和Amazon Elastic Kubernetes Service(Amazon EKS)集群。
关于Kimi K3
Kimi K3基于差异化架构构建,包括Kimi Delta Attention(KDA)、门控多头潜在注意力(MLA)和稳定潜在MoE框架。该模型将其2.8万亿参数分布在896个专家中,每个token仅激活16个。这意味着任何单次前向传播中激活约1040亿参数,相较于前代Kimi K2,扩展效率提升了2.5倍。
关键属性:总参数2.8万亿,每token激活参数1040亿,架构为MoE,专家数896(每token激活16个),上下文窗口100万token,原生多模态(文本+视觉),发布日期2026年7月27日。
Kimi K3擅长长周期编码任务、代理工作流和复杂推理。它支持原生工具调用、结构化输出和用于多步骤问题解决的始终开启思考模式。
模型可用性和格式
Kimi K3的开源权重可在Hugging Face上获取,模型标识符为moonshotai/Kimi-K3。权重以MXFP4(微缩放浮点4位)格式分发,在模型质量和大规模推理部署的内存效率之间提供了有效平衡。
考虑到模型的架构和规模,服务Kimi K3需要专为Kimi K3设计的vLLM Day-0推理容器。目前,vLLM提交位于vllm/vllm-openai:kimi-k3。vLLM原生支持MoE架构、张量并行和MXFP4量化格式,是推荐的服务引擎。
基础设施要求
部署如此规模的模型需要大量GPU计算。Kimi K3需要p6-b300实例(ml.p6-b300.48xlarge),该实例提供8个NVIDIA B300 Blackwell Ultra GPU,并配备高效张量并行推理所需的高带宽互连。
AWS提供两种主要机制来获取此容量:Flexible Training Plans(用于SageMaker HyperPod)提供可分配给HyperPod集群的预留容量;Capacity Blocks允许在指定时间段内预留EC2 GPU实例,而无需长期承诺。
选项1:在Amazon SageMaker HyperPod上部署
Amazon SageMaker HyperPod与Inference Operator提供了部署Kimi K3的最简单路径。Inference Operator在集群创建时自动安装,抽象了容器编排、模型加载和端点管理的复杂性。
先决条件:创建SageMaker HyperPod集群(选择EKS编排)并通过Flexible Training Plan预留p6-b300容量。
部署模型:应用以下InferenceEndpointConfig清单,指定模型ID、vLLM镜像、参数和8个GPU资源。Inference Operator处理模型下载、容器调度、健康检查和端点就绪。
选项2:在Amazon EKS上部署
对于希望管理自有Kubernetes基础设施的团队,可以在独立Amazon EKS集群上部署Kimi K3,并通过EC2 Capacity Blocks预留GPU容量。关键步骤包括:使用Terraform模块配置EKS集群、创建Capacity Block预留、安装GPU驱动和设备插件、部署vLLM推理服务器、暴露推理端点以及验证。
调用端点
部署后,Kimi K3端点暴露OpenAI兼容的聊天补全API。可使用OpenAI Python SDK或curl命令调用,示例代码已提供。
清理
为避免持续费用,在不再需要时删除创建的资源。对于SageMaker HyperPod,删除InferenceEndpointConfig并删除集群;对于EKS,删除部署并释放预留。
结论
Kimi K3代表了开源权重模型能力的新前沿,AWS提供了基础设施和托管服务以大规模部署它。无论选择简化的HyperPod Inference Operator路径还是自管理EKS集群的灵活性,p6-b300 GPU实例、vLLM服务和MXFP4量化权重的组合都提供了内置健康检查、自动恢复和端点就绪验证的部署方案。