AI News HubLIVE
站内改写3 分钟阅读

如何为Kimi K3构建Day-0 API

Baseten 为 Kimi K3 提供了 Day-0 支持,这是一个 2.8T 参数的新前沿开放模型。本文介绍了在发布日前运行该模型所需的技术工作,包括硬件配置、权重加载、推理引擎集成、质量验证、性能优化和规模化部署。

Baseten 已在其 Model APIs 上为 Kimi K3 提供 Day-0 支持。Kimi K3 是一个全新的 2.8T 参数开放前沿模型,由 Moonshot AI 开发。感谢 Moonshot AI 提前分享权重,以及 Inferact 和 RadixArk 团队在整个开发过程中的合作。

Kimi K3 今日在 Baseten Model APIs 上可用,支持视觉输入和完整的 1M 令牌上下文窗口。作为一个 2.8T 参数的模型,它比任何之前的开放模型都大得多,给构建高性能推理 API 带来了许多挑战。新的架构技术使 Kimi K3 能够超越此前开放前沿模型的万亿参数阈值:Kimi Delta Attention (KDA) 和 Attention Residuals (AttnRes) 作为 Kimi 架构的可扩展骨干;极稀疏的专家,每次仅激活 896 个专家中的 16 个,通过 Stable LatentMoE 组织;以及用于处理图像输入并将视觉信息映射到潜在空间的新视觉编码器。

里程碑 1:生成第一个令牌

在获得 Moonshot AI 团队提前访问 Kimi K3 权重后,首要任务是让模型运行起来。生成第一个令牌需要:配置硬件——考虑到 Kimi K3 的大小,我们决定在 NVIDIA GB300 NVL72 系统上运行模型;加载权重——在 MXFP4 格式下,Kimi K3 权重超过 1.4TB;启动推理引擎——我们与 vLLM 和 SGLang 团队合作,运行预发布版本的推理引擎。通常,在构建 Day-0 API 时,早期步骤是将权重转换为 NVFP4 以提高性能。但 Kimi K3 使用原生 MXFP4 权重和 MXFP8 激活,我们可以直接使用这些权重。

我们与 Inferact(vLLM)和 RadixArk(SGLang)紧密合作。在 Baseten Inference Stack 上运行 Kimi K3 之前,我们需要与领先的开源推理引擎建立基线。为模型添加对推理引擎的支持并非易事,需要实现核心建模代码、为 KDA 等新架构优化内核,以及构建从前端(如分词和工具调用)到后端的兼容性。vLLM 的早期访问镜像帮助我们建立了基本功能完整性、通过初步评估并设定基线性能目标。SGLang 的早期访问镜像为 Kimi K3 的快速可靠服务提供了参考。

里程碑 2:验证推理引擎

Kimi K3 是有史以来最智能的开放模型,必须在推理中真正实现这种智能。质量验证可以在不同严格级别上进行。简单的完整性检查(如使用已知提示调用模型或运行轻量级基准)在开发过程中是有用的检查点。但发布公共 API 需要更严格的基准测试。Moonshot AI 团队运营的 Kimi Vendor Verifier 帮助推理提供商确保准确、高保真地服务模型权重。通过 Kimi Vendor Verifier 是我们的重要早期里程碑。在服务模型时有很多出错的机会,但大多数质量问题,尤其是工具调用和其他结构化模型行为,源于推理服务器前端。

里程碑 3:找到正确的配置

推理引擎提供各种配置选项来调整性能。我们发现正确的配置需要对张量并行 (TP) 和专家并行 (EP) 设置、注意力数据并行 (ADP) 切换、批量大小、推测解码器草稿长度、线性层缓存间隔、路由参数和推理引擎设置进行扫描。运行 Kimi K3 需要八个 NVIDIA GB300 GPU 才能将巨大的模型权重装入 VRAM。然而,GB300 以四个为一组,但 GB300 NVL72 系统具有足够快的节点间互连,因此我们可以跨节点运行 TP 和 EP。

里程碑 4:优化性能

一旦模型在优化配置上运行,就有大量推理工程技术可以显著改善延迟和吞吐量。我们关注推测(使用小草稿模型预测多个令牌)、分离(将预填充和解码分离到不同工作节点)和缓存(分配内存以保存 KV 缓存和 KDA 状态)。一项新颖的优化在于分词器——对于 Kimi K3 这样的长输入序列和高 KV 缓存复用率的模型,分词时间可能变得重要。我们构建了一个自定义分词器,对于长输入序列,比 tiktoken 快最多 18 倍。

里程碑 5:规模化部署

对 Kimi K3 的行业热情高涨,发布时需求巨大。在 GB300 NVL72 系统上,一个节点是 4 个 GPU,因此有 18 个节点。Kimi K3 实例占用 2 个节点(8 个 GPU);每个 NVL72 机架可运行 9 个副本。我们在多个区域和云提供商中服务该模型。前缀缓存命中率是单个副本吞吐量的最关键因素,因此我们的 KV 感知路由系统(使用 NVIDIA Dynamo 工具包构建)确保能够将请求路由到具有热缓存的副本。

在 Baseten 上使用 Kimi K3 构建

我们很高兴通过 Model APIs 提供 Day-0 访问,并期待继续优化该模型的实现,以达到性能和可靠性的最高标准。Moonshot AI 团队的 Kimi K3 公告包括多种有趣的测试,如编码任务、研究任务和代理任务。7 月 28 日星期二上午 11 点(太平洋时间),我们将与 Baseten 的前沿部署工程负责人 Joey Zwicker 和 Philip Kie 举办关于 Kimi K3 用例的高管简报会。