AI News HubLIVE
站内改写2 分钟阅读

vLLM 支持 Kimi K3:速度高达 370 令牌/秒

vLLM 宣布对 Kimi K3 提供首日支持,这是一个 2.8 万亿参数、拥有 100 万令牌上下文的混合专家模型。通过 DSpark 推测性解码,速度可达 370 令牌/秒。支持混合前缀缓存、工具调用,并为生产部署进行了优化。

来源Hacker News AI作者: wskwon

我们很高兴地宣布,vLLM 已对 Kimi K3 提供高效的首日支持。Kimi K3 是由 Moonshot AI 发布的最强大的开放权重模型之一,拥有 2.8 万亿参数,采用混合专家架构(每令牌激活 16/896 专家),并基于 Kimi Delta Attention (KDA)、Attention Residuals (AttnRes) 和 MXFP4 权重,支持高达 100 万令牌的上下文窗口以及原生视觉能力。

对于 vLLM 而言,Kimi K3 带来的最大挑战在于如何将 KDA、MXFP4 MoE、KV 缓存管理、预填充/解码分离、推测性解码以及长上下文部署方案整合到一个可运行的推理引擎中。为此,vLLM 重新设计了混合前缀缓存机制,以同时管理 KDA 层的循环状态和全注意力层的分页 KV。KDA 注意力后端使用 FlashKDA 进行预填充,并在解码时使用融合 CUDA 内核(或使用 Flash-Linear-Attention/Triton 路径用于推测性解码)。混合缓存的设计不仅服务于 Kimi K3,也为其他类似架构的模型带来了收益。

在性能方面,vLLM 在单个用户请求上实现了最高 370 令牌/秒的速度(使用 DSpark 推测性解码),相比无推测性解码时的 118 令牌/秒提升了 3.14 倍。DSpark 算法使用块扩散骨干网络,基于 Kimi K3 的丰富中间状态并行生成多个推测令牌,并通过低秩马尔可夫头和置信度头提升接受率。在编码等低熵任务中,每次步骤可接受约 4.73 个令牌;在创意写作等高熵任务中,约 2.61 个令牌。此外,vLLM 还支持预填充阶段的序列并行,通过自定义的 reduce-scatter 和 all-gather 内核减少通信开销,相较于 NCCL 实现 1.7 到 4.5 倍的加速。

在生产特性方面,vLLM 支持推测性解码、预填充/解码分离、基于 Mooncake 的代理 KV 缓存、工具调用、推理输出和结构化输出,并且在发布时支持 NVIDIA 和 AMD GPU。Kimi K3 的聊天模板采用 Python 程序而非 Jinja 模板,vLLM 的前端实现了输入渲染器和流式输出解析器,并集成了 XGrammar 以约束结构化区域的解码。

快速开始使用 Kimi K3 的最简单方式是使用 8 块 NVIDIA B300 或 AMD MI355X GPU,运行以下命令:

vllm serve moonshotai/Kimi-K3 --tensor-parallel-size 8 --trust-remote-code --load-format fastsafetensors --enable-prefix-caching --enable-auto-tool-choice --tool-call-parser kimi_k3 --reasoning-parser kimi_k3

若要启用 DSpark 推测性解码,可添加相应配置。更多细节请参考官方文档。由于复杂的依赖关系,目前仅支持 Docker 镜像。

vLLM 支持 Kimi K3:速度高达 370 令牌/秒 | AI News Hub