AI News HubLIVE
站内改写2 分钟阅读

月之暗面Kimi K3现已在Modal上可用

月之暗面发布了2.8万亿参数的多模态模型Kimi K3,并可在Modal上以每秒460个token的速度运行。该模型采用混合专家架构,支持100万token上下文窗口和原生视觉。Modal提供了自定义DFlash推测解码器,大幅提升推理速度。

月之暗面(Moonshot)今日发布了Kimi K3,一个拥有2.8万亿参数的多模态模型,具备100万token的上下文窗口和原生视觉能力。该模型现已在Modal平台上可用,发布当天即可达到每秒460个token的推理速度。

Modal与月之暗面及vLLM合作,实现了发布当天的零日支持。用户可以通过基于token计费的共享API使用K3,也可以选择专用Auto Endpoint以获得独立容量。此外,Modal还提供了一个针对K3架构定制训练的DFlash推测解码器。

Kimi K3是目前最强开源模型之一,在Artificial Analysis的智能指数中排名第四,总分186,其所在层级原本由闭源模型主导。它是一个混合专家(MoE)变换器模型:总参数2.8万亿,每token激活16个专家(总共896个),上下文窗口达到100万token,并原生支持视觉。K3专为长周期自主任务设计,月之暗面在内部测试中使用了早期版本进行大部分内核优化工作。Kimi Delta Attention(KDA)在序列长度增长时降低了注意力计算成本,而注意力残差机制允许更深层网络回溯早期注意力输出,而非仅依赖上一层,这两项技术共同使K3的扩展效率相比K2提高了约2.5倍。

然而,运行这样一个大模型并非易事。月之暗面在架构上投入了大量精力解决这一问题:从SFT阶段开始就进行量化感知训练,采用MXFP4权重和MXFP8激活,使模型能在多种硬件上运行;同时重新平衡专家并行,以保持大规模吞吐。当KDA被证明会破坏传统前缀缓存时,他们编写了新的实现并提前贡献给vLLM。这些幕后工作使得一个3万亿参数级别的开源模型得以提供服务。

Modal进一步优化了端点性能,为K3提供了定制DFlash推测解码器的零日支持。由于K3每任务生成大量token,用户等待时间主要花在解码阶段,而推测解码能够加速这一过程。在自主工作负载中,不使用DFlash时每GPU约50 token/秒,每分钟0.8百万token;使用后提升至100 token/秒,每分钟约1百万token,每个用户上限超过200 token/秒。

K3配备了一个MTP(多token预测)头用于推测解码,但实践中发现MTP更适合作为训练优化手段,而专门的推测模型如DFlash能显著加速生产推理。DFlash一次处理整个块,根据目标模型特征进行推测,且没有额外开销。DFlash训练主要是一个数据生成问题,使用32个B300节点,其中28个运行K3(TP8)产生隐藏状态,4个节点用于训练推测模型。

Kimi K3现可通过Modal的OpenAI兼容共享API(基于token计费)或专用Auto Endpoint使用。Modal提供标准优惠:每月30美元免费计算额度,用户可免费使用K3共享API。

月之暗面Kimi K3现已在Modal上可用 | AI News Hub