Kimi K3 技术博客:开放前沿智能
Kimi 推出其最强模型 K3,拥有 2.8 万亿参数,采用 Kimi Delta Attention 和 Attention Residuals 架构,支持原生视觉和百万 token 上下文。这是全球首个开放的 3T 级模型,在长时间编码、知识工作和推理方面表现出色。尽管整体性能仍落后于最强大的专有模型,但在多项评估中超越其他测试模型。
Kimi 今天正式发布其最强模型 Kimi K3,这是一款拥有 2.8 万亿参数的前沿人工智能模型。Kimi K3 基于 Kimi Delta Attention(KDA)和 Attention Residuals(AttnRes)架构构建,具备原生视觉能力和百万 token 的上下文窗口。作为全球首个开放的 3T 级模型,K3 专为长时间编码、知识工作和推理等前沿智能任务设计。
尽管整体性能仍略逊于最强大的专有模型(如 Claude Fable 5 和 GPT 5.6 Sol),Kimi K3 在内部评估套件中展现了前沿级别的性能,持续优于其他测试模型。目前,Kimi K3 已在 Kimi.com、Kimi Work、Kimi Code 和 Kimi API 上线,默认使用最大思考努力模式,后续将引入低和高努力模式。模型权重将于 2026 年 7 月 27 日全面开源,技术报告届时也将发布。
在架构创新方面,Kimi K3 通过 KDA 和 AttnRes 改善了信息在序列长度和模型深度上的流动。同时,采用混合专家(MoE)模型,激活 896 个专家中的 16 个,结合 Stable LatentMoE 框架,整体扩展效率相比 Kimi K2 提升约 2.5 倍。
Kimi K3 在编码方面表现突出,能进行长时间工程会话,导航大型代码库,并编排终端工具。其视觉与代码结合的能力在游戏开发、前端设计和 CAD 等领域表现出色。案例包括:GPU 内核优化中与 Fable 5 竞争;自主开发 MiniTriton 编译器,性能媲美 Triton;构建 3D 开放世界游戏;在 48 小时内自主设计芯片,支持其自身架构的 nano 模型;以及从文献到代码的科研工作流,如重现天体物理中的 I-Love-Q 关系。
在知识工作方面,Kimi K3 可生成交互式研究报告,如对 42 年 ASIC 行业的研究,涉及大量数据检索和可视化。Kimi Work 还引入了 Widgets 和 Dashboard 功能,使交互更加可视化且持久。在视频编辑方面,K3 能创建 3Blue1Brown 风格的动画,并编辑自己的预告片。
技术上,Kimi K3 采用量化感知训练,支持 MXFP4 权重和 MXFP8 激活。训练采用完全平衡的专家并行方法,推荐在 64 个以上加速器的超节点配置下部署。针对 KDA 的预填充缓存问题,Kimi 已向 vLLM 社区贡献了实现方案。
Kimi K3 现已通过多种渠道可用:iOS、Android 和鸿蒙系统的 Kimi 应用;Windows 和 Apple Silicon Mac 的 Kimi Work 桌面应用;终端中的 Kimi Code;以及 Kimi API 平台,定价为缓存命中输入每百万 token 0.30 美元,缓存未命中输入每百万 token 3.00 美元,输出每百万 token 15.00 美元。企业版提供数据隐私和成员管理功能。