Kimi K3 开放权重模型:中国最大的人工智能押注内存而非算力
月之暗面发布Kimi K3,一个拥有2.8万亿参数的开放权重模型,采用混合专家架构、量化训练和Delta注意力机制,以内存池化策略应对美国芯片限制。尽管参数庞大,但模型通过降低计算需求来适配受限硬件,实际部署仍需数据中心级基础设施,且软件生态尚未完全就绪。
月之暗面于7月16日发布了Kimi K3开放权重模型,其2.8万亿参数立即成为焦点。这是目前最大的开放权重模型,将模型规模推升至3T级别。然而,参数数量只是K3最引人注目的部分,却最不能解释其运行原理。
K3的设计核心在于用内存换计算。美国芯片出口管制限制了中国获取先进计算芯片,月之暗面通过架构创新来绕过这一限制。主要技术包括混合专家(MoE)架构:模型分为896个专家模块,每次只调用16个,计算量大幅下降,但所有2.8万亿参数仍需驻留内存。为此,月之暗面采用了量化感知训练,将参数精度从16位降至4位,使模型大小从5.6TB缩减至约1.4TB。此外,Kimi Delta注意力机制针对长文本处理的内存瓶颈进行优化,支持百万token上下文,配合缓存代码显著降低推理成本。
月之暗面建议K3在64个或更多加速器上运行,类似于华为的CloudMatrix方案。这表明真正的突破口在于通过大量普通芯片聚合内存,而非依赖高端计算芯片。然而,这些芯片是否基于国产硅尚不明确——测试使用了NVIDIA H200和未具名的“替代GPU”。美国已通过法案限制中国通过云租用海外算力,而中国在内存领域的技术差距比计算领域更大。2025年8月的贸易谈判中,中国请求放宽高带宽内存限制,而非光刻机或台积电服务,这凸显了内存瓶颈的关键性。
对企业而言,K3的开放权重意味着可以自主部署,但代价高昂。模型权重约1.4TB,需要数据中心级基础设施。大多数企业可能选择租赁专用算力,这虽然能遵守数据主权法规,但无法摆脱对基础设施提供商的依赖。软件生态尚未就绪,主流开源推理工具尚不支持K3的架构创新,实际可用时间可能晚于7月27日的权重发布日。
定价方面,K3输入token每百万3美元,输出每百万15美元,高于前代和部分竞品,但低于Fable 5。初始仅支持最大推理模式,后续将推出低推理模式。企业需按任务总成本预算。
性能上,K3在Arena前端代码测试中排名第一,但月之暗面承认整体性能仍落后于Claude Fable 5和GPT 5.6 Sol,并列出三点局限:生成质量可能不稳定、意图模糊时可能自主决策、用户体验有差距。此外,SWE马拉松评估中Fable 5曾触发35%的后备模式,可能影响得分。所有基准测试结果需等权重公开后独立验证。
美国银行分析师指出,K3表明在算力受限下,大规模预训练结合架构创新仍能带来跃升。开放权重模型的使用量正在快速增长,但K3能否成为主流取决于其实际部署成本和性能表现。