AI News HubLIVE
站内改写5 分钟阅读

Kimi K3:开放权重升级

Moonshot AI发布了最新旗舰模型Kimi K3,这是一个2.8万亿参数的MoE模型,将于7月27日开放权重。K3在多项基准测试中排名靠前,成为最强的开源模型。文章探讨了中美AI模型差距缩小、中国开源策略、开源模型的经济影响以及中国AI的效率优势。

来源Hacker News AI作者: pretext

2026年7月20日

7月16日星期四,Moonshot AI发布了其最新旗舰模型Kimi K3。K3是一个拥有2.8万亿参数的混合专家(MoE)模型,其权重将于7月27日开放。本文基于Moonshot信守权重发布日期的前提下,对生态系统现状进行反思。这是一种更极端的平衡观点,如果中国拥有类似强大但封闭的模型(即K3永不发布),许多结果将处于中间状态。

关键事实是,无论是开源与闭源模型之间的性能差距,还是美国与中国模型之间的性能差距,都已从备受争议的6-9个月缩短至更短,大约3-5个月。

从发布材料来看,K3显然是一个真正的前沿模型。它将是自DeepSeek R1以来最接近前沿的开源模型。DeepSeek R1是一个不同的故事——中国实验室迅速转向推理模型,发布速度比许多美国公司更快。Kimi K3则是中国实验室在已知领域(数据、算法、架构、工具、环境等)进行扩展的范例。

Kimi K3在Vals AI指数中排名第二,在Artificial Analysis的智能指数中排名第三(仅被Claude Fable和GPT-5.6 Sol Max击败,但价格更便宜),在前端代码竞技场中排名第一,并取得了其他令人印象深刻的成绩。Moonshot AI正在以远远更少的资源与Anthropic和OpenAI正面竞争。

这显然是有史以来发布的最强开源模型。从该模型可以清楚地看出,即使来自美国前沿闭源模型的对抗性蒸馏有所贡献,其程度也相对较小。那些跟随蒸馏恐慌并错误地认为中国AI实验室仅仅因知识产权盗窃才产出好模型的人,将迎来觉醒——中国公司在构建模型方面与领先的美国公司一样出色。Moonshot AI正在解决OpenAI或Anthropic员工面临的许多相同问题。我相信蒸馏讨论和压力还会继续,但证据已经表明,中国公司不仅能快速追随。

在我访问中国期间与Kimi核心团队会面后,我清楚地看到他们拥有令人难以置信的文化,有些人称之为“气场”,以及表达自由——尽管在GPU受限的环境中。在构建模型很大程度上是规模游戏的情况下,构建好模型的能力仍然取决于个人执行、动机和表达。访问他们之后,这个结果就不那么令人惊讶了。我访问过许多AI公司,很少有像这样立刻能感受到的文化。

与此同时,中国的AI采用趋势起步晚于美国。因此,虽然中国实验室的计算资源远少于美国同行,但更多的资源可以用于训练。当我开玩笑说一个OpenAI研究员可以拥有多少计算资源——比如几千台H100等效机器——时,Kimi的研究员感到震惊。Kimi模型的组织架构和方法肯定反映了这一点,但在没有大量专有信息的情况下,很难梳理出具体情况。

目前峰值模型性能的状态大致如下:

Anthropic – Claude Fable 5

OpenAI – GPT 5.6 Sol

Moonshot AI – Kimi K3(开放权重*)

SpaceXAI – Grok 4.5

Zhipu (Z.ai) – GLM 5.2(开放权重)

Meta – Muse Spark 1.1

DeepMind – Gemini Flash 3.5

Alibaba – Qwen 3.7 Max(3.8已宣布,也将开放权重,写本文时)

令人惊讶的是DeepMind和其他美国巨头排名如此之低。在很多方面,X AI团队值得更多赞誉。以下来自Artificial Analysis的可视化摘要:

这次发布和其他近期事件导致了开放与封闭模型之间最可能结果的重大方向转变。我将逐一分析。

在很多方面,感觉像是一个新时代的开始。一个竞争更激烈,但也更需要协调的时代,因为我们在全球范围内部署了极其强大的技术。

分享

  1. 中国重申对开源AI的承诺——显示出对近期风险的不同解读

许多人相对较晚才开始关注中国AI领域,因此可能得出开源是其核心策略的结论。事实上,我认为大多数实验室的核心策略更接近Anthropic或OpenAI——构建最好的智能。经过多年关注并参与中国实验室,我认为他们最初转向开源模型的最佳解释是实用性。他们需要开放模型以获得采用、关注和反馈(特别是在高价值的湾区市场)。

长期以来,中国关于开源AI的角色以及可能的“国家层面战略”的政策非常有限。据我所知,没有高级领导人公开评论过开源AI。这种情况在本周也发生了变化,习近平在世界人工智能大会上发表主旨演讲,非常直接地承诺中国AI生态系统的未来将走向开源和全球扩散。这一对现状的承诺,恰逢有史以来最强开放权重模型发布,成为现代AI早期历史上的一个明确标志。

这发生在许多关于中国AI行业潜在前进道路的讨论中——他们会保持开放吗?他们能跟上美国实验室的扩展吗?中国市场收入是否在增长?这些讨论的关注点一直在于中国的风险承受能力、公司的货币化能力,以及公司停止发布最佳开放模型的任何密切相关原因。

通过将习近平的承诺与一个非常强大的模型在时间上联系起来,中国隐含地评论了其对发布开放权重模型的风险承受能力。目前,这是对诸如强网络安全能力(或生物危害)等话题在中国体系内感知风险的一种解读。

最简单的解释是,中国政府肯定在密切跟踪模型的潜在风险——可能比美国政府的“氛围监管”更具技术范围——如果检测到风险,就会采取行动。简单解释是,他们认为当前的前沿模型不具有重大风险。

同时,中国的经济决策者认为AI采用是好事,这样他们可以在后期通过该行业获利——在扩大分发之后(正如中国近年来在汽车、太阳能、先进制造业等领域所做的那样)。

这些可能在某些方面令人震惊,在美国AI媒体经历了对Claude Mythos模型数月炒作和恐惧之后。这种惊讶应该是极好的立足点——世界对美国最常听到的关于AI的叙述并未达成一致意见。

  1. 开源模型作为前沿实验室的经济致命弱点

许多引导AI讨论的叙述者都有明确动机来贬低最佳开源AI模型的感知能力。Dean Ball——个人支持开源模型,但现在在OpenAI工作——发表了一篇关于Kimi的广泛评论的帖子,其中他对开源模型说了以下话。理解这一陈述很重要,因为它聚焦了开源模型在AI建设经济方面的角色。Dean说:

开放权重模型本质上是去加速主义的,我不断感到惊讶的是,所谓的“加速主义者”对开放权重模型如此兴奋。

解释为什么开放权重模型是一种去加速主义形式,对于理解即将到来的世界秩序很重要。他是对的。

开源模型在经济上对前沿实验室是去加速主义的,这将减缓AI的净投资和资本支出 rollout。这是因为强大的开放权重AI模型极大地减少了闭源实验室的利润潜力。这有两个影响。首先,AI实验室有更少的利润用于再投资未来模型。其次,市场看到这些公司的终值降低,因此将削弱未来的融资轮次。这些共同将减缓最具变革性AI模型的时间线,但我不认为它们强大到足以阻止OpenAI和Anthropic成为世界上估值最高的几家公司之一。

这些对我来说对社会是净利好。因为开放权重模型通过降低一定性能水平智能的入门价格,加速了AI在经济中的扩散。开源模型还鼓励定制化。问题是,这种扩散本质上比前沿AI实验室的产品慢得多,后者销售直接供开发者使用的工具。开源模型的潜力在于几乎每个企业都可以使用它们来构建特定领域的代理。这种经济扩散需要极长的时间!我曾将开源模型描述为起步慢得多,但可能指数更大的曲线。问题是,如果闭源模型在原始能力上领先太多,这种定制化能力就可能变得无意义。

扩散增加和AI实验室权力集中的减少相结合,我认为对AI转型非常积极。它给了我们更多时间来弄清楚新能力的难题,并让更多利益相关者影响故事——任何一家公司在安全地控制世界上最重要的技术方面都很可能遇到问题。

当然,对我来说,最好的模型仍然由美国公司制造,这将使美国能够控制技术的轨迹及其价值观,这一点也很重要。我也预期这将如此,因为美国有更大的资本市场愿意投资AI(并且利润份额在增长),但这并非必然。

  1. 中国的效率优势

Kimi的发布博客包含一些技术细节,证实了我们感受到的持续模型改进。选择其一:

Kimi K3构建在Kimi Delta Attention (KDA) 和 Attention Residuals (AttnRes) 之上,这是两种旨在改善信息在序列长度和模型深度上流动的架构更新。我们还扩展了混合专家稀疏性,结合稳定的潜在MoE框架,有效激活了896个专家中的16个。结合改进的训练和数据配方,这些结构变化相对于Kimi K2带来了约2.5倍的整体扩展效率提升,使模型能够更有效地将计算转化为智能。

训练效率真的会累积。它们将导致模型持续出现令人难以置信的进步。

顺便提一下,追踪这一特定创新在生态系统中的路径是一个有趣的例子。Kimi Delta Attention (KDA) 在Kimi Linear论文中引入,类似于用于Olmo Hybrid(我在Ai2的最后一个Olmo模型)的Gated DeltaNet。Qwen的最新模型切换到了相关架构,最近的Nemotron模型也是混合的(但仍更接近Mamba而非Gated DeltaNet)。看到像这样由学术界大力推动的新架构思想如此迅速地转化为前沿规模模型,真是太棒了。Gated Delta Networks于2024年底引入,基于Mamba的思想。到2026年中期,它们已进入前沿模型。

我选择关注这个例子,部分原因是Kimi团队给出了模型间创新的具体数字,但主要是为关于中国资源效率的更广泛讨论提供空间。

越来越清楚的是……