AI News HubLIVE
站内改写2 分钟阅读

Kimi K3的设计秘密可能在于其思考痕迹

Moonshot AI 的最新开源模型 Kimi K3 在单次前端竞技场中排名第一,Elo 分数为1392。研究发现,Kimi K3 使用了大量思考令牌,其独特的链式思维方法模拟了智能体工作流程,通过在推理过程中反复迭代设计,产生了更高质量的网站设计。此外,Kimi K3 凭借其强大的训练数据索引,能够直接使用 Unsplash 图像,无需实际搜索。

来源Hacker News AI作者: giuliomagnifico

Moonshot AI 的最新开源模型 Kimi K3 在单次前端竞技场中凭借1392的 Elo 分数登顶,相比 Kimi K2.6 提升了10个名次,比 Kimi K2.7 Code 提升了16个名次,这是 Moonshot 模型系列中最大的一次跃进。

然而,研究人员发现 Kimi K3 使用了极其大量的思考令牌——其推理量是 Claude Opus 4.8 的12倍以上,甚至超过 Kimi K2.6 的两倍。这种极端的推理消耗促使团队深入探究 Kimi K3 究竟在思考什么。

研究发现,Kimi K3 的性能主要归功于其独特的链式思维方法。它像完整的 AI 智能体一样在内部迭代设计,但这一切都发生在链式思维之中。这种策略生成了复杂、有意图的网站,包含创造性的组件设计,并增强了 Kimi K3 与外部依赖集成能力。

通过观察 Kimi K3 的思维痕迹,可以发现它具有独特的多阶段思考过程:从规划到决策,再到设计最终网站的各个部分。这完全就是智能体工作流程,并且是之前从未见过的模式。在最终设计阶段,Kimi K3 甚至会写出示例代码,以确保最终生成时能够正确实现它精心设计的交互。相比之下,之前的模型推理痕迹更短,很少编写代码,通常只是决定高级细节或部分后就直接输出最终结果。

汇总所有 Kimi 模型的生成数据,Kimi K3 在推理过程中编写的代码量是其他模型的10倍以上,且用于编码的推理令牌甚至多于纯粹的推理令牌。没有其他模型具有如此高的代码块密度,这是因为 Kimi K3 在推理过程中迭代单个组件,进行“心理测试”,而不是在智能体循环中使用常规测试。这也意味着 Kimi K3 本质上是“以代码思考”,用代码和具体约束来表达其规划规范,而非依赖于模糊的计划。

没有其他大模型在推理阶段进行这种高层规划和低层迭代,因为这种策略会增加推理时间。通过选择这种策略,Kimi K3 有意生成消耗更多令牌但性能更好的结果,本质上是“用令牌换智能”,从而在偏好与速度的图表上建立了新的帕累托前沿。

此外,Kimi K3 还有一个秘密武器——强大的训练数据索引。通常,推理弱于智能体轨迹,因为智能体无法使用网络搜索等工具更新其内部思考。但 Kimi K3 的学习索引极其强大,它可以直接检查其心理索引,判断刚刚输出的推理是否最新且正确。例如,Kimi K3 在思考需要什么图像后,会一次性生成一个 Unsplash 图像 ID,然后思考该 ID 是否有效。这使得 Kimi K3 在查找网站图像方面表现惊人地出色。

其他模型如 Fable 5 并未像 Kimi K3 那样充分利用学习索引,也不对其生成的图像进行太多推理。在对比生成中,Kimi K3 没有遗漏任何图像装饰,而 Claude Fable 5 和 Kimi K2.7 Code 则不得不依赖替代文本和默认图像。这种思考还扩展到依赖使用,Kimi K3 通过推理如何更好地使用依赖项,创建出更优秀的滚动动画、图表和前端 UI。

Kimi K3 是设计改进上的一步,也是整个开源模型的巨大飞跃。此类发布提醒我们,开源前沿正在快速推进,开源模型可以提出新想法,推动所有人前进。每一次发布都为研究人员和开发人员提供了更强大的基础。我们将继续监测 Kimi K3 的性能及其与其他模型的比较。祝贺 Moonshot AI 团队的发布,欢迎大家到 DesignArena.ai 体验。