跳到主要内容
AI News HubLIVE
站内改写1 分钟阅读

Kimi K3 与 Fable 竞争;Kimi K3 + Fable 达到 SOTA

文章摘要

Fireworks AI 发布新研究,开源模型 Kimi K3 与闭源模型 Fable 5 在约 1000 个智能体任务上对比,通过任务路由两者结合可实现 93% 准确率,成本降低最高达 50 倍,表明最佳 AI 来自模型组合而非单一模型。

Kimi K3 与 Fable 竞争;Kimi K3 + Fable 达到 SOTA
报告错误

纠错通道尚未开通,可先复制下方文章信息留存。

查看更正说明
直接读正文

Fireworks AI 在宣布完成 D 轮融资并达到 10 亿美元年经常性收入的同时,发布了一项重要研究成果:开源模型 Kimi K3 与闭源模型 Fable 5 在约 1000 个智能体任务上的对比。结果显示,K3 与 Fable 整体表现相当,但通过任务路由将两者结合,可以达到新的最先进水平(SOTA),准确率达 93%,同时成本大幅降低。

研究团队使用了约 1030 个真实的智能体循环任务,涵盖软件工程(SWE)、终端操作、算法、多语言和法律五个类别。在 SWE 基准上,K3 得分 92.4%,Fable 为 92.6%,几乎持平。但深入分析发现,K3 在符号数学和开发工具方面更出色,而 Fable 在网页和数据可视化上占优。这种互补性使得路由策略极具价值。

成本方面,K3 的优势显著。得益于更低的 token 定价和提示缓存,K3 在长期智能体循环中的成本可低至 Fable 的 1/50。例如在 SWE 任务中,K3 平均需要 55 轮交互和 130 万 token,而 Fable 只需 21 轮和 13 万 token,但由于缓存命中,K3 的实际成本仍然更低。相反,在终端任务中,Fable 可能陷入高消耗甚至超时。

研究采用了“神谕路由”方法,即假设预先知道哪个模型能以最低成本正确解决问题。结果显示,K3 被选中处理 72-96% 的任务流量。这意味着一个近乎完美的路由器在实践中是可行的,只需学习区分日常任务和真正的前沿工作。研究认为,单一模型的时代即将结束,最佳 AI 来自模型的混合,以开源模型为默认,通过持续学习的路由器保持领先。

展开要点与分析

文章情报

工程师入门

要点

  • Kimi K3 和 Fable 5 在整体性能上接近,但在不同任务领域各有专长。
  • 通过神谕路由,K3 被选中处理 72-96% 的任务,组合性能超过任何单一模型。
  • K3 在长期智能体循环中成本可比 Fable 低 50 倍。
  • 研究建议以开源模型为默认,通过定制路由保持领先。

要点与分析由自动化流程生成,可能有误,请结合原始来源核实。