AI News HubLIVE
站内改写1 分钟阅读

Kimi K3 与 Fable 竞争;Kimi K3 + Fable 达到 SOTA

Fireworks AI 发布新研究,开源模型 Kimi K3 与闭源模型 Fable 5 在约 1000 个智能体任务上对比,通过任务路由两者结合可实现 93% 准确率,成本降低最高达 50 倍,表明最佳 AI 来自模型组合而非单一模型。

Fireworks AI 在宣布完成 D 轮融资并达到 10 亿美元年经常性收入的同时,发布了一项重要研究成果:开源模型 Kimi K3 与闭源模型 Fable 5 在约 1000 个智能体任务上的对比。结果显示,K3 与 Fable 整体表现相当,但通过任务路由将两者结合,可以达到新的最先进水平(SOTA),准确率达 93%,同时成本大幅降低。

研究团队使用了约 1030 个真实的智能体循环任务,涵盖软件工程(SWE)、终端操作、算法、多语言和法律五个类别。在 SWE 基准上,K3 得分 92.4%,Fable 为 92.6%,几乎持平。但深入分析发现,K3 在符号数学和开发工具方面更出色,而 Fable 在网页和数据可视化上占优。这种互补性使得路由策略极具价值。

成本方面,K3 的优势显著。得益于更低的 token 定价和提示缓存,K3 在长期智能体循环中的成本可低至 Fable 的 1/50。例如在 SWE 任务中,K3 平均需要 55 轮交互和 130 万 token,而 Fable 只需 21 轮和 13 万 token,但由于缓存命中,K3 的实际成本仍然更低。相反,在终端任务中,Fable 可能陷入高消耗甚至超时。

研究采用了“神谕路由”方法,即假设预先知道哪个模型能以最低成本正确解决问题。结果显示,K3 被选中处理 72-96% 的任务流量。这意味着一个近乎完美的路由器在实践中是可行的,只需学习区分日常任务和真正的前沿工作。研究认为,单一模型的时代即将结束,最佳 AI 来自模型的混合,以开源模型为默认,通过持续学习的路由器保持领先。