Kimi K3 與 Fable 競爭;Kimi K3 + Fable 達到 SOTA
Fireworks AI 發佈新研究,開源模型 Kimi K3 與閉源模型 Fable 5 在約 1000 個智能體任務上對比,通過任務路由兩者結合可實現 93% 準確率,成本降低最高達 50 倍,表明最佳 AI 來自模型組合而非單一模型。
Fireworks AI 在宣佈完成 D 輪融資並達到 10 億美元年經常性收入的同時,發佈了一項重要研究成果:開源模型 Kimi K3 與閉源模型 Fable 5 在約 1000 個智能體任務上的對比。結果顯示,K3 與 Fable 整體表現相當,但通過任務路由將兩者結合,可以達到新的最先進水平(SOTA),準確率達 93%,同時成本大幅降低。
研究團隊使用了約 1030 個真實的智能體循環任務,涵蓋軟件工程(SWE)、終端操作、算法、多語言和法律五個類別。在 SWE 基準上,K3 得分 92.4%,Fable 為 92.6%,幾乎持平。但深入分析發現,K3 在符號數學和開發工具方面更出色,而 Fable 在網頁和數據可視化上佔優。這種互補性使得路由策略極具價值。
成本方面,K3 的優勢顯著。得益於更低的 token 定價和提示緩存,K3 在長期智能體循環中的成本可低至 Fable 的 1/50。例如在 SWE 任務中,K3 平均需要 55 輪交互和 130 萬 token,而 Fable 只需 21 輪和 13 萬 token,但由於緩存命中,K3 的實際成本仍然更低。相反,在終端任務中,Fable 可能陷入高消耗甚至超時。
研究採用了“神諭路由”方法,即假設預先知道哪個模型能以最低成本正確解決問題。結果顯示,K3 被選中處理 72-96% 的任務流量。這意味着一個近乎完美的路由器在實踐中是可行的,只需學習區分日常任務和真正的前沿工作。研究認為,單一模型的時代即將結束,最佳 AI 來自模型的混合,以開源模型為默認,通過持續學習的路由器保持領先。