AI News HubLIVE
站內改寫1 分鐘閱讀

Kimi K3 與 Fable 競爭;Kimi K3 + Fable 達到 SOTA

Fireworks AI 釋出新研究,開源模型 Kimi K3 與閉源模型 Fable 5 在約 1000 個智慧體任務上對比,透過任務路由兩者結合可實現 93% 準確率,成本降低最高達 50 倍,表明最佳 AI 來自模型組合而非單一模型。

Fireworks AI 在宣佈完成 D 輪融資並達到 10 億美元年經常性收入的同時,釋出了一項重要研究成果:開源模型 Kimi K3 與閉源模型 Fable 5 在約 1000 個智慧體任務上的對比。結果顯示,K3 與 Fable 整體表現相當,但透過任務路由將兩者結合,可以達到新的最先進水平(SOTA),準確率達 93%,同時成本大幅降低。

研究團隊使用了約 1030 個真實的智慧體迴圈任務,涵蓋軟體工程(SWE)、終端操作、演算法、多語言和法律五個類別。在 SWE 基準上,K3 得分 92.4%,Fable 為 92.6%,幾乎持平。但深入分析發現,K3 在符號數學和開發工具方面更出色,而 Fable 在網頁和資料視覺化上佔優。這種互補性使得路由策略極具價值。

成本方面,K3 的優勢顯著。得益於更低的 token 定價和提示快取,K3 在長期智慧體迴圈中的成本可低至 Fable 的 1/50。例如在 SWE 任務中,K3 平均需要 55 輪互動和 130 萬 token,而 Fable 只需 21 輪和 13 萬 token,但由於快取命中,K3 的實際成本仍然更低。相反,在終端任務中,Fable 可能陷入高消耗甚至超時。

研究採用了“神諭路由”方法,即假設預先知道哪個模型能以最低成本正確解決問題。結果顯示,K3 被選中處理 72-96% 的任務流量。這意味著一個近乎完美的路由器在實踐中是可行的,只需學習區分日常任務和真正的前沿工作。研究認為,單一模型的時代即將結束,最佳 AI 來自模型的混合,以開源模型為預設,透過持續學習的路由器保持領先。