AI News HubLIVE
站內改寫2 分鐘閱讀

Kimi K3的設計秘密可能在於其思考痕跡

Moonshot AI 的最新開源模型 Kimi K3 在單次前端競技場中排名第一,Elo 分數為1392。研究發現,Kimi K3 使用了大量思考令牌,其獨特的鏈式思維方法模擬了智慧體工作流程,透過在推理過程中反覆迭代設計,產生了更高質量的網站設計。此外,Kimi K3 憑藉其強大的訓練資料索引,能夠直接使用 Unsplash 影像,無需實際搜尋。

來源Hacker News AI作者: giuliomagnifico

Moonshot AI 的最新開源模型 Kimi K3 在單次前端競技場中憑藉1392的 Elo 分數登頂,相比 Kimi K2.6 提升了10個名次,比 Kimi K2.7 Code 提升了16個名次,這是 Moonshot 模型系列中最大的一次躍進。

然而,研究人員發現 Kimi K3 使用了極其大量的思考令牌——其推理量是 Claude Opus 4.8 的12倍以上,甚至超過 Kimi K2.6 的兩倍。這種極端的推理消耗促使團隊深入探究 Kimi K3 究竟在思考什麼。

研究發現,Kimi K3 的效能主要歸功於其獨特的鏈式思維方法。它像完整的 AI 智慧體一樣在內部迭代設計,但這一切都發生在鏈式思維之中。這種策略生成了複雜、有意圖的網站,包含創造性的元件設計,並增強了 Kimi K3 與外部依賴整合能力。

透過觀察 Kimi K3 的思維痕跡,可以發現它具有獨特的多階段思考過程:從規劃到決策,再到設計最終網站的各個部分。這完全就是智慧體工作流程,並且是之前從未見過的模式。在最終設計階段,Kimi K3 甚至會寫出示例程式碼,以確保最終生成時能夠正確實現它精心設計的互動。相比之下,之前的模型推理痕跡更短,很少編寫程式碼,通常只是決定高階細節或部分後就直接輸出最終結果。

彙總所有 Kimi 模型的生成資料,Kimi K3 在推理過程中編寫的程式碼量是其他模型的10倍以上,且用於編碼的推理令牌甚至多於純粹的推理令牌。沒有其他模型具有如此高的程式碼塊密度,這是因為 Kimi K3 在推理過程中迭代單個元件,進行“心理測試”,而不是在智慧體迴圈中使用常規測試。這也意味著 Kimi K3 本質上是“以程式碼思考”,用程式碼和具體約束來表達其規劃規範,而非依賴於模糊的計劃。

沒有其他大模型在推理階段進行這種高層規劃和低層迭代,因為這種策略會增加推理時間。透過選擇這種策略,Kimi K3 有意生成消耗更多令牌但效能更好的結果,本質上是“用令牌換智慧”,從而在偏好與速度的圖表上建立了新的帕累託前沿。

此外,Kimi K3 還有一個秘密武器——強大的訓練資料索引。通常,推理弱於智慧體軌跡,因為智慧體無法使用網路搜尋等工具更新其內部思考。但 Kimi K3 的學習索引極其強大,它可以直接檢查其心理索引,判斷剛剛輸出的推理是否最新且正確。例如,Kimi K3 在思考需要什麼影像後,會一次性生成一個 Unsplash 影像 ID,然後思考該 ID 是否有效。這使得 Kimi K3 在查詢網站影像方面表現驚人地出色。

其他模型如 Fable 5 並未像 Kimi K3 那樣充分利用學習索引,也不對其生成的影像進行太多推理。在對比生成中,Kimi K3 沒有遺漏任何影像裝飾,而 Claude Fable 5 和 Kimi K2.7 Code 則不得不依賴替代文本和預設影像。這種思考還擴充套件到依賴使用,Kimi K3 透過推理如何更好地使用依賴項,建立出更優秀的滾動動畫、圖表和前端 UI。

Kimi K3 是設計改進上的一步,也是整個開源模型的巨大飛躍。此類釋出提醒我們,開源前沿正在快速推進,開源模型可以提出新想法,推動所有人前進。每一次釋出都為研究人員和開發人員提供了更強大的基礎。我們將繼續監測 Kimi K3 的效能及其與其他模型的比較。祝賀 Moonshot AI 團隊的釋出,歡迎大家到 DesignArena.ai 體驗。