AI News HubLIVE
站內改寫2 分鐘閱讀

開放模型回顧:關於Kimi K3、Qwen 3.8、習在WAIC的講話、蒸餾、開放與封閉差距以及未來發展

本播客中,Nathan和Florian討論了開放AI模型的最新進展,包括Kimi K3的釋出、Qwen的開放策略、習近平在WAIC支援開源的講話、開放與封閉模型之間的效能差距以及蒸餾技術的爭議。他們深入分析了中國模型為何表現優異、美國開放模型生態的現狀,並對未來進行了預測。

來源Interconnects (Nathan Lambert)作者: Nathan Lambert

在一期關於開放模型現狀的深度播客中,Nathan Lambert和Florian Brand圍繞Kimi K3的釋出展開了討論。Kimi K3是近期最受關注的開放權重模型之一,其效能在某些任務上令人驚豔,尤其是編碼和資料分析。Nathan分享了他使用Kimi K3的經歷:在訂閱其最高階別服務後,他發現該模型在涉及網路爬取和Reddit分析等任務時表現獨特,甚至能發現傳統模型忽略的洞察。然而,由於伺服器位於中國且使用者過多,API響應速度較慢,影響了實際使用體驗。

Florian則從工程實踐角度評價了Kimi K3。他認為該模型生成的程式碼更簡潔易讀,但功能深度上略遜於Codex或Claude。儘管如此,對於監督實驗或快速原型開發,Kimi K3已足夠實用。他同時提到了GLM 5.2的持續價值,稱其為“Sonnet級別”的模型,適合作為子代理任務。

兩人還探討了中國模型為何如此出色。他們認為,中國實驗室在資料、環境和訓練規模上投入巨大,加上政府對開源戰略的支援(如習近平在WAIC的講話),推動了模型能力的快速提升。Qwen宣佈其下一代模型將開放權重,標誌著開放生態的重大轉變。

關於開放與封閉模型的差距,Nathan強調這種差距因任務而異。在軟體工程等領域,開放模型可能僅落後幾個月,但這一差距對特定用例(如Claude Code)至關重要。他預測,透過後訓練最佳化,開放模型有望在特定領域超越封閉模型。Florian則指出,人們往往用不同基準來誇大或縮小差距,實際表現取決於具體場景。

蒸餾技術成為另一個焦點。兩人批評了一些關於蒸餾的片面觀點,認為蒸餾並非簡單的複製,而是需要結合創新。他們預測,未來開放模型將繼續加速發展,但基礎設施和後訓練能力將成為關鍵瓶頸。整體而言,開放模型生態正快速專業化,但與封閉模型仍存在動態博弈。

此外,播客中還討論了美國開放模型生態的現狀,包括對前沿與近前沿模型的區分,以及網路安全方面的論據。兩人對未來的模型層級進行了預測,並展望了開放與封閉模型之間的競爭趨勢。

最後,他們還提到Nath的新書《後訓練知識分享》即將釋出,該書目前已成為亞馬遜AI類第一名。