AI News HubLIVE
站內改寫2 分鐘閱讀

Fireworks AI 推出 Kimi K3 的 LoRA 訓練:前沿智能,觸手可及

Fireworks AI 為其巨大的 MoE 模型 Kimi K3(約 2.8 萬億參數)推出了無服務器 LoRA 訓練。LoRA 適配器訓練成本低,服務靈活,可將細微調整成本降至幾乎為零。通過兩個任務示例(Countdown 和 Frozen Lake)展示了小適配器如何快速教模型新目標或工具使用循環。文章還強調了獎勵設計的重要性,以及數據飛輪效應。

Fireworks AI 今天宣佈為其旗艦模型 Kimi K3 提供無服務器 LoRA 訓練服務,使開發者能夠以極低的成本定製這個擁有約 2.8 萬億參數的混合專家模型。Kimi K3 是首個達到 3 萬億參數規模的開源模型,此前訓練這樣的龐然大物需要大量基礎設施投入,而現在只需在 Fireworks 平台上更改一行代碼即可開始。

LoRA(低秩適配)技術通過訓練一小部分額外權重(適配器)而非整個模型來工作。適配器文件僅幾兆字節,易於存儲和部署。Fireworks 提供兩種服務方式:實時合併(將單個適配器合併到模型中,實現與基礎模型相同的速度)和多 LoRA(在同一部署中託管多個適配器,按請求路由)。由於基礎權重只加載一次,添加新適配器的邊際成本極低。

無服務器訓練的最大優勢在於成本效率。用户按 token 付費,無需預定 GPU 集羣。一個小規模強化學習運行(約 20 步、86 萬個訓練 token)總花費約 65 美元,包括訓練和採樣,30 到 60 分鐘內完成。對於多輪 agent 任務,由於採用了 KV 緩存感知技術,重複上下文的預填充費用僅為標準費率的 20%,進一步降低成本。HUD 公司的聯創 Lorenss Martinsons 表示,他們的團隊可以專注於環境和獎勵質量,而無需操心 GPU 集羣。

為了展示 LoRA 的威力,Fireworks 團隊設計了兩個典型任務。第一個是 Countdown 遊戲:模型需使用給定數字通過算術運算達到目標值。這主要考驗學習新目標的能力。K3 基線約能獲得 80% 的分數,而經過約十步訓練後,一個簡單適配器就讓其逼近完美解。第二個是 Frozen Lake 網格導航任務:模型需通過移動工具從起點走到目標點,且不能落入陷阱。這模擬了真實 agent 的觀察-行動-觀察循環。起初 K3 的成功率接近拋硬幣水平,但經過少量訓練後,幾乎每次都能到達目標。

Fireworks 強調,LoRA 使得訓練如此廉價,以至於真正的挑戰不再是成本,而是如何設計獎勵函數。在 Countdown 任務中,部分獎勵提供了密集信號,學習曲線快速上升;而 Frozen Lake 只有到達目標才給獎勵,信號稀疏,學習曲線上升較慢。這凸顯了獎勵設計在模型後訓練中的核心作用——即使是全參數訓練,如果獎勵設計不當也無法成功。

對於有興趣的開發者,Fireworks 提供了快速入門指南。只需安裝 SDK、克隆 cookbook,並運行一條命令即可復現 Countdown 示例。K3 的 LoRA 訓練需要申請訪問權限。

最後,Fireworks 指出,對於大多數單一行為任務,LoRA 已經足夠。全參數訓練仍適用於更廣泛或全新的場景,如多項無關任務訓練、大規模蒸餾或新語言領域。但真正的優勢在於訓練和服務在同一平台上的循環:訓練適配器 → 部署 → 監控 → 收集反饋 → 再次訓練。這個數據飛輪隨着每輪迭代使模型不斷進化,形成越來越寬的護城河。