AI News HubLIVE
站內改寫2 分鐘閱讀

Fireworks AI 推出 Kimi K3 的 LoRA 訓練:前沿智慧,觸手可及

Fireworks AI 為其巨大的 MoE 模型 Kimi K3(約 2.8 萬億引數)推出了無伺服器 LoRA 訓練。LoRA 介面卡訓練成本低,服務靈活,可將細微調整成本降至幾乎為零。透過兩個任務示例(Countdown 和 Frozen Lake)展示了小介面卡如何快速教模型新目標或工具使用迴圈。文章還強調了獎勵設計的重要性,以及資料飛輪效應。

Fireworks AI 今天宣佈為其旗艦模型 Kimi K3 提供無伺服器 LoRA 訓練服務,使開發者能夠以極低的成本定製這個擁有約 2.8 萬億引數的混合專家模型。Kimi K3 是首個達到 3 萬億引數規模的開源模型,此前訓練這樣的龐然大物需要大量基礎設施投入,而現在只需在 Fireworks 平臺上更改一行程式碼即可開始。

LoRA(低秩適配)技術透過訓練一小部分額外權重(介面卡)而非整個模型來工作。介面卡檔案僅幾兆位元組,易於儲存和部署。Fireworks 提供兩種服務方式:即時合併(將單個介面卡合併到模型中,實現與基礎模型相同的速度)和多 LoRA(在同一部署中託管多個介面卡,按請求路由)。由於基礎權重只載入一次,新增新介面卡的邊際成本極低。

無伺服器訓練的最大優勢在於成本效率。使用者按 token 付費,無需預定 GPU 叢集。一個小規模強化學習執行(約 20 步、86 萬個訓練 token)總花費約 65 美元,包括訓練和取樣,30 到 60 分鐘內完成。對於多輪 agent 任務,由於採用了 KV 快取感知技術,重複上下文的預填充費用僅為標準費率的 20%,進一步降低成本。HUD 公司的聯創 Lorenss Martinsons 表示,他們的團隊可以專注於環境和獎勵質量,而無需操心 GPU 叢集。

為了展示 LoRA 的威力,Fireworks 團隊設計了兩個典型任務。第一個是 Countdown 遊戲:模型需使用給定數字透過算術運算達到目標值。這主要考驗學習新目標的能力。K3 基線約能獲得 80% 的分數,而經過約十步訓練後,一個簡單介面卡就讓其逼近完美解。第二個是 Frozen Lake 網格導航任務:模型需透過移動工具從起點走到目標點,且不能落入陷阱。這模擬了真實 agent 的觀察-行動-觀察迴圈。起初 K3 的成功率接近拋硬幣水平,但經過少量訓練後,幾乎每次都能到達目標。

Fireworks 強調,LoRA 使得訓練如此廉價,以至於真正的挑戰不再是成本,而是如何設計獎勵函式。在 Countdown 任務中,部分獎勵提供了密集訊號,學習曲線快速上升;而 Frozen Lake 只有到達目標才給獎勵,訊號稀疏,學習曲線上升較慢。這凸顯了獎勵設計在模型後訓練中的核心作用——即使是全引數訓練,如果獎勵設計不當也無法成功。

對於有興趣的開發者,Fireworks 提供了快速入門指南。只需安裝 SDK、克隆 cookbook,並執行一條命令即可復現 Countdown 示例。K3 的 LoRA 訓練需要申請訪問許可權。

最後,Fireworks 指出,對於大多數單一行為任務,LoRA 已經足夠。全引數訓練仍適用於更廣泛或全新的場景,如多項無關任務訓練、大規模蒸餾或新語言領域。但真正的優勢在於訓練和服務在同一平臺上的迴圈:訓練介面卡 → 部署 → 監控 → 收集反饋 → 再次訓練。這個資料飛輪隨著每輪迭代使模型不斷進化,形成越來越寬的護城河。