AI News HubLIVE
站內改寫1 分鐘閱讀

Mellum2 開源:適用於 AI 工作流的快速模型

JetBrains 開源了 Mellum2,一個 12B 參數的 MoE 模型,專為快速、高效的 AI 工作流設計,用於路由、問答、子代理等。由於採用 MoE 架構,每 token 僅激活 2.5B 參數,降低了推理成本和延遲。

來源Hacker News AI作者: microflash

JetBrains 今日宣佈開源 Mellum2,一個 12B 參數的混合專家(MoE)模型,旨在解決生產級 AI 中延遲、吞吐量和成本的核心挑戰。該模型從零開始訓練,採用 Apache 2.0 許可證發佈,為基礎設施提供了高性能、高性價比的替代方案。

Mellum 最初專注於代碼補全,如今已進化為同時處理自然語言和代碼的通用工具。Mellum2 適用於路由、總結和中間推理步驟,可靈活集成到現代 AI 工作流中。無論是實驗、微調還是大規模部署,用户都可以在自己的系統中運行 Mellum2。

在架構上,Mellum2 採用 MoE 設計,總參數 12B,但每 token 僅激活 2.5B 參數,從而降低計算成本並實現高吞吐量、低延遲的推理。該模型並非多模態,而是專門針對自然語言和代碼數據訓練,確保在軟件工程環境中表現出色且保持輕量。技術報告顯示,Mellum2 在代碼生成、科學、數學和推理基準測試中與同類模型競爭,同時推理時間縮短一半以上,這使其在生產部署中具有明顯優勢。

關鍵用例包括:路由和編排 AI 工作負載,分析傳入提示並選擇合適模型;構建低延遲 RAG 流水線,檢索上下文並即時生成響應;在複雜工作流中驅動快速子代理,將代理流程拆分為上下文收集、規劃和驗證等步驟;以及啓用私有本地 AI 部署,完全控制代碼和數據。

JetBrains 強調“焦點模型”理念:隨着 AI 系統日益複雜,性能瓶頸從原始能力轉向延遲、吞吐量和成本。並非所有任務都需要最大模型,許多步驟重複、對延遲敏感且頻繁。焦點模型作為快速、可靠的專門組件,能夠高效處理高頻任務。JetBrains 認為未來屬於協調的系統,而 Mellum2 正是下一代 AI 軟件工具中的焦點模型。

用户可立即開始使用 Mellum2,將其集成到 IDE、RAG 流水線、代理工作流或自有基礎設施中。JetBrains 表示,開源是打造更好工具的方式。