Mellum2 開源:適用於 AI 工作流的快速模型
JetBrains 開源了 Mellum2,一個 12B 參數的 MoE 模型,專為快速、高效的 AI 工作流設計,用於路由、問答、子代理等。由於採用 MoE 架構,每 token 僅激活 2.5B 參數,降低了推理成本和延遲。
JetBrains 今日宣佈開源 Mellum2,一個 12B 參數的混合專家(MoE)模型,旨在解決生產級 AI 中延遲、吞吐量和成本的核心挑戰。該模型從零開始訓練,採用 Apache 2.0 許可證發佈,為基礎設施提供了高性能、高性價比的替代方案。
Mellum 最初專注於代碼補全,如今已進化為同時處理自然語言和代碼的通用工具。Mellum2 適用於路由、總結和中間推理步驟,可靈活集成到現代 AI 工作流中。無論是實驗、微調還是大規模部署,用户都可以在自己的系統中運行 Mellum2。
在架構上,Mellum2 採用 MoE 設計,總參數 12B,但每 token 僅激活 2.5B 參數,從而降低計算成本並實現高吞吐量、低延遲的推理。該模型並非多模態,而是專門針對自然語言和代碼數據訓練,確保在軟件工程環境中表現出色且保持輕量。技術報告顯示,Mellum2 在代碼生成、科學、數學和推理基準測試中與同類模型競爭,同時推理時間縮短一半以上,這使其在生產部署中具有明顯優勢。
關鍵用例包括:路由和編排 AI 工作負載,分析傳入提示並選擇合適模型;構建低延遲 RAG 流水線,檢索上下文並即時生成響應;在複雜工作流中驅動快速子代理,將代理流程拆分為上下文收集、規劃和驗證等步驟;以及啓用私有本地 AI 部署,完全控制代碼和數據。
JetBrains 強調“焦點模型”理念:隨着 AI 系統日益複雜,性能瓶頸從原始能力轉向延遲、吞吐量和成本。並非所有任務都需要最大模型,許多步驟重複、對延遲敏感且頻繁。焦點模型作為快速、可靠的專門組件,能夠高效處理高頻任務。JetBrains 認為未來屬於協調的系統,而 Mellum2 正是下一代 AI 軟件工具中的焦點模型。
用户可立即開始使用 Mellum2,將其集成到 IDE、RAG 流水線、代理工作流或自有基礎設施中。JetBrains 表示,開源是打造更好工具的方式。