JetBrains 發佈 Mellum2:面向多模型 AI 流水線的 12B MoE 快速專用模型
JetBrains 開源了 Mellum2,一個 12B 參數的混合專家(MoE)模型,活躍參數僅 2.5B,訓練於 10.6 萬億 token,專為軟件工程任務設計。它作為多模型 AI 系統中的快速專用組件,適用於路由、RAG 流水線、子代理和本地部署等場景。
JetBrains 近日發佈了 Mellum2,這是其 Mellum 系列的第二代模型,採用混合專家(MoE)架構,總參數量 12B,但每個 token 僅激活 2.5B 參數。模型權重以 Apache 2.0 許可開源,可在 Hugging Face 獲取。
Mellum2 定位為“焦點模型”,旨在作為大型 AI 系統中快速、專用的組件,而非替代前沿模型。它專為軟件工程任務設計,涵蓋代碼生成、編輯、調試、多步推理、工具調用、函數調用、代理編碼和對話式編程協助等能力。
架構亮點
- 28 層網絡,隱藏層維度 2304。
- 64 個專家網絡,每個 token 激活 8 個專家。
- 採用分組查詢注意力(GQA),32 個查詢頭、4 個鍵值頭。
- 滑動窗口注意力(SWA)應用於每四層中的三層,窗口大小 1024。
- 上下文長度達 131,072 token。
- 多 token 預測頭(MTP)作為輔助預訓練目標和內置草稿模型。
- 精度為 bfloat16,詞表大小 98,304。
- 僅支持文本和代碼,不支持多模態輸入。
預訓練與微調 Mellum2 經過約 10.6 萬億 token 的三階段課程式預訓練,數據混合從多樣網絡內容逐步轉向精選代碼和數學內容。訓練使用 Muon 優化器和 FP8 混合精度,學習率採用 Warmup-Hold-Decay 調度。預訓練後通過層選擇性 YaRN 擴展上下文至 128K。
微調分兩階段:先進行監督微調(SFT),再使用可驗證獎勵的強化學習(RLVR)優化數學、編碼、工具使用、指令遵循、推理和知識任務。
JetBrains 發佈了六個檢查點:預訓練基礎版(上下文擴展前和後)、SFT 指令版、SFT 思考版、RL 指令版和 RL 思考版。指令變體直接作答,適用於低延遲場景;思考變體輸出顯式推理過程,適用於複雜調試和多步規劃。
基準測試表現 JetBrains 報告了自測結果,對比模型為 4B-14B 參數的開源模型。
- 編碼:EvalPlus 78.4,MultiPL-E 67.1,LiveCodeBench v6 37.2。
- 工具調用:BFCL v3 66.3,BFCL v4 44.2。
- 數學:AIME 2025+2026 41.7,GSM-Plus 80.5。
- 知識對話:MMLU-Redux 78.1,GPQA Diamond 40.9,IFEval 75.8,MixEval 62.2。
在部分基準上,Mellum2 的表現弱於 Qwen3.5 9B 和 Ministral 3 14B,但其計算效率更高。
應用場景 JetBrains 推薦四個生產場景:
- 路由與編排:分析輸入提示並選擇合適模型或工具。
- 低延遲 RAG 流水線:以低延遲彙總檢索到的上下文。
- 子代理:處理代理流水線中的重複或延遲敏感步驟。
- 私有本地部署:Apach 2.0 許可允許完全自託管。
優點與侷限 優點:MoE 設計提供 2.5B 活躍參數的高計算效率;MTP 頭實現內置推測解碼;131K 上下文窗口;Apache 2.0 許可允許商業使用和微調;vLLM 支持工具調用。
侷限:僅文本和代碼,無多模態;LiveCodeBench v6 和 GPQA Diamond 等基準得分較低;不適用於前沿任務。
快速開始 用户可通過 vLLM 快速部署 Mellum2:
pip install vllm
vllm serve JetBrains/Mellum2-12B-A2.5B-Instruct --max-model-len 131072啓用工具調用:
vllm serve ... --enable-auto-tool-choice --tool-call-parser hermes也支持 Hugging Face Transformers 庫。