JetBrains 釋出 Mellum2:面向多模型 AI 流水線的 12B MoE 快速專用模型
JetBrains 開源了 Mellum2,一個 12B 引數的混合專家(MoE)模型,活躍引數僅 2.5B,訓練於 10.6 萬億 token,專為軟體工程任務設計。它作為多模型 AI 系統中的快速專用元件,適用於路由、RAG 流水線、子代理和本地部署等場景。
JetBrains 近日釋出了 Mellum2,這是其 Mellum 系列的第二代模型,採用混合專家(MoE)架構,總引數量 12B,但每個 token 僅啟用 2.5B 引數。模型權重以 Apache 2.0 許可開源,可在 Hugging Face 獲取。
Mellum2 定位為“焦點模型”,旨在作為大型 AI 系統中快速、專用的元件,而非替代前沿模型。它專為軟體工程任務設計,涵蓋程式碼生成、編輯、除錯、多步推理、工具呼叫、函式呼叫、代理編碼和對話式程式設計協助等能力。
架構亮點
- 28 層網路,隱藏層維度 2304。
- 64 個專家網路,每個 token 啟用 8 個專家。
- 採用分組查詢注意力(GQA),32 個查詢頭、4 個鍵值頭。
- 滑動視窗注意力(SWA)應用於每四層中的三層,視窗大小 1024。
- 上下文長度達 131,072 token。
- 多 token 預測頭(MTP)作為輔助預訓練目標和內建草稿模型。
- 精度為 bfloat16,詞表大小 98,304。
- 僅支援文本和程式碼,不支援多模態輸入。
預訓練與微調 Mellum2 經過約 10.6 萬億 token 的三階段課程式預訓練,資料混合從多樣網路內容逐步轉向精選程式碼和數學內容。訓練使用 Muon 最佳化器和 FP8 混合精度,學習率採用 Warmup-Hold-Decay 排程。預訓練後透過層選擇性 YaRN 擴充套件上下文至 128K。
微調分兩階段:先進行監督微調(SFT),再使用可驗證獎勵的強化學習(RLVR)最佳化數學、編碼、工具使用、指令遵循、推理和知識任務。
JetBrains 釋出了六個檢查點:預訓練基礎版(上下文擴充套件前和後)、SFT 指令版、SFT 思考版、RL 指令版和 RL 思考版。指令變體直接作答,適用於低延遲場景;思考變體輸出顯式推理過程,適用於複雜除錯和多步規劃。
基準測試表現 JetBrains 報告了自測結果,對比模型為 4B-14B 引數的開源模型。
- 編碼:EvalPlus 78.4,MultiPL-E 67.1,LiveCodeBench v6 37.2。
- 工具呼叫:BFCL v3 66.3,BFCL v4 44.2。
- 數學:AIME 2025+2026 41.7,GSM-Plus 80.5。
- 知識對話:MMLU-Redux 78.1,GPQA Diamond 40.9,IFEval 75.8,MixEval 62.2。
在部分基準上,Mellum2 的表現弱於 Qwen3.5 9B 和 Ministral 3 14B,但其計算效率更高。
應用場景 JetBrains 推薦四個生產場景:
- 路由與編排:分析輸入提示並選擇合適模型或工具。
- 低延遲 RAG 流水線:以低延遲彙總檢索到的上下文。
- 子代理:處理代理流水線中的重複或延遲敏感步驟。
- 私有本地部署:Apach 2.0 許可允許完全自託管。
優點與侷限 優點:MoE 設計提供 2.5B 活躍引數的高計算效率;MTP 頭實現內建推測解碼;131K 上下文視窗;Apache 2.0 許可允許商業使用和微調;vLLM 支援工具呼叫。
侷限:僅文本和程式碼,無多模態;LiveCodeBench v6 和 GPQA Diamond 等基準得分較低;不適用於前沿任務。
快速開始 使用者可透過 vLLM 快速部署 Mellum2:
pip install vllm
vllm serve JetBrains/Mellum2-12B-A2.5B-Instruct --max-model-len 131072啟用工具呼叫:
vllm serve ... --enable-auto-tool-choice --tool-call-parser hermes也支援 Hugging Face Transformers 庫。