AI News HubLIVE
站內改寫2 分鐘閱讀

JetBrains 發佈 Mellum2:面向多模型 AI 流水線的 12B MoE 快速專用模型

JetBrains 開源了 Mellum2,一個 12B 參數的混合專家(MoE)模型,活躍參數僅 2.5B,訓練於 10.6 萬億 token,專為軟件工程任務設計。它作為多模型 AI 系統中的快速專用組件,適用於路由、RAG 流水線、子代理和本地部署等場景。

來源MarkTechPost作者: Asif Razzaq

JetBrains 近日發佈了 Mellum2,這是其 Mellum 系列的第二代模型,採用混合專家(MoE)架構,總參數量 12B,但每個 token 僅激活 2.5B 參數。模型權重以 Apache 2.0 許可開源,可在 Hugging Face 獲取。

Mellum2 定位為“焦點模型”,旨在作為大型 AI 系統中快速、專用的組件,而非替代前沿模型。它專為軟件工程任務設計,涵蓋代碼生成、編輯、調試、多步推理、工具調用、函數調用、代理編碼和對話式編程協助等能力。

架構亮點

  • 28 層網絡,隱藏層維度 2304。
  • 64 個專家網絡,每個 token 激活 8 個專家。
  • 採用分組查詢注意力(GQA),32 個查詢頭、4 個鍵值頭。
  • 滑動窗口注意力(SWA)應用於每四層中的三層,窗口大小 1024。
  • 上下文長度達 131,072 token。
  • 多 token 預測頭(MTP)作為輔助預訓練目標和內置草稿模型。
  • 精度為 bfloat16,詞表大小 98,304。
  • 僅支持文本和代碼,不支持多模態輸入。

預訓練與微調 Mellum2 經過約 10.6 萬億 token 的三階段課程式預訓練,數據混合從多樣網絡內容逐步轉向精選代碼和數學內容。訓練使用 Muon 優化器和 FP8 混合精度,學習率採用 Warmup-Hold-Decay 調度。預訓練後通過層選擇性 YaRN 擴展上下文至 128K。

微調分兩階段:先進行監督微調(SFT),再使用可驗證獎勵的強化學習(RLVR)優化數學、編碼、工具使用、指令遵循、推理和知識任務。

JetBrains 發佈了六個檢查點:預訓練基礎版(上下文擴展前和後)、SFT 指令版、SFT 思考版、RL 指令版和 RL 思考版。指令變體直接作答,適用於低延遲場景;思考變體輸出顯式推理過程,適用於複雜調試和多步規劃。

基準測試表現 JetBrains 報告了自測結果,對比模型為 4B-14B 參數的開源模型。

  • 編碼:EvalPlus 78.4,MultiPL-E 67.1,LiveCodeBench v6 37.2。
  • 工具調用:BFCL v3 66.3,BFCL v4 44.2。
  • 數學:AIME 2025+2026 41.7,GSM-Plus 80.5。
  • 知識對話:MMLU-Redux 78.1,GPQA Diamond 40.9,IFEval 75.8,MixEval 62.2。

在部分基準上,Mellum2 的表現弱於 Qwen3.5 9B 和 Ministral 3 14B,但其計算效率更高。

應用場景 JetBrains 推薦四個生產場景:

  1. 路由與編排:分析輸入提示並選擇合適模型或工具。
  2. 低延遲 RAG 流水線:以低延遲彙總檢索到的上下文。
  3. 子代理:處理代理流水線中的重複或延遲敏感步驟。
  4. 私有本地部署:Apach 2.0 許可允許完全自託管。

優點與侷限 優點:MoE 設計提供 2.5B 活躍參數的高計算效率;MTP 頭實現內置推測解碼;131K 上下文窗口;Apache 2.0 許可允許商業使用和微調;vLLM 支持工具調用。

侷限:僅文本和代碼,無多模態;LiveCodeBench v6 和 GPQA Diamond 等基準得分較低;不適用於前沿任務。

快速開始 用户可通過 vLLM 快速部署 Mellum2:

pip install vllm
vllm serve JetBrains/Mellum2-12B-A2.5B-Instruct --max-model-len 131072

啓用工具調用:

vllm serve ... --enable-auto-tool-choice --tool-call-parser hermes

也支持 Hugging Face Transformers 庫。