AI News HubLIVE
站內改寫2 分鐘閱讀

JetBrains 釋出 Mellum2:面向多模型 AI 流水線的 12B MoE 快速專用模型

JetBrains 開源了 Mellum2,一個 12B 引數的混合專家(MoE)模型,活躍引數僅 2.5B,訓練於 10.6 萬億 token,專為軟體工程任務設計。它作為多模型 AI 系統中的快速專用元件,適用於路由、RAG 流水線、子代理和本地部署等場景。

來源MarkTechPost作者: Asif Razzaq

JetBrains 近日釋出了 Mellum2,這是其 Mellum 系列的第二代模型,採用混合專家(MoE)架構,總引數量 12B,但每個 token 僅啟用 2.5B 引數。模型權重以 Apache 2.0 許可開源,可在 Hugging Face 獲取。

Mellum2 定位為“焦點模型”,旨在作為大型 AI 系統中快速、專用的元件,而非替代前沿模型。它專為軟體工程任務設計,涵蓋程式碼生成、編輯、除錯、多步推理、工具呼叫、函式呼叫、代理編碼和對話式程式設計協助等能力。

架構亮點

  • 28 層網路,隱藏層維度 2304。
  • 64 個專家網路,每個 token 啟用 8 個專家。
  • 採用分組查詢注意力(GQA),32 個查詢頭、4 個鍵值頭。
  • 滑動視窗注意力(SWA)應用於每四層中的三層,視窗大小 1024。
  • 上下文長度達 131,072 token。
  • 多 token 預測頭(MTP)作為輔助預訓練目標和內建草稿模型。
  • 精度為 bfloat16,詞表大小 98,304。
  • 僅支援文本和程式碼,不支援多模態輸入。

預訓練與微調 Mellum2 經過約 10.6 萬億 token 的三階段課程式預訓練,資料混合從多樣網路內容逐步轉向精選程式碼和數學內容。訓練使用 Muon 最佳化器和 FP8 混合精度,學習率採用 Warmup-Hold-Decay 排程。預訓練後透過層選擇性 YaRN 擴充套件上下文至 128K。

微調分兩階段:先進行監督微調(SFT),再使用可驗證獎勵的強化學習(RLVR)最佳化數學、編碼、工具使用、指令遵循、推理和知識任務。

JetBrains 釋出了六個檢查點:預訓練基礎版(上下文擴充套件前和後)、SFT 指令版、SFT 思考版、RL 指令版和 RL 思考版。指令變體直接作答,適用於低延遲場景;思考變體輸出顯式推理過程,適用於複雜除錯和多步規劃。

基準測試表現 JetBrains 報告了自測結果,對比模型為 4B-14B 引數的開源模型。

  • 編碼:EvalPlus 78.4,MultiPL-E 67.1,LiveCodeBench v6 37.2。
  • 工具呼叫:BFCL v3 66.3,BFCL v4 44.2。
  • 數學:AIME 2025+2026 41.7,GSM-Plus 80.5。
  • 知識對話:MMLU-Redux 78.1,GPQA Diamond 40.9,IFEval 75.8,MixEval 62.2。

在部分基準上,Mellum2 的表現弱於 Qwen3.5 9B 和 Ministral 3 14B,但其計算效率更高。

應用場景 JetBrains 推薦四個生產場景:

  1. 路由與編排:分析輸入提示並選擇合適模型或工具。
  2. 低延遲 RAG 流水線:以低延遲彙總檢索到的上下文。
  3. 子代理:處理代理流水線中的重複或延遲敏感步驟。
  4. 私有本地部署:Apach 2.0 許可允許完全自託管。

優點與侷限 優點:MoE 設計提供 2.5B 活躍引數的高計算效率;MTP 頭實現內建推測解碼;131K 上下文視窗;Apache 2.0 許可允許商業使用和微調;vLLM 支援工具呼叫。

侷限:僅文本和程式碼,無多模態;LiveCodeBench v6 和 GPQA Diamond 等基準得分較低;不適用於前沿任務。

快速開始 使用者可透過 vLLM 快速部署 Mellum2:

pip install vllm
vllm serve JetBrains/Mellum2-12B-A2.5B-Instruct --max-model-len 131072

啟用工具呼叫:

vllm serve ... --enable-auto-tool-choice --tool-call-parser hermes

也支援 Hugging Face Transformers 庫。