AI News HubLIVE
サイト内リライト2 分で読了

JetBrains、Mellum2 をリリース:マルチモデル AI パイプライン向け高速特化型 12B MoE モデル

JetBrains は、Mellum2 を Apache 2.0 ライセンスでオープンソース化しました。これは、12B パラメータの Mixture-of-Experts (MoE) モデルで、アクティブパラメータは 2.5B のみ、10.6 兆トークンで学習されています。ソフトウェアエンジニアリングタスクに特化し、大規模 AI システム内の高速コンポーネントとして、ルーティング、RAG、エージェントワークフローなどに適しています。

ソースMarkTechPost著者: Asif Razzaq

JetBrains は、ソフトウェアエンジニアリングに特化した新モデル Mellum2 をリリースしました。本モデルは Mixture-of-Experts (MoE) アーキテクチャを採用し、総パラメータ数 12B、トークンあたりのアクティブパラメータは 2.5B と効率的です。Apache 2.0 ライセンスで公開され、Hugging Face からダウンロード可能です。

Mellum2 は「焦点モデル」として位置づけられ、大規模 AI システムの高速かつ特化したコンポーネントとして機能します。コード生成、編集、デバッグ、マルチステップ推論、ツール呼び出し、関数呼び出し、エージェントコーディング、対話型プログラミング支援など、ソフトウェアエンジニアリングの幅広いタスクをカバーします。

アーキテクチャの特徴

  • 28 層、隠れ層サイズ 2304。
  • 64 のエキスパート、トークンあたり 8 つを活性化。
  • グループ化クエリアテンション(GQA)を採用、32 のクエリヘッドと 4 の KV ヘッド。
  • スライディングウィンドウアテンション(SWA)を 4 層中 3 層に適用、ウィンドウサイズ 1024。
  • コンテキスト長 131,072 トークン。
  • マルチトークン予測ヘッド(MTP)を備え、補助学習目的と投機的復号のドラフトモデルとして機能。
  • 精度は bfloat16、語彙サイズ 98,304。
  • テキストとコードのみ対応、画像やビデオは処理不可。

学習プロセス 約 10.6 兆トークンを用いた 3 フェーズのカリキュラム事前学習を実施。データ構成は多様なウェブコンテンツから徐々にコードや数学へシフト。最適化には Muon オプティマイザーと FP8 混合精度を使用。学習率は Warmup-Hold-Decay スケジュールで、線形減衰を適用。事前学習後、層選択的 YaRN でコンテキストを 128K に拡張。

事後学習は、教師ありファインチューニング(SFT)に続き、数学、コード、ツール使用、推論、知識タスクに対して検証可能な報酬を用いた強化学習(RLVR)を実施。

JetBrains は、事前学習ベース、コンテキスト拡張後ベース、SFT 指示モデル、SFT 思考モデル、RL 指示モデル、RL 思考モデルの 6 つのチェックポイントを公開。指示モデルは直接回答し低遅延タスクに適し、思考モデルは明示的な推論過程を示し複雑なデバッグやマルチステップ計画に有効。

ベンチマーク結果 自社比較(4B~14B パラメータのオープンモデル対象):

  • コード:EvalPlus 78.4、MultiPL-E 67.1、LiveCodeBench v6 37.2。
  • ツール使用:BFCL v3 66.3、BFCL v4 44.2。
  • 数学:AIME 2025+2026 41.7、GSM-Plus 80.5。
  • 知識対話:MMLU-Redux 78.1、GPQA Diamond 40.9、IFEval 75.8、MixEval 62.2。

一部ベンチマークでは Qwen3.5 9B や Ministral 3 14B に劣るものの、計算効率は大幅に高い。

実用的なユースケース

  1. ルーティングとオーケストレーション:入力プロンプトを分析し適切なモデルを選択。
  2. 低遅延 RAG パイプライン:検索コンテキストを高速に要約。
  3. 複雑ワークフローのサブエージェント:繰り返し処理や遅延センシティブなステップを担当。
  4. プライベートおよびローカルデプロイ:Apache 2.0 ライセンスにより完全なセルフホスティングが可能。

強みと限界 強み:アクティブパラメータ 2.5B による高効率、MTP ヘッドによる投機的復号、131K コンテキスト、Apache 2.0 ライセンス、vLLM でのツール呼び出し対応。

限界:テキストとコードのみ、LiveCodeBench v6 や GPQA Diamond での低スコア、フロンティアモデルの代替不可。

はじめ方 vLLM を使用して簡単にデプロイ可能:

pip install vllm
vllm serve JetBrains/Mellum2-12B-A2.5B-Instruct --max-model-len 131072

ツール呼び出しを有効にするには:

vllm serve ... --enable-auto-tool-choice --tool-call-parser hermes

Hugging Face Transformers ライブラリもサポート。