AI News HubLIVE
サイト内リライト2 分で読了

Mellum2 がオープンソースに:AI ワークフローのための高速モデル

JetBrains は、ルーティング、Q&A、サブエージェント向けに設計された 12B パラメータの MoE モデル Mellum2 をオープンソース化しました。トークンあたりわずか 2.5B パラメータしか活性化しないため、低レイテンシを実現します。

ソースHacker News AI著者: microflash

JetBrains は本日、Mellum2 をオープンソースとして公開しました。これは 12B パラメータの混合専門家(MoE)モデルで、本番 AI におけるレイテンシ、スループット、コストの課題を解決するために設計されています。ゼロからトレーニングされ、Apache 2.0 ライセンスの下で提供され、高パフォーマンスでコスト効率の高いインフラストラクチャ代替手段を提供します。

Mellum は当初コード補完に特化していましたが、現在は自然言語とコードの両方を処理できる汎用ツールへと進化しました。Mellum2 は、ルーティング、要約、中間推論ステップに適しており、最新の AI ワークフローに柔軟に統合できます。実験、ファインチューニング、大規模デプロイのいずれにおいても、ユーザーは自身のシステムで Mellum2 を実行できます。

アーキテクチャ面では、Mellum2 は MoE 設計を採用し、総パラメータ数 12B ですが、トークンあたりわずか 2.5B パラメータしか活性化しないため、計算コストを削減し、高スループット・低レイテンシの推論を実現します。このモデルはマルチモーダルではなく、自然言語とコードデータに特化してトレーニングされており、ソフトウェアエンジニアリング環境で優れた性能を発揮しつつ、軽量で高速です。技術レポートによると、Mellum2 はコード生成、科学、数学、推論ベンチマークで同規模のモデルと競合し、推論時間を半分以下に短縮します。これは本番デプロイにおける決定的な利点です。

主なユースケースとして、AI ワークロードのルーティングとオーケストレーション(入力プロンプトを分析し適切なモデルを選択)、低レイテンシ RAG パイプラインの構築(関連コンテキストを取得し瞬時に応答生成)、複雑なワークフローにおける高速サブエージェントの駆動(エージェントパイプラインをコンテキスト収集、計画、検証などのステップに分割)、そしてプライベートなローカル AI デプロイの実現(コードとデータを完全に制御)が挙げられます。

JetBrains は「焦点モデル」の哲学を強調しています。AI システムが複雑になるにつれ、パフォーマンスのボトルネックは生の能力からレイテンシ、スループット、コストへと移行します。すべてのタスクに最大のモデルが必要なわけではなく、多くのステップは反復的でレイテンシに敏感で高頻度です。焦点モデルは、高速で信頼性の高い専門コンポーネントとして、高頻度タスクを効率的に処理します。JetBrains は、将来は調整されたシステムにあり、Mellum2 は次世代 AI ソフトウェアツールにおける焦点モデルとしての役割を担うと述べています。

ユーザーはすぐに Mellum2 を使い始めることができ、IDE、RAG パイプライン、エージェントワークフロー、または独自のインフラストラクチャに統合できます。JetBrains は、オープンソースこそがより良いツールを生み出す方法であると述べています。