Ollamaは2026年6月11日、MLXエンジンのアップデートによりApple Silicon上でこれまでで最高のパフォーマンスを達成したことを発表しました。このアップデートでは、AppleのユニファイドメモリとMetalベースのMLXフレームワークをより活用することで、モデルの応答品質が向上し、応答速度が向上し、メモリ使用量が削減されます。
(ビデオタグ:MacBook Pro M5 Max上でGemma 4 12Bを使用したコーディングエージェント。改善されたMLXエンジンにより、高品質な結果、高速な出力、思考と複数のサブエージェントによる短い初回トークン時間を実現。)
NVFP4による高品質な出力
OllamaのMLXエンジンはNVIDIAのモデル最適化NVFP4フォーマットをサポートするようになり、他の4ビット量子化フォーマットよりも高品質な出力を提供しながら、最先端のパフォーマンスを維持します。さらに、データセンター向けに最適化されたモデルをインポートしてMLXエンジンで実行できるようになり、データセンターとデスクトップ間の移植性が向上しました。
NVFP4はモデルウェイトの局所的なダイナミックレンジをより厳密に追跡するため、量子化による損失が低減されます。Gemma 4 12Bモデルでq4_K_M(Ollamaで一般的な4ビット量子化フォーマット)、NVFP4、未量子化のbf16ウェイト間のパープレキシティ差を測定したところ、モデル最適化NVFP4は品質損失をほぼ半減させながらパフォーマンスを維持しました。
(パープレキシティチャート:Gemma 4 12B – 低いほど良い。NVFP4は4ビット量子化の品質損失を未量子化BF16と比較してほぼ半減。)
高速な出力パフォーマンス
OllamaのMLXエンジンは、新しい最適化により最大20%高速化されました。MLXのジャストインタイムコンパイラ機能を介していくつかの操作が単一のMetalカーネルに融合され、OllamaのGPUベースのサンプリングがより効率的に動作するよう再構築されました。
(出力速度チャート:tokens/s – 高いほど良い。更新されたエンジンでは、NVFP4はq4_K_Mよりも約20%高速。8300トークンの入力プロンプトを指定した10回の実行における平均出力速度。)
エージェントワークフローでの応答性向上
エージェントワークロードはプロンプト処理が大部分を占めます。ツールコールごとに新しいリクエストが発生し、リクエストごとにシステムプロンプト、ツール定義、これまでに読み取ったすべてのファイルを含むトランスクリプト全体が再送信されます。単一のタスク中にモデルは同じコンテキストを何度も処理することになります。プレフィックスキャッシングは、各リクエストが前回のリクエストの続きから開始する限り、繰り返しの作業を回避します。
実際のエージェントセッションでは、そのような状態が長く続くことはありません。Ollamaの新しいスナップショットシステムは、会話のキーポイントでモデル状態を保存します。これはOllamaのクラウドでエージェントワークロードを処理するのと同じアプローチです。
- マルチエージェント:エージェントがサブエージェントに引き継ぎ、後で再開するか、2つのセッションが同時に実行されます。各セッションは自身の保存状態から再開し、共通部分(多くの場合数万トークンのシステムプロンプト、ツール定義、取り込まれたファイル)は一度だけ処理されます。
- 思考モデル:推論トークンが生成された後、会話履歴から削除されるため、次のリクエストはエンジンが構築した状態と一致しません。通常、各ターンで会話全体が再処理されます。応答が開始される直前にスナップショットを取得することで、次のターンに再開する場所を提供します。
- ブランチングとリトライ:異なるフォローアップや再生成された応答は、キャッシュされた会話を拡張するのではなく、分岐します。スナップショットは会話が分割される時点に存在するため、新しい方向のみを処理する必要があります。
ほとんどの新しいモデルでは、これがさらに困難になります。スライディングウィンドウアテンションとリカレント層は巻き戻せない状態を保持します。モデルが会話のある時点を過ぎると、その時点で状態が保存されていない限り回復できません。Ollamaは会話に戻る可能性が高い時点、つまり分岐点、長いプロンプトの間隔、各応答の直前で状態を保存します。スナップショットを選択的かつ段階的に保持することで、モデルにより多くのメモリを残します。
はじめに
OllamaのMLXエンジンでモデルを実行するには、最新バージョンのOllamaをダウンロードし、次のコマンドを実行します:
ollama run gemma4:12b-mlx
コーディングエージェントで使用する場合は、ollama launchを使用します:
ollama launch pi --model gemma4:12b-mlx