Ollamaは本日、AppleのMLXフレームワークをベースにしたプレビュー版をリリースし、Apple Siliconデバイス上での推論パフォーマンスを大幅に向上させました。このバージョンはMLXの統合メモリアーキテクチャを活用し、M5、M5 Pro、M5 Maxチップ上のGPUニューラルアクセラレータを最大限に活用することで、最初のトークン生成時間(TTFT)と生成速度(トークン/秒)を劇的に改善します。
公式テスト(2026年3月29日)によると、AlibabaのQwen3.5-35B-A3Bモデル(NVFP4量子化)を使用した場合、Ollama 0.19のプリフィル性能は1810トークン/秒(従来版は1154トークン/秒)、デコード性能は112トークン/秒(従来版は58トークン/秒)を達成しました。int4量子化を使用すると、プリフィル1851トークン/秒、デコード134トークン/秒まで向上します。
NVFP4形式のサポートも注目すべき点です。OllamaはNVIDIAのNVFP4形式を採用し、メモリ帯域幅とストレージ要件を削減しながらモデル精度を維持します。これにより、Ollamaユーザーはプロダクション環境と同じ推論結果を得られ、NVIDIAのモデルオプティマイザーで最適化されたモデルも実行可能になります。将来的には、研究やハードウェアパートナーとの協力に基づき、さらに多くの精度形式が追加される予定です。
キャッシュシステムも全面的に改良されました。会話間でのキャッシュ再利用によりメモリ使用量を削減し、プロンプト内のインテリジェントな位置にチェックポイントを設定して処理量を低減します。また、よりスマートな退避戦略により、古いブランチが削除されても共有プレフィックスが長く保持されます。これらの改善により、コーディングやエージェントタスクの効率が大幅に向上します。
Ollama 0.19プレビュー版はQwen3.5-35B-A3Bコーディングモデル向けにチューニングされており、32GB以上のユニファイドメモリを搭載したMacでの使用が推奨されます。Claude CodeやOpenClawなどのツールに対応し、コマンドラインでの対話も簡単に行えます。Ollamaチームは今後さらに多くのモデルをサポートする予定で、カスタムファインチューニングモデルの簡単なインポート機能も計画しています。
プロジェクトは、MLXコントリビューター、NVIDIAのNVFP4サポート、GGML/llama.cppコミュニティ、AlibabaのQwenチームのオープンソース貢献と協力に感謝の意を表しています。