本文にスキップ
AI News HubLIVE
サイト内リライト2 分で読了

OllamaがApple Silicon上でMLXを搭載し、プレビュー版を公開

記事の要約

OllamaはAppleのMLXフレームワークをベースにしたプレビュー版を発表。Apple Silicon上で大幅なパフォーマンス向上、NVFP4サポート、キャッシュ改善を実現。

ソースOllama Blog
OllamaがApple Silicon上でMLXを搭載し、プレビュー版を公開
誤りを報告

訂正窓口はまだ利用できません。記事情報をコピーして保存できます。

訂正案内
本文へ

Ollamaは本日、AppleのMLXフレームワークをベースにしたプレビュー版をリリースし、Apple Siliconデバイス上での推論パフォーマンスを大幅に向上させました。このバージョンはMLXの統合メモリアーキテクチャを活用し、M5、M5 Pro、M5 Maxチップ上のGPUニューラルアクセラレータを最大限に活用することで、最初のトークン生成時間(TTFT)と生成速度(トークン/秒)を劇的に改善します。

公式テスト(2026年3月29日)によると、AlibabaのQwen3.5-35B-A3Bモデル(NVFP4量子化)を使用した場合、Ollama 0.19のプリフィル性能は1810トークン/秒(従来版は1154トークン/秒)、デコード性能は112トークン/秒(従来版は58トークン/秒)を達成しました。int4量子化を使用すると、プリフィル1851トークン/秒、デコード134トークン/秒まで向上します。

NVFP4形式のサポートも注目すべき点です。OllamaはNVIDIAのNVFP4形式を採用し、メモリ帯域幅とストレージ要件を削減しながらモデル精度を維持します。これにより、Ollamaユーザーはプロダクション環境と同じ推論結果を得られ、NVIDIAのモデルオプティマイザーで最適化されたモデルも実行可能になります。将来的には、研究やハードウェアパートナーとの協力に基づき、さらに多くの精度形式が追加される予定です。

キャッシュシステムも全面的に改良されました。会話間でのキャッシュ再利用によりメモリ使用量を削減し、プロンプト内のインテリジェントな位置にチェックポイントを設定して処理量を低減します。また、よりスマートな退避戦略により、古いブランチが削除されても共有プレフィックスが長く保持されます。これらの改善により、コーディングやエージェントタスクの効率が大幅に向上します。

Ollama 0.19プレビュー版はQwen3.5-35B-A3Bコーディングモデル向けにチューニングされており、32GB以上のユニファイドメモリを搭載したMacでの使用が推奨されます。Claude CodeやOpenClawなどのツールに対応し、コマンドラインでの対話も簡単に行えます。Ollamaチームは今後さらに多くのモデルをサポートする予定で、カスタムファインチューニングモデルの簡単なインポート機能も計画しています。

プロジェクトは、MLXコントリビューター、NVIDIAのNVFP4サポート、GGML/llama.cppコミュニティ、AlibabaのQwenチームのオープンソース貢献と協力に感謝の意を表しています。

要点と分析を開く

記事インテリジェンス

エンジニア上級

要点

  • Ollamaプレビュー版はMLXフレームワークを活用し、Apple Silicon上で最速のパフォーマンスを実現。
  • NVFP4形式をサポートし、高品質な推論とプロダクション環境との互換性を提供。
  • キャッシュシステムをアップグレードし、メモリ使用量削減、インテリジェントチェックポイント、スマートな退避を実現。
  • Qwen3.5-35B-A3Bモデル向けに最適化され、コーディングタスクに適している。

要点と分析は自動生成され、誤りを含む場合があります。原典をご確認ください。