本文にスキップ
AI News HubLIVE
サイト内リライト1 分で読了

GGUFによるパフォーマンス向上とモデルサポートの拡充

記事の要約

Ollama 0.30がリリースされ、llama.cppを通じてGGUFモデルの互換性とパフォーマンスが向上。Appleシリコン上のMLXエンジンを補完し、より多くのハードウェアでモデルを実行可能に。

ソースOllama Blog
GGUFによるパフォーマンス向上とモデルサポートの拡充
誤りを報告

訂正窓口はまだ利用できません。記事情報をコピーして保存できます。

訂正案内
本文へ

Ollama 0.30が正式にリリースされ、パフォーマンスの向上とGGUF形式のモデル互換性が実現しました。今回のアップデートでは、llama.cppの統合によりAppleシリコン上のMLXエンジンを補完し、より幅広いハードウェアでモデルを実行できるようになりました。

パフォーマンス面では、NVIDIA GPUで最大20%のスループット向上を達成。これはNVIDIAとllama.cppチームによる最適化の成果で、Gemma 4 26BモデルをRTX 5090上でQ4_K_M量子化を用いてテストしました。また、Vulkanがデフォルトで有効化され、AMDやIntelデバイスでもGPUアクセラレーションが利用可能に。ベンダー固有のライブラリをインストールすることなく、すぐにGPU上でモデルを実行できます。

対応モデルも拡大。LFM、Prismといったモデルファミリーや、Unslothが公開するファインチューンモデルを含むGGUFエコシステムとの互換性が向上しました。Hugging FaceからGGUFファイルをダウンロードし、Modelfileを作成して以下のコマンドで実行できます:

FROM ./my-model.Q4_K_M.gguf ollama create -f Modelfile my-model ollama run my-model

ツール呼び出しをサポートするモデルは、その機能をOllama上でもそのまま利用可能。Claude Code、Hermes Agent、OpenClawなどのコーディングエージェントと組み合わせて、ワンコマンドで使用できます:

ollama launch claude --model my-model

ツール呼び出しの対応状況は ollama show my-model で確認できます。

Ollamaチームは、llama.cppメンテナのGeorgi Gerganov氏、および各プラットフォームでのGGML最適化に協力いただいたNVIDIA、AMD、Qualcomm、Intelの各社に感謝の意を表します。フィードバックはDiscordまたは[email protected]まで。

要点と分析を開く

記事インテリジェンス

エンジニア上級

要点

  • NVIDIA GPUで最大20%のスループット向上
  • Vulkanをデフォルト有効化し、AMD/Intel GPUをサポート
  • LFM、Prism、Unslothなどの新モデルファミリーに対応
  • GGUFモデルを介したコーディングエージェント向けツール呼び出し

要点と分析は自動生成され、誤りを含む場合があります。原典をご確認ください。