跳到主要內容
AI News HubLIVE
站內改寫1 分鐘閱讀

Ollama 在 Apple Silicon 上由 MLX 驅動,現提供預覽版

文章摘要

Ollama 宣佈推出基於 Apple MLX 框架的預覽版,針對 Apple Silicon 性能大幅優化,支持 NVFP4 精度和智能緩存,顯著提升預填和解碼速度。

Ollama 在 Apple Silicon 上由 MLX 驅動,現提供預覽版
報告錯誤

更正渠道尚未開通,可先複製下方文章資訊留存。

查看更正說明
直接讀正文

Ollama 今日發佈了基於 Apple MLX 框架的預覽版,面向 Apple Silicon 設備提供更快的推理性能。該版本利用 MLX 的統一內存架構,在 M5、M5 Pro 和 M5 Max 芯片上充分發揮 GPU 神經加速器的優勢,顯著縮短首個令牌生成時間(TTFT)並提升生成速度(每秒令牌數)。

根據官方測試(2026年3月29日),使用阿里 Qwen3.5-35B-A3B 模型的 NVFP4 量化版本,Ollama 0.19 的預填性能達到 1810 token/s(對比此前版本 1154 token/s),解碼性能達到 112 token/s(對比 58 token/s)。若使用 int4 量化,性能可進一步提升至 1851 token/s 預填和 134 token/s 解碼。

NVFP4 格式支持是本次更新的另一亮點。Ollama 採用 NVIDIA 的 NVFP4 格式,在降低內存帶寬和存儲需求的同時保持模型精度。這使得 Ollama 用户能夠與生產環境中的推理結果保持一致,併兼容 NVIDIA 模型優化器優化的模型。未來還將根據研究與合作需求引入更多精度格式。

緩存系統得到全面升級:跨對話複用緩存以降低內存佔用,並在提示詞中智能設置檢查點以減少處理量,同時採用更智能的驅逐策略,使共享前綴在分支丟棄後仍能保持更長時間。這些改進使得編碼和智能體任務更加高效。

Ollama 0.19 預覽版已針對 Qwen3.5-35B-A3B 編碼模型進行調優,推薦在配備 32GB 以上統一內存的 Mac 上使用。支持 Claude Code 和 OpenClaw 等工具,同時也提供簡單的命令行交互方式。Ollama 團隊正積極支持更多未來模型,並計劃為自定義微調模型提供更簡便的導入方式。

項目團隊感謝 MLX 貢獻者、NVIDIA 的 NVFP4 支持、GGML/llama.cpp 社區以及阿里通義千問團隊的開源貢獻與合作。

展開要點與分析

文章情報

工程師進階

要點

  • Ollama 預覽版利用 MLX 框架,在 Apple Silicon 上實現最快速度。
  • 支持 NVFP4 格式,推理質量提升且兼容生產環境。
  • 緩存系統升級:降低內存佔用、智能檢查點和更智能的驅逐策略。
  • 針對 Qwen3.5-35B-A3B 模型優化,適用於編碼任務。

要點與分析由自動化流程生成,可能有誤,請結合原始來源核實。