Ollama 今日發佈了基於 Apple MLX 框架的預覽版,面向 Apple Silicon 設備提供更快的推理性能。該版本利用 MLX 的統一內存架構,在 M5、M5 Pro 和 M5 Max 芯片上充分發揮 GPU 神經加速器的優勢,顯著縮短首個令牌生成時間(TTFT)並提升生成速度(每秒令牌數)。
根據官方測試(2026年3月29日),使用阿里 Qwen3.5-35B-A3B 模型的 NVFP4 量化版本,Ollama 0.19 的預填性能達到 1810 token/s(對比此前版本 1154 token/s),解碼性能達到 112 token/s(對比 58 token/s)。若使用 int4 量化,性能可進一步提升至 1851 token/s 預填和 134 token/s 解碼。
NVFP4 格式支持是本次更新的另一亮點。Ollama 採用 NVIDIA 的 NVFP4 格式,在降低內存帶寬和存儲需求的同時保持模型精度。這使得 Ollama 用户能夠與生產環境中的推理結果保持一致,併兼容 NVIDIA 模型優化器優化的模型。未來還將根據研究與合作需求引入更多精度格式。
緩存系統得到全面升級:跨對話複用緩存以降低內存佔用,並在提示詞中智能設置檢查點以減少處理量,同時採用更智能的驅逐策略,使共享前綴在分支丟棄後仍能保持更長時間。這些改進使得編碼和智能體任務更加高效。
Ollama 0.19 預覽版已針對 Qwen3.5-35B-A3B 編碼模型進行調優,推薦在配備 32GB 以上統一內存的 Mac 上使用。支持 Claude Code 和 OpenClaw 等工具,同時也提供簡單的命令行交互方式。Ollama 團隊正積極支持更多未來模型,並計劃為自定義微調模型提供更簡便的導入方式。
項目團隊感謝 MLX 貢獻者、NVIDIA 的 NVFP4 支持、GGML/llama.cpp 社區以及阿里通義千問團隊的開源貢獻與合作。