Ollama 今日釋出了基於 Apple MLX 框架的預覽版,面向 Apple Silicon 裝置提供更快的推理效能。該版本利用 MLX 的統一記憶體架構,在 M5、M5 Pro 和 M5 Max 晶片上充分發揮 GPU 神經加速器的優勢,顯著縮短首個令牌生成時間(TTFT)並提升生成速度(每秒令牌數)。
根據官方測試(2026年3月29日),使用阿里 Qwen3.5-35B-A3B 模型的 NVFP4 量化版本,Ollama 0.19 的預填效能達到 1810 token/s(對比此前版本 1154 token/s),解碼效能達到 112 token/s(對比 58 token/s)。若使用 int4 量化,效能可進一步提升至 1851 token/s 預填和 134 token/s 解碼。
NVFP4 格式支援是本次更新的另一亮點。Ollama 採用 NVIDIA 的 NVFP4 格式,在降低記憶體頻寬和儲存需求的同時保持模型精度。這使得 Ollama 使用者能夠與生產環境中的推理結果保持一致,併相容 NVIDIA 模型最佳化器最佳化的模型。未來還將根據研究與合作需求引入更多精度格式。
快取系統得到全面升級:跨對話複用快取以降低記憶體佔用,並在提示詞中智慧設定檢查點以減少處理量,同時採用更智慧的驅逐策略,使共享字首在分支丟棄後仍能保持更長時間。這些改進使得編碼和智慧體任務更加高效。
Ollama 0.19 預覽版已針對 Qwen3.5-35B-A3B 編碼模型進行調優,推薦在配備 32GB 以上統一記憶體的 Mac 上使用。支援 Claude Code 和 OpenClaw 等工具,同時也提供簡單的命令列互動方式。Ollama 團隊正積極支援更多未來模型,並計劃為自定義微調模型提供更簡便的匯入方式。
專案團隊感謝 MLX 貢獻者、NVIDIA 的 NVFP4 支援、GGML/llama.cpp 社群以及阿里通義千問團隊的開源貢獻與合作。