Ollama 今日发布了基于 Apple MLX 框架的预览版,面向 Apple Silicon 设备提供更快的推理性能。该版本利用 MLX 的统一内存架构,在 M5、M5 Pro 和 M5 Max 芯片上充分发挥 GPU 神经加速器的优势,显著缩短首个令牌生成时间(TTFT)并提升生成速度(每秒令牌数)。
根据官方测试(2026年3月29日),使用阿里 Qwen3.5-35B-A3B 模型的 NVFP4 量化版本,Ollama 0.19 的预填性能达到 1810 token/s(对比此前版本 1154 token/s),解码性能达到 112 token/s(对比 58 token/s)。若使用 int4 量化,性能可进一步提升至 1851 token/s 预填和 134 token/s 解码。
NVFP4 格式支持是本次更新的另一亮点。Ollama 采用 NVIDIA 的 NVFP4 格式,在降低内存带宽和存储需求的同时保持模型精度。这使得 Ollama 用户能够与生产环境中的推理结果保持一致,并兼容 NVIDIA 模型优化器优化的模型。未来还将根据研究与合作需求引入更多精度格式。
缓存系统得到全面升级:跨对话复用缓存以降低内存占用,并在提示词中智能设置检查点以减少处理量,同时采用更智能的驱逐策略,使共享前缀在分支丢弃后仍能保持更长时间。这些改进使得编码和智能体任务更加高效。
Ollama 0.19 预览版已针对 Qwen3.5-35B-A3B 编码模型进行调优,推荐在配备 32GB 以上统一内存的 Mac 上使用。支持 Claude Code 和 OpenClaw 等工具,同时也提供简单的命令行交互方式。Ollama 团队正积极支持更多未来模型,并计划为自定义微调模型提供更简便的导入方式。
项目团队感谢 MLX 贡献者、NVIDIA 的 NVFP4 支持、GGML/llama.cpp 社区以及阿里通义千问团队的开源贡献与合作。