跳到主要内容
AI News HubLIVE
站内改写1 分钟阅读

Ollama 在 Apple Silicon 上由 MLX 驱动,现提供预览版

文章摘要

Ollama 宣布推出基于 Apple MLX 框架的预览版,针对 Apple Silicon 性能大幅优化,支持 NVFP4 精度和智能缓存,显著提升预填和解码速度。

Ollama 在 Apple Silicon 上由 MLX 驱动,现提供预览版
报告错误

纠错通道尚未开通,可先复制下方文章信息留存。

查看更正说明
直接读正文

Ollama 今日发布了基于 Apple MLX 框架的预览版,面向 Apple Silicon 设备提供更快的推理性能。该版本利用 MLX 的统一内存架构,在 M5、M5 Pro 和 M5 Max 芯片上充分发挥 GPU 神经加速器的优势,显著缩短首个令牌生成时间(TTFT)并提升生成速度(每秒令牌数)。

根据官方测试(2026年3月29日),使用阿里 Qwen3.5-35B-A3B 模型的 NVFP4 量化版本,Ollama 0.19 的预填性能达到 1810 token/s(对比此前版本 1154 token/s),解码性能达到 112 token/s(对比 58 token/s)。若使用 int4 量化,性能可进一步提升至 1851 token/s 预填和 134 token/s 解码。

NVFP4 格式支持是本次更新的另一亮点。Ollama 采用 NVIDIA 的 NVFP4 格式,在降低内存带宽和存储需求的同时保持模型精度。这使得 Ollama 用户能够与生产环境中的推理结果保持一致,并兼容 NVIDIA 模型优化器优化的模型。未来还将根据研究与合作需求引入更多精度格式。

缓存系统得到全面升级:跨对话复用缓存以降低内存占用,并在提示词中智能设置检查点以减少处理量,同时采用更智能的驱逐策略,使共享前缀在分支丢弃后仍能保持更长时间。这些改进使得编码和智能体任务更加高效。

Ollama 0.19 预览版已针对 Qwen3.5-35B-A3B 编码模型进行调优,推荐在配备 32GB 以上统一内存的 Mac 上使用。支持 Claude Code 和 OpenClaw 等工具,同时也提供简单的命令行交互方式。Ollama 团队正积极支持更多未来模型,并计划为自定义微调模型提供更简便的导入方式。

项目团队感谢 MLX 贡献者、NVIDIA 的 NVFP4 支持、GGML/llama.cpp 社区以及阿里通义千问团队的开源贡献与合作。

展开要点与分析

文章情报

工程师进阶

要点

  • Ollama 预览版利用 MLX 框架,在 Apple Silicon 上实现最快速度。
  • 支持 NVFP4 格式,推理质量提升且兼容生产环境。
  • 缓存系统升级:降低内存占用、智能检查点和更智能的驱逐策略。
  • 针对 Qwen3.5-35B-A3B 模型优化,适用于编码任务。

要点与分析由自动化流程生成,可能有误,请结合原始来源核实。