阿里新模型号称笔记本电脑上可达到Opus 4.6级性能
阿里巴巴发布了2.4万亿参数的Qwen3.8开放权重,但更引人注目的是同时推出的270亿参数稠密版Qwen3.8 27B,采用Apache 2.0许可。该模型可本地运行,基准测试性能与Anthropic Opus 4.6 Max相当,部分测试甚至超越,并支持视觉能力。不过需注意基准测试与量化折损等问题。
阿里巴巴最近开放了其2.4万亿参数的Qwen3.8模型权重。这是一个规模庞大的模型,其基准测试成绩使其能够直接与美国实验室的封闭前沿模型竞争。但更令人感兴趣的是,上周五阿里巴巴还以Apache 2.0许可证发布了Qwen 3.8的稠密270亿参数版本。
这意味着你可以在一台配置不错的MacBook Pro或Mac Studio上本地运行该模型——而且这样做可能是值得的,因为根据阿里巴巴的基准测试,该模型的性能与Anthropic的Opus 4.6在Max设置下的表现处于同一水平。在不少基准测试中,它甚至超越了Anthropic此前的旗舰模型,尤其是在某些计算机使用、编程和知识工作测试方面。那款旗舰模型在二月份发布时曾是最先进的。
再加上该模型还具备视觉能力(包括视频),这使得它成为本地使用的有吸引力的选择(前提是硬件足够给力)。
需要注意的是,基准测试并不总能反映模型在现实世界中的表现,对于智能体使用场景,运行环境和模型本身同样重要。早期报告显示,该模型有过度思考的倾向。此外,阿里巴巴的基准测试可能基于原始检查点,而大多数本地用户使用的是量化版本。量化虽然能让模型在消费级硬件上运行,但总会带来一定质量损失。
尽管如此,对于一个可以在本地运行的模型来说,这些结果依然令人印象深刻。
阿里巴巴指出,该模型显著优于上一代Qwen 3.7-Plus,尤其在编程和知识工作任务上,一些性能提升相当惊人,例如DeepSWE智能体编码基准从14.2分跃升至42.2分。这仍然落后于当前前沿水平以及其他开放模型(如新发布的GLM-5.3),但即便是Google的中端Gemini 3.6 Flash在该测试中也只获得了49%,而且你不太可能很快在笔记本上运行那个模型。
阿里巴巴还将该模型与Meta的Muse Glimmer-30B进行了对比,后者是最近发布的同类规模模型。Qwen3.8-27B在阿里巴巴同时报告分数的所有测试中均领先。看来“Glimmer”(微光)这个名字取得很贴切。
至于运行Qwen 3.8 27B所需的硬件,速度是另一个问题。目前阿里巴巴尚未发布更小的Qwen3.8 27B混合专家版本,这种版本每个token激活的参数更少,运行速度会比稠密27B版本更快(例如之前对Qwen 3.6-35B就是这么做的)。未量化的Qwen3.8-27B仓库大小为55.6GB,还没算上推理运行时和上下文缓存。这不是大多数人会直接运行的版本。
对Mac用户来说,好消息是社区已经提供了面向Apple Silicon的MLX转换版本。4-bit版本约16.1GB,8-bit版本约29.5GB。这意味着32GB统一内存的Mac可以在中等上下文长度下流畅运行4-bit版本。如果内存达到48GB或64GB,则有更多空间用于更高精度或更长的提示词。
默认情况下,该模型支持262,000个token的上下文,并通过YaRN方法可扩展到100万token(阿里巴巴将为其托管的生产版本进行扩展)。但这并不表示你在桌面端可以使用完整的上下文窗口,因为随着提示词增长,键值缓存会占用更多内存。