阿里新模型號稱筆記本電腦上可達到Opus 4.6級性能
阿里巴巴發佈了2.4萬億參數的Qwen3.8開放權重,但更引人注目的是同時推出的270億參數稠密版Qwen3.8 27B,採用Apache 2.0許可。該模型可本地運行,基準測試性能與Anthropic Opus 4.6 Max相當,部分測試甚至超越,並支持視覺能力。不過需注意基準測試與量化折損等問題。
阿里巴巴最近開放了其2.4萬億參數的Qwen3.8模型權重。這是一個規模龐大的模型,其基準測試成績使其能夠直接與美國實驗室的封閉前沿模型競爭。但更令人感興趣的是,上週五阿里巴巴還以Apache 2.0許可證發佈了Qwen 3.8的稠密270億參數版本。
這意味着你可以在一台配置不錯的MacBook Pro或Mac Studio上本地運行該模型——而且這樣做可能是值得的,因為根據阿里巴巴的基準測試,該模型的性能與Anthropic的Opus 4.6在Max設置下的表現處於同一水平。在不少基準測試中,它甚至超越了Anthropic此前的旗艦模型,尤其是在某些計算機使用、編程和知識工作測試方面。那款旗艦模型在二月份發佈時曾是最先進的。
再加上該模型還具備視覺能力(包括視頻),這使得它成為本地使用的有吸引力的選擇(前提是硬件足夠給力)。
需要注意的是,基準測試並不總能反映模型在現實世界中的表現,對於智能體使用場景,運行環境和模型本身同樣重要。早期報告顯示,該模型有過度思考的傾向。此外,阿里巴巴的基準測試可能基於原始檢查點,而大多數本地用户使用的是量化版本。量化雖然能讓模型在消費級硬件上運行,但總會帶來一定質量損失。
儘管如此,對於一個可以在本地運行的模型來説,這些結果依然令人印象深刻。
阿里巴巴指出,該模型顯著優於上一代Qwen 3.7-Plus,尤其在編程和知識工作任務上,一些性能提升相當驚人,例如DeepSWE智能體編碼基準從14.2分躍升至42.2分。這仍然落後於當前前沿水平以及其他開放模型(如新發布的GLM-5.3),但即便是Google的中端Gemini 3.6 Flash在該測試中也只獲得了49%,而且你不太可能很快在筆記本上運行那個模型。
阿里巴巴還將該模型與Meta的Muse Glimmer-30B進行了對比,後者是最近發佈的同類規模模型。Qwen3.8-27B在阿里巴巴同時報告分數的所有測試中均領先。看來“Glimmer”(微光)這個名字取得很貼切。
至於運行Qwen 3.8 27B所需的硬件,速度是另一個問題。目前阿里巴巴尚未發佈更小的Qwen3.8 27B混合專家版本,這種版本每個token激活的參數更少,運行速度會比稠密27B版本更快(例如之前對Qwen 3.6-35B就是這麼做的)。未量化的Qwen3.8-27B倉庫大小為55.6GB,還沒算上推理運行時和上下文緩存。這不是大多數人會直接運行的版本。
對Mac用户來説,好消息是社區已經提供了面向Apple Silicon的MLX轉換版本。4-bit版本約16.1GB,8-bit版本約29.5GB。這意味着32GB統一內存的Mac可以在中等上下文長度下流暢運行4-bit版本。如果內存達到48GB或64GB,則有更多空間用於更高精度或更長的提示詞。
默認情況下,該模型支持262,000個token的上下文,並通過YaRN方法可擴展到100萬token(阿里巴巴將為其託管的生產版本進行擴展)。但這並不表示你在桌面端可以使用完整的上下文窗口,因為隨着提示詞增長,鍵值緩存會佔用更多內存。