AI News HubLIVE
站內改寫2 分鐘閱讀

阿里新模型號稱筆記型電腦上可達到Opus 4.6級效能

阿里巴巴釋出了2.4萬億引數的Qwen3.8開放權重,但更引人注目的是同時推出的270億引數稠密版Qwen3.8 27B,採用Apache 2.0許可。該模型可本地執行,基準測試效能與Anthropic Opus 4.6 Max相當,部分測試甚至超越,並支援視覺能力。不過需注意基準測試與量化折損等問題。

來源The New Stack AI作者: Frederic Lardinois

阿里巴巴最近開放了其2.4萬億引數的Qwen3.8模型權重。這是一個規模龐大的模型,其基準測試成績使其能夠直接與美國實驗室的封閉前沿模型競爭。但更令人感興趣的是,上週五阿里巴巴還以Apache 2.0許可證釋出了Qwen 3.8的稠密270億引數版本。

這意味著你可以在一臺配置不錯的MacBook Pro或Mac Studio上本地執行該模型——而且這樣做可能是值得的,因為根據阿里巴巴的基準測試,該模型的效能與Anthropic的Opus 4.6在Max設定下的表現處於同一水平。在不少基準測試中,它甚至超越了Anthropic此前的旗艦模型,尤其是在某些計算機使用、程式設計和知識工作測試方面。那款旗艦模型在二月份釋出時曾是最先進的。

再加上該模型還具備視覺能力(包括影片),這使得它成為本地使用的有吸引力的選擇(前提是硬體足夠給力)。

需要注意的是,基準測試並不總能反映模型在現實世界中的表現,對於智慧體使用場景,執行環境和模型本身同樣重要。早期報告顯示,該模型有過度思考的傾向。此外,阿里巴巴的基準測試可能基於原始檢查點,而大多數本地使用者使用的是量化版本。量化雖然能讓模型在消費級硬體上執行,但總會帶來一定質量損失。

儘管如此,對於一個可以在本地執行的模型來說,這些結果依然令人印象深刻。

阿里巴巴指出,該模型顯著優於上一代Qwen 3.7-Plus,尤其在程式設計和知識工作任務上,一些效能提升相當驚人,例如DeepSWE智慧體編碼基準從14.2分躍升至42.2分。這仍然落後於當前前沿水平以及其他開放模型(如新發布的GLM-5.3),但即便是Google的中端Gemini 3.6 Flash在該測試中也只獲得了49%,而且你不太可能很快在筆記本上執行那個模型。

阿里巴巴還將該模型與Meta的Muse Glimmer-30B進行了對比,後者是最近釋出的同類規模模型。Qwen3.8-27B在阿里巴巴同時報告分數的所有測試中均領先。看來“Glimmer”(微光)這個名字取得很貼切。

至於執行Qwen 3.8 27B所需的硬體,速度是另一個問題。目前阿里巴巴尚未釋出更小的Qwen3.8 27B混合專家版本,這種版本每個token啟用的引數更少,執行速度會比稠密27B版本更快(例如之前對Qwen 3.6-35B就是這麼做的)。未量化的Qwen3.8-27B倉庫大小為55.6GB,還沒算上推理執行時和上下文快取。這不是大多數人會直接執行的版本。

對Mac使用者來說,好訊息是社群已經提供了面向Apple Silicon的MLX轉換版本。4-bit版本約16.1GB,8-bit版本約29.5GB。這意味著32GB統一記憶體的Mac可以在中等上下文長度下流暢執行4-bit版本。如果記憶體達到48GB或64GB,則有更多空間用於更高精度或更長的提示詞。

預設情況下,該模型支援262,000個token的上下文,並透過YaRN方法可擴充套件到100萬token(阿里巴巴將為其託管的生產版本進行擴充套件)。但這並不表示你在桌面端可以使用完整的上下文視窗,因為隨著提示詞增長,鍵值快取會佔用更多記憶體。