AI News HubLIVE
站內改寫3 分鐘閱讀

“僅次於Fable 5”:阿里巴巴發佈Qwen3.8,但未提供任何真實數據

阿里巴巴宣佈推出其最新大語言模型Qwen3.8,聲稱僅次於Anthropic的Fable 5,但未提供任何基準測試或模型卡。此舉發生在競爭對手月之暗面發佈Kimi K3並附有詳細技術細節之後。阿里巴巴的聲明缺乏透明度,引發對其發佈時機和動機的質疑。

來源The New Stack AI作者: Paul Sawers

阿里巴巴於週日發佈了其最新的大語言模型Qwen3.8,並宣稱該模型“僅次於Anthropic的Fable 5”,是當前最強大的模型之一。然而,該公司並未提供模型卡、基準測試或其他有意義的數據點來支持這一説法。

值得注意的是,這一公告發布僅幾天前,中國AI競爭對手月之暗面推出了Kimi K3,該模型在Arena的編碼排行榜上名列前茅,並在內部基準測試中與Anthropic和OpenAI的系統相媲美,獲得了BBC、彭博社等主流媒體的廣泛報道。月之暗面雖然尚未發佈K3的權重,但已公佈了一份相當詳盡的技術分解,包括與其他領先系統的完整基準測試表、架構細節和定價,並計劃於7月27日開源。

相比之下,阿里巴巴主要依靠一條X帖文來宣佈其大膽聲明。該帖文中還包含一些語法錯誤,例如將“compatible”與“comparable”混淆。雖然這本身並不重要,但這類細節可能無法讓人們對這款旨在成為前沿競爭者的模型建立信心。

開源權重因素

今年,對開源AI的需求快速增長。分析師和基礎設施供應商認為,開源模型與封閉前沿模型的差距已縮小至僅四個月,且價格僅為後者的一小部分。價格差距正在改變企業購買AI的方式。6月,The New Stack報道稱,AI代理初創公司Lindy將全部生產流量從Anthropic的模型轉移到DeepSeek v4,其CEO表示此舉將為公司節省數百萬美元。供應商鎖定也日益令人擔憂,許多人警告不要深度依賴單一專有模型堆棧。

Qwen一直是這一轉變的主要受益者。基礎設施提供商Runpod的平台數據顯示,Qwen已超越Meta的Llama,成為其用户中部署最多的開源LLM。然而,儘管Qwen憑藉其開源發佈建立了聲譽,但其最近兩款旗艦模型打破了這一模式。4月推出的Qwen3.6-Max-Preview是Qwen歷史上首款僅提供API、未發佈權重的旗艦產品。5月發佈的Qwen3.7-Max同樣閉源,沒有本地可運行版本,也未確認發佈日期。

隨着Qwen3.8的推出,阿里巴巴似乎迴歸初心,確認將發佈開源權重。然而,這次的主要問題是發佈時間——以及公告本身的時機是否更多與競爭對手有關,而非真正的開放。

“檢查點差距”

私募股權公司Fortino Capital的AI運營合夥人、前Hugging Face和AWS AI佈道師Julien Simon認為,真正的故事在於他所謂的“檢查點差距”——即前沿聲明與實際可驗證的產物之間的時間窗口。他指出,Kimi K3的發佈窗口雖然“激進但有紀律”:提供了基準測試表、定價和確切的7月27日權重發布日期。Simon寫道:“該發佈中的每一項聲明都可以對照日曆進行評分。”

相反,Qwen3.8打開了同樣的窗口,但沒有任何紀律:沒有基準測試表、沒有定價、沒有日期——只有“即將開源”。無日期的窗口讓供應商可以按自己的時間表行使選擇權,同時“在此期間收集開源敍事”。

兩種模型在某種程度上都來自同一家公司。阿里巴巴截至2024年是月之暗面最大的股東,投入約8億美元獲得約36%的股份——隨着月之暗面的融資和估值飆升,這一比例可能已被稀釋。僅Kimi K3的發佈據報就在幾天內抹去了全球半導體超過3萬億美元的價值。而就在幾天後,阿里巴巴宣佈了一個略小的模型(2.4T參數對比2.8T),聲稱排名略好,並附帶了同樣的開源語言——只是缺少關鍵細節。

Simon寫道:“言辭與數據之間的差距越大,公告本身就越成為產品。”顯而易見的問題是,一家公司為何要與自己的投資競爭。Simon的回答在於,真正的基準測試表會迫使阿里巴巴透露什麼。他認為,足以擊敗Kimi K3的數據會使其在月之暗面的持股看起來不如自研模型,而月之暗面正計劃進入公開市場。數據不足則會讓“僅次於Fable 5”的頭銜拱手讓人。不提供可驗證的信息則避免了這兩種結果——Qwen可以在頭條新聞和企業對話中聲稱這一地位,而無需與K3放在一起接受檢驗。

簡而言之,公告本身很可能從來不是關於模型本身,而是關於將自己插入到一個備受關注的競爭對手的討論中。

一些初步嘗試獨立基準測試Qwen3.8的嘗試已經出現。週日,Trilogy公司AI卓越中心副總裁Leonardo Gonzalez在匹配任務上對Qwen3.8的託管預覽版和Kimi K3進行了對比測試。但這只是單一測試,由一位評審員評分,針對的是阿里巴巴自己表示在正式發佈前會不斷變化的預覽版。這遠非阿里巴巴尚未發佈的基準測試表的替代品。Gonzalez承認:“對於2.4T模型,缺失的架構細節很重要。”

目前,Qwen3.8仍處於起點:一個針對強大的Anthropic的精煉頭條聲明,僅此而已。