AI News HubLIVE
站內改寫2 分鐘閱讀

GLM-5.3:中國實驗室如何緊跟前沿

Z.ai 發佈 GLM-5.3,僅用約 7500 億參數便在多個基準上匹敵甚至超越西方前沿模型。文章分析其成功並非靠蒸餾,而是後訓練、發佈速度與數據產業的綜合優勢,也討論了網絡安全風險與開放權重的影響。

來源Interconnects (Nathan Lambert)作者: Nathan Lambert

今天,Z.ai 發佈了 GLM-5.3,目前僅在編程套餐中提供,隨後會進入 API,兩週後將把權重開源到 Hugging Face。這個模型的表現相當亮眼,在多個基準上超過了 Moonshot AI 的 Kimi K3,在一些基準上甚至超越了 Claude Fable 5 或 GPT-5.6-Sol。更值得注意的是,它只有約 7500 億參數,約為 Kimi K3 的三分之一,卻已經站在智能體編碼基準的前沿。Z.ai 在博客中直言:GLM-5.3 與 GLM-5.2 共用同一個基礎模型,主要工作是在後訓練階段進行了大規模擴展。相比以預訓練見長的 Kimi,Z.ai 的強項似乎是後訓練。

對於中國實驗室為何能如此緊跟前沿,最簡單的解釋並非蒸餾。Z.ai 的技術博客強調,他們使用了更多環境、更多樣化的任務和更多計算資源來進行後訓練。RL 環境、基礎設施以及混合算法很難靠蒸餾獲得。作者認為,最大的因素可能是發佈週期:Z.ai 從模型完成到發佈只需數天,而 OpenAI 和 Anthropic 往往要花數月做發佈前測試。中國實驗室利用這段時間差持續在基準上爬坡,這很可能是在前沿保持競爭力的最大原因。此外,Z.ai 確實比 OpenAI 或 Anthropic 更在意公開基準,因為這直接影響融資和團隊士氣。

不過,作者並不認為 GLM-5.3 是過度刷分的產物。所有實驗室眼下都在面對擴展 RL 的粗糙邊緣,Anthropic 的 Opus 5 和 Sonnet 5 雖然取得驚人基準分數,口碑卻褒貶不一。GLM-5.3 可能比 Claude Fable 或 GPT Sol 更窄,且旗艦 GLM 模型一直沒有視覺能力,文本專用有助於提升基準分數,但同時也説明它面向的是更聚焦的用例。據報道 Z.ai 已實現約 10 億美元的年經常性收入,主要來自強勁的本地部署業務。

文章還提到,中國的 RL 數據產業正在起飛,美國數據公司向中國模型實驗室出售數據或 RL 環境,中國實驗室可能更快發佈下游模型。Z.ai 與清華大學關係密切,擁有大量頂尖計算機科學家,這也是其成功的關鍵之一。最後,Z.ai 承認 GLM-5.3 在網絡安全任務上很強,並存在雙重用途風險,因此採取分階段發佈:先由安全合作伙伴在受控環境中評估,再開放 API,最後發佈完整權重。但作者認為,當真正開放權重到來時,這類安全措施能起的作用有限,需要政府或行業聯盟提供工業規模的指導,才能應對能力擴散。