AI News HubLIVE
站內改寫2 分鐘閱讀

中國低價Z.ai模型暴露程式設計師昂貴習慣

Z.ai的GLM 5.2模型以低價和開放權重挑戰美國前沿AI模型,但許多程式設計師仍習慣使用昂貴模型,忽略成本。該模型在基準測試中接近Claude Opus 4.8,但實際使用效果參差不齊。

來源IEEE Spectrum AI作者: Matthew S. Smith

Z.ai是一家位於北京的人工智慧實驗室,其在2025年6月16日釋出的GLM 5.2模型正在改變程式設計師使用AI編碼助手的成本觀念。該模型擁有7530億引數,但每次推理僅啟用400億引數,這種最佳化大大提升了響應速度。更關鍵的是,GLM 5.2的API定價為每百萬輸出令牌4.40美元,僅為Anthropic Opus 4.8的五分之一,更只有Anthropic Fable編碼模型的十分之一。而且,由於採用MIT開源許可,任何組織都可以免費下載並自託管該模型。

然而,許多軟體工程師並未充分意識到AI編碼的總成本。Together AI的AI工程師Zain Hasan指出,大多數公司仍在摸索這項技術,缺乏明確的令牌預算。當成本由公司承擔時,工程師們傾向於選擇最強大的模型,而忽略費用。這種“不計代價”的習慣,加上寬鬆的令牌預算,反而成為美國前沿AI實驗室最寬的護城河。

GLM 5.2的釋出加劇了人們對美國AI公司可能失去競爭優勢的擔憂。在代理編碼基準測試如FrontierSWE和PostTrainBench上,GLM 5.2幾乎與Opus 4.8持平。網路安全研究人員還發現該模型在網路安全基準中表現出色,引發其與Anthropic Mythos的比較。根據斯坦福AI指數,2025年中國公司生產的“知名”AI模型數量已超過美國的一半,而2020年僅為五分之一。

不過,Z.ai釋出的研究報告顯示,GLM 5.2在基準測試中實際上落後於Opus 4.8和OpenAI的GPT-5.5。例如,在困難的SWE-Marathon基準中,GLM 5.2僅完成13%的任務,而Opus 4.8的成績翻倍。Opus 4.8在NL2Repo、DeepSWE和Tool-Decathlon等編碼基準中也領先10%或更多。

程式設計師對GLM 5.2的實際體驗各異。Zain Hasan表示,之前開源模型在5到15次互動後就會失去連貫性,而GLM 5.2可以維持數小時的連貫思維。MetaRouter的首席軟體工程師David Nix將其用於前端開發,並認為它“非常接近”Claude Opus和GPT-5.5,已永久加入他的工作流,每天處理10%到20%的編碼任務。Kacper Michalik也用它成功建立了網頁表單。

但並非所有反饋都是正面的。印度Indhic AI的Sai Kiran Myadaram發現GLM 5.2的每週配額在兩到三天內耗盡,而且模型存在幻覺和過度規劃問題,甚至破壞了程式碼庫。他最終切換回OpenAI的Codex。Michalik使用免費計劃時偶爾遇到速率限制,但模型質量尚可。

總體來看,GLM 5.2以低價和開放權重提供了可觀的效能,尤其適合前端開發和長時推理任務,但速率限制和幻覺問題仍需注意。對於關注資料安全的公司,自託管選項是一個重要優勢。