AI News HubLIVE
站内改写2 分钟阅读

中国低价Z.ai模型暴露程序员昂贵习惯

Z.ai的GLM 5.2模型以低价和开放权重挑战美国前沿AI模型,但许多程序员仍习惯使用昂贵模型,忽略成本。该模型在基准测试中接近Claude Opus 4.8,但实际使用效果参差不齐。

来源IEEE Spectrum AI作者: Matthew S. Smith

Z.ai是一家位于北京的人工智能实验室,其在2025年6月16日发布的GLM 5.2模型正在改变程序员使用AI编码助手的成本观念。该模型拥有7530亿参数,但每次推理仅激活400亿参数,这种优化大大提升了响应速度。更关键的是,GLM 5.2的API定价为每百万输出令牌4.40美元,仅为Anthropic Opus 4.8的五分之一,更只有Anthropic Fable编码模型的十分之一。而且,由于采用MIT开源许可,任何组织都可以免费下载并自托管该模型。

然而,许多软件工程师并未充分意识到AI编码的总成本。Together AI的AI工程师Zain Hasan指出,大多数公司仍在摸索这项技术,缺乏明确的令牌预算。当成本由公司承担时,工程师们倾向于选择最强大的模型,而忽略费用。这种“不计代价”的习惯,加上宽松的令牌预算,反而成为美国前沿AI实验室最宽的护城河。

GLM 5.2的发布加剧了人们对美国AI公司可能失去竞争优势的担忧。在代理编码基准测试如FrontierSWE和PostTrainBench上,GLM 5.2几乎与Opus 4.8持平。网络安全研究人员还发现该模型在网络安全基准中表现出色,引发其与Anthropic Mythos的比较。根据斯坦福AI指数,2025年中国公司生产的“知名”AI模型数量已超过美国的一半,而2020年仅为五分之一。

不过,Z.ai发布的研究报告显示,GLM 5.2在基准测试中实际上落后于Opus 4.8和OpenAI的GPT-5.5。例如,在困难的SWE-Marathon基准中,GLM 5.2仅完成13%的任务,而Opus 4.8的成绩翻倍。Opus 4.8在NL2Repo、DeepSWE和Tool-Decathlon等编码基准中也领先10%或更多。

程序员对GLM 5.2的实际体验各异。Zain Hasan表示,之前开源模型在5到15次交互后就会失去连贯性,而GLM 5.2可以维持数小时的连贯思维。MetaRouter的首席软件工程师David Nix将其用于前端开发,并认为它“非常接近”Claude Opus和GPT-5.5,已永久加入他的工作流,每天处理10%到20%的编码任务。Kacper Michalik也用它成功创建了网页表单。

但并非所有反馈都是正面的。印度Indhic AI的Sai Kiran Myadaram发现GLM 5.2的每周配额在两到三天内耗尽,而且模型存在幻觉和过度规划问题,甚至破坏了代码库。他最终切换回OpenAI的Codex。Michalik使用免费计划时偶尔遇到速率限制,但模型质量尚可。

总体来看,GLM 5.2以低价和开放权重提供了可观的性能,尤其适合前端开发和长时推理任务,但速率限制和幻觉问题仍需注意。对于关注数据安全的公司,自托管选项是一个重要优势。