GLM-5.3:中国实验室如何紧跟前沿
Z.ai 发布 GLM-5.3,仅用约 7500 亿参数便在多个基准上匹敌甚至超越西方前沿模型。文章分析其成功并非靠蒸馏,而是后训练、发布速度与数据产业的综合优势,也讨论了网络安全风险与开放权重的影响。
今天,Z.ai 发布了 GLM-5.3,目前仅在编程套餐中提供,随后会进入 API,两周后将把权重开源到 Hugging Face。这个模型的表现相当亮眼,在多个基准上超过了 Moonshot AI 的 Kimi K3,在一些基准上甚至超越了 Claude Fable 5 或 GPT-5.6-Sol。更值得注意的是,它只有约 7500 亿参数,约为 Kimi K3 的三分之一,却已经站在智能体编码基准的前沿。Z.ai 在博客中直言:GLM-5.3 与 GLM-5.2 共用同一个基础模型,主要工作是在后训练阶段进行了大规模扩展。相比以预训练见长的 Kimi,Z.ai 的强项似乎是后训练。
对于中国实验室为何能如此紧跟前沿,最简单的解释并非蒸馏。Z.ai 的技术博客强调,他们使用了更多环境、更多样化的任务和更多计算资源来进行后训练。RL 环境、基础设施以及混合算法很难靠蒸馏获得。作者认为,最大的因素可能是发布周期:Z.ai 从模型完成到发布只需数天,而 OpenAI 和 Anthropic 往往要花数月做发布前测试。中国实验室利用这段时间差持续在基准上爬坡,这很可能是在前沿保持竞争力的最大原因。此外,Z.ai 确实比 OpenAI 或 Anthropic 更在意公开基准,因为这直接影响融资和团队士气。
不过,作者并不认为 GLM-5.3 是过度刷分的产物。所有实验室眼下都在面对扩展 RL 的粗糙边缘,Anthropic 的 Opus 5 和 Sonnet 5 虽然取得惊人基准分数,口碑却褒贬不一。GLM-5.3 可能比 Claude Fable 或 GPT Sol 更窄,且旗舰 GLM 模型一直没有视觉能力,文本专用有助于提升基准分数,但同时也说明它面向的是更聚焦的用例。据报道 Z.ai 已实现约 10 亿美元的年经常性收入,主要来自强劲的本地部署业务。
文章还提到,中国的 RL 数据产业正在起飞,美国数据公司向中国模型实验室出售数据或 RL 环境,中国实验室可能更快发布下游模型。Z.ai 与清华大学关系密切,拥有大量顶尖计算机科学家,这也是其成功的关键之一。最后,Z.ai 承认 GLM-5.3 在网络安全任务上很强,并存在双重用途风险,因此采取分阶段发布:先由安全合作伙伴在受控环境中评估,再开放 API,最后发布完整权重。但作者认为,当真正开放权重到来时,这类安全措施能起的作用有限,需要政府或行业联盟提供工业规模的指导,才能应对能力扩散。