Z.ai发布GLM-5.3:不重训基础模型,复杂编码与长时任务能力大幅提升
Z.ai发布GLM-5.3,基于GLM-5.2的743B基座并通过扩展后训练显著提升编码与安全能力。Terminal-Bench 3.0从4.6升至28.3,CyberGym达84.5%。权重约两周后公开。
Z.ai今日发布GLM-5.3。该模型沿用GLM-5.2的743B参数基础模型,未对基座进行重新训练。所有性能提升均来自扩展的后训练阶段:更丰富的任务环境、更多样的环境类型以及更长的训练时间。测试结果显示,编码能力在长周期基准上提升最为显著,Terminal-Bench 3.0得分从4.6跃升至28.3。安全领域的能力增长超出预期,CyberGym达到84.5%。
部署方面,GLM-5.3已通过Z.ai API、GLM Coding Plan和ZCode提供。权重尚未公开,预计将在发布约两周后完成安全评估与加固后发布。初创公司和中型工程团队可立即通过Coding Plan或API接入;受数据驻留或供应商审查规则约束的企业建议等待权重发布。安全厂商和MSSP既能获得最大收益,也面临最大的政策风险。
编码评测方面,相较于GLM-5.2,Terminal-Bench 3.0从4.6升至28.3,DeepSWE v1.1从46.2升至66.9,Agents' Last Exam (CLI)从23.8升至28.5。在覆盖44个职业的GDPval-AA v2上,GLM-5.3得分为1769。Z.ai内部Code Bench显示相对GLM-5.2提升50%,在约5万输出token/任务下得分31.4%;相比之下Claude Opus 4.8在12万token下为29.5%,Claude Fable 5以最高努力度仍以39.5%领先。Z.ai认为私有基准可降低污染风险。在公开测试集上,GLM-5.3在若干高难度编码评估中仍落后于GPT-5.6 Sol和Fable 5。所有数据均为厂商报告,并附有说明。
网络安全方面,Z.ai表示这一结果并非计划内。团队加入漏洞发现数据原本期望提升单漏洞推理能力,但随着训练规模扩大,能力持续叠加,模型开始形成跨完整利用链的连贯计划。CyberGym从77.2%升至84.5%,超过Mythos 5的83.8%和GPT-5.6 Sol的83.6%。ExploitBench从24.4%升至54.4%,但Mythos 5仍以78.0%领先。在ExploitGym上,GLM-5.3两小时完成105项任务,六小时完成130项,而GLM-5.2分别仅为29和39项,Mythos 5则完成181和247项。整体趋势一致:离利用链越深,相对GLM-5.2的提升越大,与闭源前沿模型的差距也在拉大。
关键要点:GLM-5.3复用GLM-5.2基座,所有增益来自后训练;编码与安全基准大幅提升;权重约两周后发布。