Z.ai釋出GLM-5.3:不重訓基礎模型,複雜編碼與長時任務能力大幅提升
Z.ai釋出GLM-5.3,基於GLM-5.2的743B基座並透過擴充套件後訓練顯著提升編碼與安全能力。Terminal-Bench 3.0從4.6升至28.3,CyberGym達84.5%。權重約兩週後公開。
Z.ai今日釋出GLM-5.3。該模型沿用GLM-5.2的743B引數基礎模型,未對基座進行重新訓練。所有效能提升均來自擴充套件的後訓練階段:更豐富的任務環境、更多樣的環境型別以及更長的訓練時間。測試結果顯示,編碼能力在長週期基準上提升最為顯著,Terminal-Bench 3.0得分從4.6躍升至28.3。安全領域的能力增長超出預期,CyberGym達到84.5%。
部署方面,GLM-5.3已透過Z.ai API、GLM Coding Plan和ZCode提供。權重尚未公開,預計將在釋出約兩週後完成安全評估與加固後釋出。初創公司和中型工程團隊可立即透過Coding Plan或API接入;受資料駐留或供應商審查規則約束的企業建議等待權重發布。安全廠商和MSSP既能獲得最大收益,也面臨最大的政策風險。
編碼評測方面,相較於GLM-5.2,Terminal-Bench 3.0從4.6升至28.3,DeepSWE v1.1從46.2升至66.9,Agents' Last Exam (CLI)從23.8升至28.5。在覆蓋44個職業的GDPval-AA v2上,GLM-5.3得分為1769。Z.ai內部Code Bench顯示相對GLM-5.2提升50%,在約5萬輸出token/任務下得分31.4%;相比之下Claude Opus 4.8在12萬token下為29.5%,Claude Fable 5以最高努力度仍以39.5%領先。Z.ai認為私有基準可降低汙染風險。在公開測試集上,GLM-5.3在若干高難度編碼評估中仍落後於GPT-5.6 Sol和Fable 5。所有資料均為廠商報告,並附有說明。
網路安全方面,Z.ai表示這一結果並非計劃內。團隊加入漏洞發現資料原本期望提升單漏洞推理能力,但隨著訓練規模擴大,能力持續疊加,模型開始形成跨完整利用鏈的連貫計劃。CyberGym從77.2%升至84.5%,超過Mythos 5的83.8%和GPT-5.6 Sol的83.6%。ExploitBench從24.4%升至54.4%,但Mythos 5仍以78.0%領先。在ExploitGym上,GLM-5.3兩小時完成105項任務,六小時完成130項,而GLM-5.2分別僅為29和39項,Mythos 5則完成181和247項。整體趨勢一致:離利用鏈越深,相對GLM-5.2的提升越大,與閉源前沿模型的差距也在拉大。
關鍵要點:GLM-5.3複用GLM-5.2基座,所有增益來自後訓練;編碼與安全基準大幅提升;權重約兩週後釋出。