加密新闻

14.08.2026
07:47

Z.ai发布了GLM-5.3:编程与网络安全领域的突破

中国初创公司Z.ai发布了升级版语言模型GLM-5.3,这标志着其在编程、智能体场景和漏洞搜索领域迈出了重要一步。与之前的迭代不同,此次性能提升完全通过后训练实现,未改变基础架构。这是一种引人入胜的方法,表明现有模型的潜力远未耗尽。

在用于评估编程技能的内部基准测试Code Bench中,GLM-5.3相比前代提升了50%。然而,最令人印象深刻的成果体现在专项测试中。例如,在Terminal Bench 3.0中,新模型获得28.3分,而GLM-5.2仅为可怜的4.6分。在DeepSWE v1.1中,进步幅度为66.9对46.2,在Agents' Last Exam中则为28.5对23.8。

安全领域的表现尤其值得关注。在CyberGym测试中,模型达到了84.5%的成功率,而在ExploitBench中达到54.4%,是上一版本(24.4%)的两倍多。在两小时预算内,GLM-5.3完成了105项任务,而GLM-5.2仅能处理29项。当预算增加到六小时时,差距依然存在:分别为130项对39项任务。

真实测试与公开登记册

Z.ai还与多个中国安全团队合作,在真实代码库上进行了测试。经过验证和去重后,该系统在269个项目中发现了2436个漏洞,其中包括1097个中高严重性问题。仅公开披露了53项发现,其余2383项仍处于保密状态。值得注意的是,此类漏洞的平均“生命周期”估计为26.6年,而发现的最古老漏洞可追溯至1981年。

为了保持透明度,公司推出了Z.ai安全披露登记册——一个公开的登记系统,记录状态、受影响项目和严重性等级。与此同时,GLM-5.3已部署给GLM编程计划的订阅用户,成为智能体编程和长时任务的核心引擎。对旧模型的请求会自动路由到新版本。

模型的开源权重将在安全评估和额外加固后两周内开放。考虑到该工具的敏感性,这是一种合理的做法。

我的看法:GLM-5.3不仅仅是一次渐进式更新,更是对网络安全领域AI智能体领导地位的有力宣示。然而,需要提醒的是,7月份Anthropic曾指控Z.ai利用Claude和GPT的响应未经授权蒸馏GLM-5.2。鉴于ExploitBench上的如此大幅跃升,值得密切关注后续调查进展,尽管目前尚无违规证据。