Z.ai发布GLM-5.3:编码与网络安全领域的突破

中国初创公司Z.ai正式发布了语言模型GLM-5.3,重点聚焦于编程、智能体场景和漏洞搜索的显著改进。此次更新被定位为对软件开发与网络安全领域日益增长的AI系统需求的回应。
关键改进与基准测试
Z.ai强调,性能提升完全通过后训练实现,未改变基础架构,这使该版本区别于以往的迭代。在内部Code Bench测试中,新模型相比GLM-5.2提升了50%,表明算法优化力度显著。
在发布表格中,Z.ai列出了多项专业测试的亮眼结果:
- Terminal Bench 3.0:28.3分,对比GLM-5.2的4.6分——增长近六倍。
- DeepSWE v1.1:66.9对比46.2——开发任务解决能力大幅跃升。
- Agents' Last Exam:28.5对比23.8——智能体能力提升。
- CyberGym:84.5%对比77.2%——网络环境中的效率提高。
- ExploitBench:54.4%对比24.4%——漏洞利用搜索成绩翻倍。
尤其突出的是ExploitGym:模型在两小时预算内完成了105项任务,而前代仅完成29项;在六小时预算下则达到130项对比39项。这不仅展示了速度,也体现了分析的深度。
实际应用与安全
Z.ai还与中国安全团队合作,在真实代码库上进行了测试。经过验证和去重后,系统在269个项目中发现了2436个漏洞,其中包括1097个中高严重性问题。仅公开披露了53项发现,其余2383项仍处于保密状态。这些漏洞的平均“寿命”估计为26.6年,最古老的可以追溯到1981年——这凸显了遗留代码问题的规模。
为保持透明度,Z.ai推出了Z.ai安全披露台账——一个公开的注册表,用于跟踪状态、受影响项目和发现的严重性。这是行业中的重要一步,因为该领域往往缺乏开放性。
产品集成
GLM-5.3已部署给GLM Coding Plan订阅用户,成为智能体编程和长时任务的核心引擎。对旧模型的请求会自动路由到新模型,简化了用户的迁移过程。开放权重将在安全评估和加固后两周内发布。
需要提醒的是,7月份Anthropic曾指控Z.ai在GLM-5.2中未经授权蒸馏了Claude和GPT的答案,这为此次雄心勃勃的发布增添了背景。
我的分析:GLM-5.3不仅仅是增量更新,而是在小众但至关重要的领域中的一次定向突破。ExploitBench和CyberGym成绩翻倍表明,Z.ai正在大力投资安全领域,这可能成为全球对代码保护AI工具需求背景下的关键竞争优势。然而,伦理和技术来源的问题仍然悬而未决,这可能制约该模型在西方的采用。