Z.ai发布了GLM-5.3:智能体编程与网络安全领域的突破

中国初创公司Z.ai正式发布了语言模型GLM-5.3,重点押注于编程、智能体场景和漏洞搜索的显著改进。此次更新不仅仅是迭代,更是一个战略举措,重新定义了该公司在AI开发竞赛中的定位。
关键改进与基准测试
与市场预期相反,性能提升完全通过后训练实现,未改变基础架构。这种方法使Z.ai能够快速扩展改进,同时保持计算成本不变。在评估编码技能的内部测试Code Bench中,GLM-5.3相比前代GLM-5.2提升了50%。
在专业基准测试上的表现尤为亮眼:
- Terminal Bench 3.0 — 28.3分,而GLM-5.2为4.6分(增长6倍);
- DeepSWE v1.1 — 66.9对比46.2;
- Agents' Last Exam — 28.5对比23.8;
- CyberGym — 84.5%对比77.2%;
- ExploitBench — 54.4%对比24.4%(增长超过一倍)。
漏洞搜索的突破
特别值得关注的是ExploitGym,该模型展现了卓越的效率:在两小时的预算内完成了105项任务,而GLM-5.2仅为29项;在六小时限制下完成了130项任务,而GLM-5.2仅为39项。这些数据表明在自主安全分析方面实现了质的飞跃。
在与中国安全团队合作对代码库进行的真实测试中,该系统在269个项目中发现了2436个漏洞,其中1097个为中高严重性。仅公开披露了53项发现,其余2383项仍处于保密状态。发现漏洞的平均“年龄”为26.6年,最古老的漏洞可追溯至1981年。为保持透明度,Z.ai推出了公开注册表Z.ai Security Disclosure Ledger,用于跟踪发现的状态和严重性。
产品集成与背景
GLM-5.3已部署给GLM Coding Plan订阅用户,成为智能体编程和长时任务的主要引擎。对旧模型的请求会自动路由到新版本,简化了用户迁移。开放权重将在安全评估和加固后两周内发布。
需要提醒的是,7月份Anthropic曾指控Z.ai利用Claude和GPT的响应未经授权蒸馏GLM-5.2。这一背景增添了悬念:GLM-5.3的成功既可能是自身研究的结果,也可能源于争议性方法,这引发了关于行业创新边界的思考。
我的观点:Z.ai证明了后训练是快速改进模型的被低估的杠杆,尤其是在网络安全等细分领域。然而,如此激进地聚焦于ExploitBench可能预示着市场正转向进攻性AI工具,这必将引发新的伦理和监管讨论。