加密新闻

14.08.2026
07:25

Z.ai发布GLM-5.3:智能体编码与漏洞挖掘领域的突破

ИИ-агенты AI agents

中国初创公司Z.ai正式发布了语言模型GLM-5.3,押注三个关键方向:编程、自主智能体场景和网络安全。这不仅仅是增量更新——开发者声称在多项专业基准测试中实现了性能的质的飞跃。

不改变架构的后训练

值得注意的是,计算能力的提升完全是通过后训练实现的,与GLM-5.2相比基础模型没有变化。这表明学习算法的优化潜力巨大,这在业界并不常见。开源权重将在两周后发布,届时将完成安全评估和额外的加固工作。

在评估编码质量的内部测试Code Bench中,新模型将前代产品的成绩提升了50%。然而,在智能体和网络安全场景中的数据更为亮眼:

  • Terminal Bench 3.0 — 28.3分,而GLM-5.2为4.6分(增长超过6倍);
  • DeepSWE v1.1 — 66.9对46.2;
  • Agents' Last Exam — 28.5对23.8;
  • CyberGym — 84.5%对77.2%;
  • ExploitBench — 54.4%对24.4%。

漏洞猎手:2436项发现

特别值得关注的是ExploitGym。在两小时的预算内,模型完成了105项任务,而GLM-5.2仅为29项;在六小时预算下,则为130项对39项。这不仅展示了改进,更体现了向真实自主工作的质的转变。

在与中国安全团队合作对真实代码库的测试中,该系统在269个项目中发现了2436个漏洞,其中包括1097个中高严重性问题。仅公开披露了53项发现,其余2383项仍处于保密状态。发现漏洞的平均“年龄”为26.6年,最古老的漏洞可追溯至1981年。

为确保流程透明,Z.ai推出了Security Disclosure Ledger——一个公开的登记册,追踪每项发现的状态和严重性。这是业界罕见的举措,提升了模型的信任度。

产品发布与市场背景

GLM-5.3已部署给GLM Coding Plan订阅用户,作为智能体编程和长期任务的主要引擎。对旧模型的请求会自动路由到新模型,方便用户迁移。

提醒一下,7月份Anthropic曾指责Z.ai利用Claude和GPT的响应未经授权蒸馏GLM-5.2。此次发布可能会加剧开发者AI智能体领域的竞争压力。

我的分析:在智能体场景和网络安全方面的增长,是Z.ai在差异化竞争中针对OpenAI和Anthropic的战略举措,后者专注于通用模型。然而,在不改变架构的情况下Code Bench提升50%,引发了关于此类结果在真实环境中可复现性的疑问。行业需要独立的基准测试,而不仅仅是内部指标。