以太坊基金会(EF)的 Protocol Security 团队进行了一项大规模实验:他们部署了协同工作的 AI 智能体,针对区块链基础设施的关键组件进行攻击。目标包括系统软件、加密代码和智能合约。结果甚至让开发者本人都感到意外。
EF 得出的主要结论,与其说是关于发现错误的数量,不如说是关于处理这些错误的过程。正如团队所指出的,AI 确实能发现漏洞——这并不令人惊讶。真正令人惊讶的是:发现这些漏洞所需的努力如此之少,而将真实漏洞与误报区分开来的工作量却如此之大。
需要强调的是:人工智能并未取代人类在安全审计过程中的角色。它只是转移了瓶颈所在。过去,研究人员将大部分时间花在寻找假设上;而现在,他们则用于验证大量生成的候选结果。分类筛选而非生成,成为了新的瓶颈。
系统架构:群体智能而非单体
Protocol Security 放弃了传统的单一大型 AI 智能体管理整个流程的方案。取而代之的是,他们部署了一个由专业系统组成的网络,这些系统并行工作,针对同一个代码仓库。一些智能体负责代码的初步侦察,另一些则负责寻找潜在漏洞、填补空白和验证。协调工作通过共享代码仓库和版本控制系统完成。
正如 EF 所解释的,过去用于形成和验证假设的时间,现在被重新分配用于大规模评估:构建预言机、分类筛选、维护已知问题列表以及披露。智能体擅长快速扫描大量代码、追踪执行路径以及为概念验证准备材料。但每个候选结果仍然需要在真实代码上独立复现,才能被认定为漏洞。
具体发现与方法局限性
公开披露的一个例子是 libp2p gossipsub 的 Rust 实现中的漏洞 CVE-2026-34219。该漏洞与 backoff 过期时间的处理有关——backoff 是节点临时限制与对等节点交互的时间段。该错误允许在处理特制的、backoff 值接近最大值的 PRUNE 消息时,远程触发进程崩溃。原因是 Instant + Duration 加法运算中未经验证的算术逻辑,导致了溢出。
然而,EF 并未透露智能体发现的真实漏洞总数。博客中提到了几项发现,但公开指出的只有一个例子。大多数生成的候选结果都是误报、重复项或超出检查范围的问题。EF 称这是该方法的正常部分,而非系统失败。目标是快速剔除错误候选,并用难以辩驳的证据来支持真实漏洞。
值得注意的是,AI 智能体在处理那些只有通过一长串正确操作才能显现的漏洞时表现较差。这种逻辑不仅需要找到可疑的代码片段,还需要证明整个状态序列确实是可达的。这是所有自动化分析工具都会遇到的经典组合爆炸问题。
我的专业观点: EF 的实验是区块链安全演进中的重要一步,但它清楚地表明,如今的 AI 是生成假设的强大工具,而非验证假设的工具。只要人类因素在分类筛选中仍然是关键环节,安全审计的完全自动化就仍是遥远未来的事情。投资于快速验证候选结果的工具,将是这项技术发展的下一个合乎逻辑的阶段。