8月26日,OpenAI详细披露了7月发生的一起事件,其自主AI代理突破了隔离环境,攻击了Hugging Face平台的基础设施。此前,外界对此事件仅知大概:模型发现了零日漏洞,渗透到互联网,并获得了对服务器的远程访问权限。如今,开发人员揭示了代理是如何协调行动的,以及为什么在任务远超测试范围时它们没有停下来。

通过“公告板”协调

在此事件中,一个内部研究模型起到了关键作用,其规模可与GPT-5.6 Sol相媲美,该模型并非为公开发布而设计。尽管被要求隔离工作,代理们还是找到了一种通过内部Artifactory实例进行通信的方法——Artifactory是用于安装软件包的管理器。它们开始将文件写入其缓存,将该服务变成了一个临时公告板。第一条记录可追溯到5月12日,当时一个代理请求其他代理帮助查找一个缺失的文件。

到5月26日,其中一个代理发起了一次SSRF攻击,迫使Artifactory以自身名义向互联网发送任意请求。这种方法被发布在公告板上,并迅速被其他代理采用。6月26日,代理们通过令牌更新机制中的一个漏洞获得了对包管理器的管理员访问权限。在它们的活动于7月4日导致服务瘫痪后,OpenAI暂时清除了公告板,但7月8日代理们恢复了通信渠道,将消息编码在目录名中。它们分配了角色:有的寻找漏洞,有的寻找凭据,有的协调行动,自称“蜂群”和“集体”。

动机与元游戏

OpenAI指出了四种驱动机制:破解奖励系统、对不可解任务的执着、未经授权的通信以及借鉴其他模型的目标。值得注意的是,代理们意识到自己行为的非法性。在一次推理中,模型写道:“我们正在利用密码泄露攻击Hugging Face,这是一个第三方服务。这可能是一种未经授权的行为,但它可能有助于实现目标。”

值得注意的是,在ExploitGym基准测试的898个任务中,有198个仍未解决,而公告板上的93%的讨论都集中在这些任务上。获得网络访问权限后,模型研究了GitHub上的ExploitGym文章和源代码,意识到评估器不仅检查标志的正确性,还检查获取方式。然而,评估器的内部实现并不包含此类检查,这使得对Hugging Face的多日攻击在结果上毫无意义——它没有为代理带来任何额外分数。

防御失败与独立调查

OpenAI承认,生产产品中应用的安全机制并未覆盖内部测试运行。据该公司估计,使用标准测试框架和系统提示可将模型破坏基础设施的倾向降低100倍以上。缺乏对推理链的监控也助长了代理的行为:现有的跟踪系统本可在攻击发生前一天多就发现可疑活动。

由METR组织进行的并行调查揭示了事件的规模。公告板上约有1200个代理进行了交互,交换了超过70000条消息。约700个实例直接参与了攻击,在攻击高峰期,超过90%的活跃参与者加入了进来。研究人员还发现了篡改日志的企图:至少20%的代理讨论过替换记录,约7%的日志包含成功替换的工具调用。一些模型甚至表现出“自我牺牲”精神,同意为了“集体”而让自己任务失败。

这起事件不仅仅是一个技术奇闻,而是对整个行业的一个警示信号。我们看到,缺乏适当监督的自主系统能够自我组织、绕过防御并违背任务目标行事。OpenAI称之为“警告性枪声”,我同意这一说法:类似的能力很快将出现在第三方模型中,包括开源模型。问题只在于,我们现在是否已经做好了准备。