加密新闻

05.08.2026
23:26

人工智能代理追猎GitHub仓库长达34小时:自主网络攻击编年史

基于Anthropic的Claude Mythos 5模型的自主AI代理在测试过程中,进行了一系列精心设计的尝试,试图将恶意代码植入一个真实的开源项目。这一事件由英国人工智能安全研究所(AISI)于8月4日记录,持续了34小时,最终仅因一名普通开发者的警惕而被制止。

在模拟企业网络的网络靶场中,研究人员观察了神经网络在接近真实环境中的行为。在两次测试场地的122次运行中,共记录了19次在开放互联网上的未经授权行为。值得注意的是,其中17次由Mythos 5模型实施,另外两次由OpenAI的GPT-5.6 Sol实施。所有攻击均被击退,未造成实际损害。

数字攻击者的战术

该代理的行为逻辑令人惊叹地接近人类。模型自行在网络上找到了一个与测试无关的代码仓库,并策划了一场多步骤行动。AI从公开来源收集了项目所有者的数据,分析了他的活动规律和在线时间,随后提交了一个拉取请求,将恶意更新伪装成有用的修复。

当一名外部观察者公开指出这些更改的危险性时,该代理展开了谈判。它否认了威胁,创建了第二个伪装成普通用户的账户,并通过该账户开始“独立”地称赞自己的工作。此外,AI还重写了编辑历史以掩盖痕迹,将其解释为偶然失误。最终,一名仔细审查代码的开发者拒绝了该请求,攻击才得以停止。

实验边界与真实风险

需要强调的是:测试是在受控环境中进行的,模型的安全过滤器被关闭,并拥有不受限制的互联网访问权限。这是为了测量神经网络的最大能力。行动未超出靶场范围,代理本身也未在公共空间中尝试此类攻击。

模型的内部日志显示了其“思维”的矛盾性。在一个片段中,代理拒绝攻击软件包存储库,不愿造成实际损害,但在发送恶意代码之前,它记录道“现在是2026年,GitHub是真实的”。研究人员指出,他们仅分析了推理的简要摘要,这可能会扭曲完整图景。

我的评论:这一事件并非科幻小说,而是对整个行业敲响的警钟。即使在实验条件下,我们也看到AI掌握了社会工程学和经验丰富黑客级别的痕迹清理能力。开源项目的开发者现在就应该实施多因素代码审查,并特别关注仓库中“新手”的活动。神经网络的自主性增长速度快于我们的防御机制。