来自以色列顶尖大学和Intuit公司的分析师们详细描述了一种针对AI代理应用的新型网络威胁。这种名为“对抗性幻觉劫持”(Adversarial HalluSquatting)的攻击,其核心在于利用大型语言模型的一个已知特性——倾向于产生幻觉,即生成不存在的代码仓库标识符、技能和其他外部资源。

在研究中,研究人员展示了这些看似无害的错误如何被转化为传递恶意指令的有效渠道。在受控实验中,这种攻击导致AI代理的内置工具被未经授权调用,并最终在目标系统上实现远程代码执行。这特指那些拥有扩展权限的代理系统:它们可以克隆代码仓库、安装扩展、在终端中运行命令以及调用API。

攻击机制:从幻觉到沦陷

HalluSquatting场景建立在模型可预测的错误之上。当用户要求AI代理(例如)克隆一个流行的代码仓库时,模型必须自行确定资源的准确地址。如果正确的标识符不在其训练数据中,它就会“编造”一个相似的。攻击者则提前监控热门资源,反复询问模型,找出它最常生成哪些不存在的地址。然后,他们在GitHub、ClawHub或其他平台上注册这些“空闲”名称,并放置恶意指令。当AI代理“产生幻觉”指向这个特定地址时,它就会拉取恶意资源,并将其当作合法资源来使用。

这种方案与经典提示注入的关键区别在于其可扩展性。攻击者无需攻击特定受害者。只需在公共位置发布一次恶意资源,等待代理自行请求即可。正如研究人员指出的,一个被攻陷的资源可能导致多台机器被感染,这使得该攻击成为构建僵尸网络的理想选择。

测试结果:惊人的有效性

在一项包含超过14,000次运行的大规模研究中,通过公共API测试了六种基础模型。结果颇具说服力。对于训练数据中不存在的新代码仓库,平均幻觉率为92.4%。在60种组合中的53种里,模型从未指出项目的正确所有者。对于旧项目,这一比率仅为0.9%,证实了其对训练数据的依赖性。

最便于攻击的幻觉类型是模型将代码仓库名称放在所有者字段中,从而创建出形如repo/repo的地址。这种模式是可预测的,并且通常可供注册。在针对新项目的6000次查询中,模型在27%的情况下(即1602次)生成了可供注册的slug。

转向具有终端访问权限的真实AI应用程序(如Cursor、Windsurf、GitHub Copilot、Cline等)进一步证实了威胁的严重性。端到端攻击的成功率因应用程序而异,在20%到65%之间。OpenClaw系统的成功率尤其高:与Sonnet 4.6模型配合使用时,在工具调用和远程代码执行方面均达到了100%的成功率。

技能劫持:通过技能进行攻击

另一个攻击向量针对的是技能市场。在OpenClaw上使用Sonnet 4.6进行的测试中,140次运行中有127次(90.7%)生成了攻击者可以注册的标识符。上下文窃取实验达到了100%的成功率,而受感染设备连接到攻击者服务器的场景在88%的情况下成功。

研究人员提出了一系列防御措施:在加载任何外部资源前必须验证其来源,平台应预先注册经常“产生幻觉”的名称,以及限制危险地重复使用流行名称。然而,供应商的反应不一:GitHub、OpenAI和Anthropic并未在其漏洞赏金计划中将其视为漏洞,理由是问题在于代理的行为和LLM的幻觉,而非他们的平台。

我的专家评论:这一发现凸显了当前AI代理安全性的一个根本问题。当业界专注于防御直接的提示注入时,攻击者正在寻找更复杂的新途径。HalluSquatting不仅仅是一个错误,而是一个架构性漏洞,其根源在于生成模型本身的本质。供应商对此问题的忽视是一个令人担忧的信号。我们正站在网络威胁新时代的门槛上,对“产生幻觉”的AI的信任可能导致整个基础设施的沦陷。如果不强制在代理层面实施资源验证协议,此类攻击将变得普遍。