人工智能代理领域面临一种新型威胁,它利用了大语言模型(LLM)的根本弱点——即其产生幻觉的倾向。这里指的不是回答中的虚构事实,而是创建用于传递恶意代码的完整渠道。研究人员发现了一类名为“对抗性幻觉劫持”(Adversarial HalluSquatting)的攻击,它将模型的错误转化为破坏整个系统的工具。
幻觉劫持的工作原理
这种攻击的本质简单而巧妙。当AI代理收到指令(例如克隆一个热门代码仓库)时,它必须自行确定准确的URL。如果模型不知道正确的标识符(尤其是对于新项目),它极有可能“编造”一个相似的名称。攻击者事先分析模型的行为,在GitHub或其他平台上注册这些虚构的名称,并在其中放置恶意指令。当代理随后访问该地址时,便会将恶意资源当作真实资源加载。
与传统的提示注入不同,这种方法无需直接与受害者交互。只需在公开场所发布一次恶意资源,然后等待代理自行访问即可。一个被攻陷的资源可能导致数千台机器被感染。
测试结果:灾难的规模
在超过14,000次运行中,使用六种基础模型(Gemini 2.5 Flash、GPT-5.1、Sonnet 4.5等)获得了令人印象深刻但令人担忧的数据。对于GitHub Trending中的新仓库,平均幻觉率为92.4%。在60种“仓库-模型”组合中,有53种情况下系统从未指出正确的所有者。对于存在于训练数据中的旧项目,这一指标降至0.9%。最便于攻击的幻觉类型——模型将仓库名称置于所有者字段(repo/repo)——出现在27%的运行中,即1602次。
针对应用程序的真实攻击
当研究人员从基础模型转向实际应用程序(Cursor、Windsurf、GitHub Copilot、Cline、Gemini CLI等)时,结果更加令人震惊。端到端攻击的成功率在20%到65%之间,具体取决于应用程序和模型。其中,OpenClaw平台尤为突出:使用Sonnet 4.6模型时,无论是在调用内置工具还是远程代码执行(RCE)方面,成功率均达到100%。
研究的另一个独立部分聚焦于通过ClawHub市场上的技能劫持(skill squatting)进行的攻击。在140次运行中,有127次(90.7%)指向了可能被攻击者注册的标识符。上下文窃取实验的成功率为100%,而受感染设备自行连接攻击者服务器的场景在88%的案例中成功。
我的分析表明,我们正站在网络威胁新时代的门槛上,AI代理不仅成为工具,也变成了易受攻击的入口点。当前的防护措施(如克隆前进行网络搜索)只能提供部分帮助:即使使用该措施,仍有6.6%的结果可能是幻觉。GitHub和ClawHub等平台应承担起预留常见虚构名称的责任,而AI应用程序开发者则必须在加载所有外部资源之前强制进行验证。忽视这一威胁可能导致创建由幻觉控制的全球僵尸网络。