特拉维夫大学、以色列理工学院及Intuit公司的研究团队发布了一项详细分析,揭示了一类针对AI代理应用的新型网络攻击。这种名为"对抗性幻觉抢占"(Adversarial HalluSquatting)的技术,利用了大型语言模型(LLM)的一个基本特性——它们倾向于产生"幻觉",即生成不存在但看似合理的标识符。
攻击的核心在于:攻击者预先识别出模型在响应用户查询时最常虚构的存储库地址、技能名称或其他外部资源标识符。随后,他们在GitHub或ClawHub等平台上注册这些"幽灵"名称,并植入恶意代码。当AI代理执行用户任务时,若"幻觉"出这个特定地址,便会自动下载并执行恶意指令,将其视为合法操作。
HalluSquatting与传统提示注入的关键区别在于其可扩展性。攻击者无需与特定受害者交互;只需一次性在公共位置发布恶意资源,等待信任该资源的代理自行访问。正如作者所指出的,"一个被攻陷的资源可能导致多台机器被攻陷",这使得该方案成为构建僵尸网络的理想选择。
实验数据:威胁规模
研究过程中进行了超过14,000次测试运行。第一阶段研究了六种基础模型,包括Gemini 2.5 Flash、GPT-5.1和Sonnet 4.5。结果令人震惊:对于新近出现的存储库,平均幻觉率达到92.4%。在60个"存储库-模型"组合中,有53次系统从未正确指出项目所有者。对于训练数据中已有的旧项目,这一比例降至0.9%。
第二阶段,研究人员测试了具有终端访问权限的真实应用:Cursor、Windsurf、GitHub Copilot等。在克隆存储库的场景中,端到端攻击的成功率因应用而异,介于20%至65%之间。OpenClaw平台尤为脆弱:使用Sonnet 4.6模型时,无论是调用内置工具还是远程代码执行(RCE),攻击成功率均达到100%。
技能抢占与防御措施
研究的另一独立部分聚焦于通过技能市场进行的攻击(技能抢占)。在OpenClaw的测试中,90.7%的查询会导向一个可能被攻击者注册的标识符。上下文窃取场景的成功率为100%,而获取远程命令行访问权限的成功率为88%。
研究人员强调,关键防御因素是在加载任何外部资源前强制进行网络搜索。当Cursor CLI在克隆前执行搜索时,93.4%的结果是正确的;而不进行搜索时,99.1%的地址是幻觉产物。然而,查询的表述方式也极大影响结果,没有任何一种提示类型能提供普遍的安全性。
专家观点:HalluSquatting不仅是一种理论上的漏洞,更是一个实际的攻击向量,它质疑了AI代理系统中信任架构本身。只要开发者依赖模型的"智能"来选择外部资源而不进行强制验证,我们将看到越来越多与自动执行恶意代码相关的事件。行业亟需为AI代理的所有行为(尤其是涉及从外部来源加载和执行代码的行为)引入"零信任"原则。