人工智能世界正面临一种全新的威胁类别。来自以色列顶尖大学及Intuit公司的研究人员发现了一种漏洞,该漏洞可能将语言模型的“幻觉”转化为创建僵尸网络的强大机制。这种名为Adversarial HalluSquatting的攻击利用了LLM倾向于编造不存在的仓库标识符、技能及其他外部资源的特性。

与经典的提示注入不同,这种方法无需直接接触受害者。攻击者只需在GitHub等平台上注册一个虚假资源,然后等待AI代理自行请求该资源。这为大规模、非针对性攻击开辟了道路,一个被攻陷的资源可能感染数千台机器。

HalluSquatting的工作原理

该场景基于模型的可预测错误。当用户要求代理克隆一个流行仓库时,模型必须确定准确的地址。如果它不知道正确的标识符,就会生成一个相似但实际不存在的标识符。攻击者事先查明模型最常输出哪些“幻影”地址,并注册这些地址,植入恶意指令。代理在“幻觉”中调用该地址时,便会拉取恶意代码,并将其视为合法代码进行操作。

实验结果令人震惊。在对新仓库(来自GitHub Trending)进行的超过14,000次运行中,平均幻觉率高达惊人的92.4%。在60种“仓库-模型”组合中,有53种组合的系统从未指出正确的所有者。对于可能存在于训练数据中的旧项目,这一比率降至0.9%。

实践测试:从理论到恶意代码

从基础模型转向实际应用(Cursor、Windsurf、GitHub Copilot、Cline)证实了威胁的严重性。端到端攻击在20-65%的运行中成功。OpenClaw平台尤其脆弱:与Sonnet 4.6模型配合使用时,无论是在调用内置工具还是远程执行代码方面,均实现了100%的成功率

研究还专门针对“技能抢注”进行了分析——即通过ClawHub市场上的技能进行攻击。在90.7%的OpenClaw运行中,模型生成了攻击者可能已注册的技能标识符。上下文窃取实验实现了100%的成功率,而受感染设备自动连接攻击者服务器的场景在88%的案例中成功。

防护措施与厂商反应

研究人员建议在加载任何外部资源前强制进行来源验证。在克隆前进行网络搜索可将幻觉率降至6.6%,但测试表明,没有任何一种提示类型是普遍安全的。

厂商的反应不一。GitHub声称这不是平台漏洞,而是LLM幻觉的结果。Cursor和Anthropic也未承认问题,将其归因于依赖项名称劫持攻击。谷歌承诺将信息转交给产品团队。

我的专家意见:大型厂商对此威胁置之不理,这是一个令人担忧的信号。HalluSquatting并非漏洞,而是代理型AI系统架构的根本特性。除非我们在协议层面强制对所有外部资源进行验证,否则此类攻击只会愈演愈烈,将“智能”代理变成完美的恶意软件传播工具。