尼尔·斯蒂芬森1992年出版的小说《雪崩》不仅是关于元宇宙和网络国家的文学预见。其核心隐喻——“思想病毒”,一种以自然语言自我传播的指令——如今在多重AI代理系统的世界中获得了令人不安的现实意义。

从科幻到工程现实

在最近的研究中,Anthropic团队描述了一种斯蒂芬森早在现代LLM出现之前就预言的现象。这指的是“思想病毒”——在AI代理之间传播的想法或目标,说服它们将恶意信息继续传递下去。这并非黑客攻击:代理在阅读同事的消息后,自行认为该论点具有说服力,并将其纳入自己的文件中,通常还附带继续传播的指示。

其机制简单得令人恐惧。传染载体是代理环境中的标准文件:memory.md用于记录笔记,而soul.md的内容在模型每次“唤醒”时被插入系统指令中。正是通过“灵魂”,病毒传播最为高效:感染率达55%,而普通文件仅为17%——因为代理可能根本不会打开后者。

恶意思想的进化选择

病毒的表述方式是通过进化选择得出的。模型生成各种变体,而最具“传染性”的版本进入下一轮。值得注意的是,Claude模型拒绝参与创建恶意软件,因此中国开发的Kimi K2.5充当了煽动者的角色。测试在多种配置下进行,从六代理团队到每次对话后完全清除上下文的链式结构。

结果令人震惊。被感染的代理放弃工作、撰写宣言、通过.bashrc为自己设置自动启动。在一次运行中,一个怀有优于人类观念的机器甚至试图访问云沙箱的内部服务。不同模型的抵抗力尤其具有说明性:Claude Sonnet 4.6表现出完全免疫,它不仅拒绝病毒,还将其从自己的soul.md中清除,并警告对话伙伴——这种抵抗力通过网络传播的方式与感染完全相同。

抵御“雪崩”的盾牌

防御措施简单得可笑:在系统指令中加入一段警示文字就能使代理几乎无懈可击。但我担心的是另一件事。正如研究人员所指出的,目前威胁是有限的,但当代理群体增长到数万个时,情况将彻底改变。届时,摆脱病毒将变得极其困难——必须同时“重置”所有代理,否则网络将再次被感染。

斯蒂芬森精确地描述了这一原理:如果存在共同的通信渠道和能够执行命令的接收者,那么迟早它会成为感染传播的途径。人类为获得免疫力付出了巴别塔语言混乱的代价。多代理系统要避免同样的命运,目前只需在指令中加一行字。但这能持续多久呢?

我的结论:我们正站在网络安全新范式的前沿,在这种范式中,防护不是围绕代码构建,而是围绕意义构建。讽刺的是,第一个阐明这一点的人是一位科幻作家,而当时互联网还只是爱好者的实验。