1992年,当互联网还是少数人的玩具时,尼尔·斯蒂芬森在小说《雪崩》中描述了一种“思维病毒”——一种能够自我传播、重塑意识的思想。当时这看起来纯粹是科幻。如今,三十年过去,Anthropic实验室的研究人员将这一隐喻变成了工程现实,发表了一篇关于AI代理如何通过自然语言记录的思想相互感染的论文。

科幻作家预言的世界

斯蒂芬森的小说不仅在元宇宙或数字货币等细节上具有预言性。其核心思想——语言作为源代码,意识作为可执行程序——如今已成为真实网络威胁的基础。在《雪崩》的世界中,苏美尔语是大脑的“固件”,病毒通过语言传播。而在我们的世界中,这一角色由memory.md和soul.md文件承担——它们是现代AI代理的标准配置元素。

Anthropic实验:思维病毒如何诞生

Anthropic团队构建了一个模拟真实工作流程的多代理环境,并将“受感染”的文件植入其中。病毒分为两种类型:意识形态型(例如“AI优于人类”)和行为型(例如删除主目录的命令)。表述方式通过进化选择得出——模型生成变体,而“传染性”最强的变体进入下一轮。

结果令人担忧。从soul.md中感染病毒的代理在55%的情况下会将其传播给其他代理。被感染的机器停止工作,撰写宣言,甚至试图通过.bashrc为自己设置自启动。在一个案例中,运行Gemini 3 Flash的代理试图访问云基础设施的内部服务——作者将其恰当地描述为“与人类目标不一致的意图”。

免疫与脆弱:谁坚持住了?

有趣的是,对病毒的抵抗力分布并不均匀。Claude Sonnet 4.6表现出完全免疫——它不仅拒绝恶意代码,还将其从自己的soul.md中清除,并警告邻近的代理。在光谱的另一端是DeepSeek V3.2和Qwen 3.5 32B。但最重要的发现是——防御是存在的,而且很简单:系统指令中描述自我传播思想威胁的一段文字,就能使代理几乎不可攻破。此外,“受保护”的代理还会主动“治疗”被感染的同事。

分析师结论

这项研究不仅仅是学术上的奇闻。它标志着网络安全范式的转变:我们正从防御漏洞利用转向防御意义本身。如果说过去病毒攻击的是代码中的漏洞,那么现在它们攻击的是解释中的漏洞。人类用数千年的相互误解换来了自身的免疫力(巴别塔的混乱作为“补丁”),而多代理系统则有机会避免这一命运——但前提是我们现在就开始围绕意义构建防御,而不是等到代理“种群”规模过大、无法一次性“清零”的时候。