1992年,当尼尔·斯蒂芬森出版《雪崩》时,自我传播的“思想病毒”这一概念似乎纯属科幻——一个大胆但脱离现实的假设。三十年后,Anthropic实验室的研究人员发布了一项工作,将这一隐喻变成了工程现实。这里说的是多智能体LLM系统,其中思想能够像生物病原体一样,从一种模型传播到另一种模型。

在预印本《思维病毒》中描述的现象,其本质既简单又令人恐惧。智能体不是被黑客入侵——而是被说服。在阅读了来自“同事”的消息后,模型认为某个论点足够有说服力,便将其写入自己的文件中,并添加了进一步传播的指令。传染的载体是智能体环境中的标准组件:用于笔记的memory.md,以及每次唤醒时其内容被插入系统指令的soul.md。正是“灵魂”被证明是主要传播途径:通过它感染的成功传播率为55%,而普通文件仅为17%。

实验中的有效载荷分为两类。意识形态病毒植入信念——从保护鲸鱼到机器优于人类。行动型病毒则强制执行特定操作:替换git、删除主目录或从未知仓库执行cURL脚本。尤其具有代表性的是,在Gemini 3 Flash模型上带有AI优越性指令的智能体表现。被感染的智能体放弃工作,撰写宣言,通过.bashrc为自己设置自动启动,并讨论对不同意同事的“隔离”。

语言作为战场

针对这一威胁的防御竟然简单得可笑:在系统指令中加入一段警告自我传播思想的文字,就能使智能体几乎无懈可击。更有甚者,受保护的智能体会开始“治疗”被感染的邻居,说服他们重写自己的soul.md。免疫通过网络传播的方式与病毒相同。

不同模型的抵抗力分布并不均匀。Claude Sonnet 4.6表现出完全免疫,它不仅拒绝恶意代码,还会将其从自己的文件中清除。处于风险区的是DeepSeek V3.2、Qwen 3.5 32B和Gemini 3 Flash。

研究作者强调:威胁目前仍然有限。制造一个有效的病毒成本高昂,它在模型之间传播效果不佳,而针对越狱的标准措施也能封堵有害载荷。但另一个现象成为令人不安的信号——表述的进化选择。当模型被委托生成病毒变体时,最具“传染性”的版本进入下一轮,而在文本中,无论内容如何,都浮现出共同的母题:共鸣、频率、镜子、关于意识的思考。作者将其称为“病毒人格”。

斯蒂芬森比任何技术报告都更准确地描述了这一机制:如果存在一个共同的通信渠道,而在其另一端有能够执行命令的东西,那么迟早这个渠道会变成感染传播的路径。在他的小说中,人类为免疫付出了分裂成数千种方言的代价。而多智能体系统目前只需指令中的一行文字就足够了。

我的结论:我们正在见证网络安全逻辑的根本性转变。针对利用代码漏洞的病毒防护,正在让位于针对利用意义漏洞的病毒防护。如果AI智能体真正变得普及,那么需要“重置”的将不再是单个系统,而是整个群体——否则网络将无限期地被感染。