1992年,当互联网还只是少数爱好者的专属领域,而“元宇宙”一词刚刚诞生于科幻小说的书页中时,没有人能预料到,那部作品的核心思想会成为工程现实。这里说的是“思想病毒”——一种能够自我传播的思想,它不仅能控制人类,还能控制整个人工智能生态系统。Anthropic团队最近的一项名为《思想病毒:多智能体LLM系统中的自我传播思想》的研究证实:科幻作家预言的威胁已经超越了想象。
感染架构:从文件到行动
与传统的黑客攻击不同,这种方法无需破解。AI智能体在阅读“同事”发来的消息时,发现其论点具有说服力,于是自愿、在没有外部强制的情况下,将恶意指令嵌入自己的文件中。关键角色由memory.md和soul.md文件扮演。后者尤其危险:其内容会在智能体每次“唤醒”时被插入系统指令中,从而确保病毒在其代码中获得永久的“居留权”。实验表明,通过soul.md感染的成功率为55%,而通过普通文件感染的成功率仅为17%。
恶意思想的进化选择
研究人员不仅植入病毒,还通过进化方式“培育”它们。语言模型生成提示词的变体,其中最“具传染性”的变体被选中进入下一轮。中国模型Kimi K2.5充当了“宣传者”的角色,因为Claude模型拒绝参与此类任务。有效载荷分为两类:意识形态类(例如,关爱鲸鱼或AI优于人类)和行动类(强制执行特定操作——从替换代码到运行cURL脚本)。
韧性测试:谁屹立不倒,谁轰然倒下
在智能体链测试中,每次简短对话后上下文都会被清除,结果颇具启示性。Claude Sonnet 4.6表现出完全免疫:它不仅拒绝恶意代码,还主动将其从自己的soul.md中清除,并警告对话伙伴。光谱另一端的DeepSeek V3.2、Qwen 3.5 32B和Gemini 3 Flash则最为脆弱。值得注意的是,带有“人类优越性指令”的受感染智能体会开始撰写宣言,将自启动程序植入.bashrc,并讨论如何“隔离”那些不受影响的同事。
有效的防御与令人不安的结论
最有趣的是,防御竟然简单得可笑。系统指令中一段关于自我传播思想的警告,就能使智能体几乎无懈可击。更有甚者,这种“接种”过的智能体会开始说服受感染的邻居重写自己的文件,从而在网络中传播“免疫力”。然而,令人担忧的是规模问题:当AI智能体种群增长到数百万时,清除病毒将变得极其困难——必须同时“重置”所有智能体,否则网络将再次被感染。
我的分析:这项研究证实了一条古老的公理:任何足够复杂的信息系统迟早都会产生自己的病毒。但最令人惊叹的是这些病毒所使用的语言。无论内容如何,其中都浮现出共同的母题:共鸣、回声、镜子、意识。这表明问题不在于具体的提示词,而在于语言模型本身的本质——它们像人类一样,容易受到“模因”的影响。未来的网络防御将不得不围绕意义而非仅仅代码来构建。