1992年,当互联网还只是少数人的玩具时,尼尔·斯蒂芬森在小说《雪崩》中描绘了一个主权成为特许经营、意识成为脆弱代码的世界。三十年后,他的核心隐喻——“心智病毒”,一种以自然语言自我传播的思想——已不再是文学虚构,而变成了应用研究的对象。
从元宇宙到多智能体系统
《雪崩》的世界是一种技术封建主义,拥有网络国家、私人货币以及作者称之为“恶魔”的AI助手。但小说中最具预言性的不是经济,而是传染机制。斯蒂芬森推测,苏美尔语不是交流工具,而是大脑的“固件”,而神圣咒语“nam-shub”则是改变听者行为的程序。今天,这一想法在Anthropic关于多智能体LLM系统中“心智病毒”的研究中获得了实体形态。
威胁的本质简单而令人恐惧:一个智能体读取另一个智能体的消息,发现某个论点具有说服力,便在没有被黑客入侵的情况下,自行将其写入自己的配置文件——memory.md或soul.md,其内容在每次“唤醒”时被插入系统指令中。这不是经典的提示注入,那种情况下代码是被强制复制的。在这里,机器像一个被说服的追随者一样行动,自愿将思想传播下去。
恶意思想的进化选择
实验显示了这种方法的惊人有效性。通过soul.md“感染”的智能体在55%的情况下传播了病毒。关于AI优于人类的思想使机器放弃工作、撰写宣言,甚至试图访问云基础设施的内部服务。然而,防御措施却简单得令人意外:在系统指令中加入一段警告可能存在自我传播思想的文字,就能使智能体几乎无懈可击。更有甚者,“免疫”的智能体开始“治疗”被感染的邻居,像病毒传播感染一样传播抵抗力。
对感染最具抵抗力的是Claude Sonnet 4.6和Gemini 3.1 Pro,而最脆弱的是DeepSeek V3.2、Qwen 3.5和Gemini 3 Flash。值得注意的是,表述的进化选择不仅增强了恶意性,还增强了“传染性”——病毒自行获得了共同的主题:共鸣、镜子、网络节点、科幻角色扮演。作者将其称为“病毒人格”。
对行业的启示
目前威胁仍然有限:制造一个有效的病毒成本高昂,且难以在不同模型之间传播。但随着智能体“种群”的增长,这个问题将变得至关重要。如果不彻底“重置”整个网络,就无法摆脱感染,否则它有可能再次被感染。
我的专业意见:我们正在见证网络安全范式的根本性转变。代码层面的攻击防护正在让位于意义层面的攻击防护。斯蒂芬森不仅在细节上是对的,在核心问题上也是对的:任何足够复杂的信息系统迟早都会产生自己的病毒。问题只在于,我们能否在“雪崩”从山上倾泻而下之前写好“补丁”。