Anthropic 研究团队取得突破性进展,在其语言模型 Claude 内部发现了一个此前未知的内部结构。这个被命名为 "J-space" 的机制,如同一个通用工作空间,模型的不同组件都会访问它。需要强调的是:工程师在设计时并未预设这一架构——它是在训练过程中自发形成的。
什么是 J-space,它是如何工作的?
从本质上讲,J-space 是 Claude 内部的一个虚拟空间,用于在整个模型中收集和传递关键数据。可以将其想象成人工智能内部的一块"白板"。当模型回答问题或解决问题时,关键信息会出现在 J-space 中,以便模型的不同部分能够与之交互。科学家们通过名为 "J-lens" 的特殊工具发现了这一结构,该工具可以观察任务执行过程中的信息流动。
值得注意的是,J-space 在很大程度上复现了人类思维中"全局工作空间"的概念。当人类听到一个问题、回忆起相关事实并决定如何回答时,大脑会将所有必要数据汇集到一处。Claude 的工作方式与此类似。此外,研究人员还证明,该模型可以按需描述 J-space 的内容,甚至在被要求时对其进行修改。对 J-space 的手动干预会直接影响模型的回答和行为。
为什么这改变了人工智能安全的游戏规则
这一发现对人工智能的安全性和可解释性具有重大意义。追踪 J-space 活动的能力为识别模型行为中的隐藏动机开辟了道路。我们将能更有效地发现系统开始不可靠运行的时刻。特别是,监控 J-space 可以让我们看到提示注入攻击的尝试——即在请求中植入恶意指令以劫持模型回答的控制权。
当然,目前的能力仍然有限。Claude 的大部分信息处理仍然发生在 J-space 之外。尽管如此,Anthropic 已经发布了 J-lens 实现的源代码,并在 Neuronpedia 上提供了演示版本,邀请研究社区在实践中验证这些结果。
这项研究建立在一系列早期工作的基础上。2025年10月,Anthropic 发布了一份关于模型形成内省"意识"的报告,并于4月启动了研究模型福祉的倡议。一个重要说明:该公司并未声称 Claude 具有意识或主观体验。"意识可访问"这一术语借用于认知科学,并不表示存在真正的意识。
Cryptalist 专家评论: J-space 的发现不仅仅是一个学术奇闻。这是朝着为神经网络打造"X光机"迈出的一步。能够窥视决策的"黑箱",是构建真正安全可控的人工智能系统的关键,这对于将其整合到金融和管理流程中至关重要。