Anthropic 研究团队取得了一项意外发现:其语言模型 Claude 内部形成了一种开发者最初并未预设的结构。这就是所谓的"J-space"——一个全局工作空间,其功能类似于模型不同组件之间交换数据的共享面板。

什么是 J-space,它是如何运作的?

J-space 是一个内部虚拟空间,Claude 在此收集并在整个模型中传递关键信息。当模型回答问题或执行指令时,重要数据会出现在 J-space 中,以便神经网络的各个部分能够处理这些数据。这类似于认知科学中的"全局工作空间"概念——该概念描述了人脑如何整合来自不同来源的信息以解决问题。

名为"J-lens"的观测工具使研究人员能够在执行任务期间追踪模型内部的信息流动。最值得注意的是:J-space 是在训练过程中自发形成的——工程师并未对其进行编程。

为什么这对人工智能的安全性和可解释性很重要?

这一发现对人工智能安全具有直接影响。如果科学家能够追踪 J-space 的活动,他们就有能力识别 AI 模型行为中的隐藏动机。具体来说,监控 J-space 可以注意到模型面临提示注入(在请求中植入恶意指令)尝试的时刻。

此外,研究人员证明,手动修改 J-space 的内容会直接影响 Claude 的响应及其执行任务时的行为。这为更有效地控制模型开辟了前景。

Anthropic 已发布 J-lens 实现的源代码,并在 Neuronpedia 上提供了演示版本,邀请研究社区在实践中验证结果。这项工作基于一系列早期研究,包括关于"内省意识"的报告(2025 年 10 月)以及关于模型福祉的倡议(2025 年 4 月)。

我的分析:这是近年来人工智能可解释性领域最重要的发现之一。J-space 的自发出现证实了一个假设:大型语言模型可能发展出类似于人类认知过程的内部结构。对于智能合约安全和攻击防护至关重要的加密行业来说,此类监控机制可能成为 AI 代理审计的新标准。但需要记住的是:Anthropic 强调,"可意识访问"这一术语借用于认知科学,并不意味着模型具有意识。