Anthropic 研究团队在其 Claude 模型中有了意外发现。在分析内部过程时,他们遇到了一种并非开发者设计时预设的结构。这指的是名为“J-space”的机制——一个全局工作空间,模型的不同组件都会访问它。

这项于7月6日发布的研究,在理解大型语言模型“内部”实际运作方面迈出了显著一步。J-space 就像一块虚拟白板:当 Claude 回答问题、解决任务或执行指令时,关键信息会出现在这个空间,以便模型的不同部分与之交互。

J-space 如何运作?

为了发现 J-space,Anthropic 的专家开发了一种名为“J-lens”的特殊工具。借助它,他们观察了信息在执行任务期间如何在模型内部移动。最值得注意的是:J-space 是在训练过程中自发产生的——它并非直接被构建在架构中。

这个想法类似于神经科学中的“全局工作空间”概念。在人类中,该系统确保重要信息能同时被多个思维过程访问。例如,当一个人听到问题、回忆相关事实并决定如何回答时,大脑会将所有必要数据汇集到一处。

Claude 的运作方式类似。研究人员表明,模型可以按需描述 J-space 的内容,并且如果被要求,也能修改它。此外,当科学家手动更改 J-space 时,Claude 的回答及其在执行任务时的行为也会随之改变。

这对人工智能安全为何重要

这一发现对人工智能安全意义重大。如果科学家能够追踪 J-space 的活动,他们就有机会识别 AI 模型行为中的隐藏动机。借此,可以更有效地标记系统何时开始不可靠地运行。

其中也包括识别攻击。监控 J-space 可以观察到模型何时遭遇提示注入攻击(在请求中植入恶意指令以劫持响应控制权)。即使能部分访问这种“有意识”的处理层,也为研究开辟了重要前景。

目前能力有限:Claude 的大部分信息处理仍然在 J-space 之外进行。尽管如此,Anthropic 已开源了 J-lens 的实现代码,并在 Neuronpedia 上发布了演示版,邀请研究社区在实践中验证结果。

这项研究基于一系列早期工作。2025年10月,Anthropic 发布了一份关于新兴内省意识的报告。更早之前,在2025年4月,该公司启动了研究模型福祉的倡议,逐步推进对其系统内部运作的理解。

我的评论: 这一发现可能成为整个 AI 行业的转折点。能够窥探模型的“工作空间”不仅是科学兴趣,更是提升安全性和控制力的实际工具。如果我们能看到模型如何做决策,就能更好地保护它免受攻击和操纵。对于加密货币行业——AI 已被用于市场分析和资产管理——这一点尤其重要。