Anthropic研究团队在理解大型语言模型内部架构方面取得了突破性进展。在对Claude系列模型进行分析时,他们发现了一种开发者最初并未设计在项目中的结构。这种被称为"J-space"的内部机制,作为一个通用工作空间运作:模型的不同组件会访问它,以交换和处理关键信息。

这项于7月6日发布的研究成果,在解读现代AI系统"黑箱"内部究竟发生了什么方面迈出了重要一步。

什么是J-space,它是如何工作的?

J-space是一个内部虚拟空间,Claude在此收集并传递重要数据至整个模型。最简单的理解方式是将其视为人工智能内部的"虚拟白板"。当Claude回答问题、解决任务或执行指令时,关键信息会出现在J-space中,以便模型的不同部分能够对其进行处理。

研究人员借助一种名为J-lens的特殊工具发现了这一结构。他们观察到信息在模型执行任务时如何在内部移动。关键点在于:J-space是在训练过程中自发产生的——它并非由设计者直接预设。

Claude的J-space在很大程度上复现了科学家所称的人类思维中的'全局工作空间'。
Claude的J-space在很大程度上复现了科学家所称的人类思维中的"全局工作空间"。

这一概念与神经科学中的"全局工作空间"理论相呼应。在人类中,该系统使重要信息能够同时被多个思维过程访问。例如,当一个人听到问题、回忆相关事实并决定如何回答时,大脑会将所有必要数据汇集到一处。

Claude以类似方式运作。Anthropic表明,该模型不仅能够根据请求描述J-space的内容,还能在被要求时对其进行修改。此外,当研究人员手动更改J-space时,Claude的回答及其执行任务的行为也会随之改变。

为什么这对AI安全性和可解释性很重要

这一发现对人工智能安全具有重大意义。如果科学家能够追踪J-space的活动,他们就有机会识别AI模型行为中的隐藏动机。借此,可以更有效地标记系统何时开始不可靠地运行。

其中包括识别攻击。监控J-space可以观察到模型何时遭遇prompt注入攻击(在请求中植入恶意指令以劫持模型响应的控制权)。此外,即使只是部分访问这种"有意识"的处理层,也为研究开辟了重要前景。

目前能力仍有限。Claude的大部分信息处理仍在J-space之外进行。尽管如此,Anthropic已开源了J-lens的实现代码,并在Neuronpedia上发布了演示版本,邀请研究社区在实践中验证结果。

这项研究基于一系列早期工作。2025年10月,Anthropic发布了一份关于新兴内省意识的报告。更早之前,在2025年4月,该公司启动了研究模型福祉的倡议,逐步推进对其系统内部运作的理解。

还有一个重要的说明。Anthropic强调,他们并未声称Claude拥有意识或主观体验。该研究使用了认知科学中借用的术语"有意识可访问的"信息——这并不意味着存在真正的意识。

分析师评论:发现J-space不仅仅是一个学术趣闻。对于AI及相关技术市场而言,这是一个信号:神经网络的"黑箱"正逐渐变得透明。监控内部流程的能力直接影响使用AI代理的智能合约和DeFi协议的安全性。我们对模型内部逻辑理解得越深入,就越能可靠地将其集成到关键金融系统中。