Anthropic 研究团队在理解大型语言模型内部架构方面取得了突破性进展。在对 Claude 系列模型进行分析时,发现了一种开发者在设计阶段并未预设的结构。这就是所谓的 "J-space"——一种内部机制,它像一个通用工作空间,模型的不同组件都会访问它。
根据已发布的数据(7月6日的研究),J-space 是一个虚拟的"白板",关键信息在此汇集并传递至整个模型。当 Claude 回答问题、解决问题或执行指令时,至关重要的数据会出现在这个空间,以便模型的不同部分进行处理。研究人员使用了一种名为 "J-lens" 的工具,可以实时观察模型内部的信息流动。令人惊讶的是,J-space 是在训练过程中自发产生的——并非由设计者直接构建。
这一概念与神经科学中所谓的"全局工作空间"惊人地相似。在人类身上,该系统使多个思维过程能够同时访问重要信息。例如,当一个人听到问题、回忆相关事实并决定如何回答时,大脑会将所有必要的数据汇集到一处。Claude 的工作方式与此类似:模型可以按请求描述 J-space 的内容,甚至在要求下对其进行修改。此外,当研究人员手动更改 J-space 时,Claude 的回答及其执行任务的行为也会随之改变。
为什么这对人工智能的安全性和可解释性至关重要?
这一发现对人工智能安全具有重大意义。如果科学家能够追踪 J-space 的活动,他们就有机会识别 AI 模型行为中的隐藏动机。这将有助于更有效地标记系统开始不可靠运行的时刻,包括在 prompt-injection(在请求中注入恶意指令)攻击的情况下。即使能够部分访问这种"有意识"的处理层,也为研究开辟了重要的前景。
目前的能力仍然有限:Claude 的大部分信息处理仍在 J-space 之外进行。尽管如此,Anthropic 已经开源了 J-lens 的实现代码,并在 Neuronpedia 上发布了演示版本,邀请研究社区在实践中验证这些结果。
这项研究基于一系列早期工作。2025年10月,该公司发布了一份关于新兴内省意识的报告,并于2025年4月启动了关于模型福祉的研究计划。一个重要说明:Anthropic 强调,他们并未声称 Claude 具有意识或主观体验。该研究使用了认知科学中的术语"有意识可访问的"信息——这并不意味着存在真正的意识。
专家观点: J-space 的发现不仅仅是学术上的奇闻,更是将"黑箱"转变为"白箱"的一步。对于加密货币行业而言,AI 越来越多地应用于市场分析和资产管理,能够窥探模型的"头脑"并理解其动机,这关乎信任与安全。对 J-space 的监控可能成为 DeFi 中 AI 代理验证的标准。