Anthropic 的研究人员在理解其 Claude 模型的内部运作方面取得了突破性进展。他们发现了一种工程师在设计阶段并未预先植入架构中的结构。这指的是所谓的 "J-space"——模型在训练过程中自行创建的一个内部工作空间。
J-space 就像一个全局数据公告板。当 Claude 处理查询、解决问题或执行指令时,关键信息会集中在这个空间内。模型的不同组件会访问 J-space 以交换数据。这让人联想到认知神经科学中 "全局工作空间" 的概念,即大脑将来自不同区域的信息整合在一起以做出决策。
为了发现这种结构,Anthropic 团队开发了一种名为 J-lens 的工具。借助它,研究人员观察了信息在执行任务期间如何在模型内部移动。关键结论是:J-space 并非被编程设定——它是作为学习的一种涌现特性而自发产生的。
为什么这对人工智能的安全性和可解释性至关重要
J-space 的发现对人工智能安全具有重大意义。如果科学家能够追踪这个空间内的活动,他们就有可能识别出模型行为中的隐藏动机。这为更有效地检测攻击(例如提示注入,即恶意指令试图劫持模型响应的控制权)开辟了道路。
研究人员还证明,他们可以手动修改 J-space 的内容,这直接影响 Claude 的响应和行为。这提供了前所未有的控制水平和理解深度。
Anthropic 已经发布了 J-lens 实现的源代码,并在 Neuronpedia 上提供了演示版本,邀请科学界在实践中验证这些结果。这是该公司系列工作的延续:2025年10月,他们发布了一份关于涌现内省意识的报告;4月,他们启动了研究模型福祉的倡议。
专家观点: J-space 的发现不仅仅是一个学术奇闻。这是迈向 "透明人工智能" 的一步,届时我们能够窥探神经网络的 "黑箱",理解它为何做出特定决策。对于越来越多地使用人工智能分析市场和管理资产的加密行业来说,这是直接提升信任度和安全性的途径。能够监控模型的内部过程,是我们应该追求的新安全标准。