Anthropic研究团队在分析其语言模型Claude的内部架构时,意外发现了一个重要结构。在使用新型可视化工具J-lens的过程中,专家们识别出一个在设计阶段并未规划的结构——即所谓的"J-space"(J空间),这是一个作为模型各组件通用数据总线运行的内部工作空间。

什么是J-space及其工作原理

J-space可以想象成一个虚拟"面板",神经网络的不同部分在执行任务时都会访问它。当Claude收到请求时,关键信息(上下文、指令、中间结果)会被放入这个空间,以便模型的所有模块能够协同处理。这并非工程师直接预设——该结构是在模型训练过程中自发形成的。

本质上,J-space类似于认知科学中被称为"全局工作空间"(global workspace)的人类意识机制。在大脑中,这个系统整合来自不同感官和认知过程的数据,使其可用于有意识的决策。Claude的情况类似:研究人员不仅能观察J-space的内容,还能手动修改它,这直接影响模型的行为。

Claude的J-space在很大程度上复现了科学家所称的人类思维中的'全局工作空间'。
Claude的J-space相当于人类思维中的全局工作空间。

这对AI安全性和可解释性的重要意义

这一发现对人工智能安全具有直接意义。如果我们能追踪J-space的活动,就获得了识别模型行为中隐藏动机的工具——例如试图绕过限制或执行恶意指令(prompt injection)。监控这一层可以在模型生成不良响应之前,就发现其遭遇攻击的时刻。

此外,对"有意识可访问"信息的部分访问为研究开辟了新前景。Anthropic强调,"有意识"一词借用于认知科学,并不意味着Claude具有主观体验或意识。然而,能够影响模型内部空间并观察变化本身,就是迈向创建更透明、更可控系统的一步。

目前,Claude的大部分信息处理仍在J-space之外进行,工具的功能也有限。尽管如此,该公司已发布J-lens实现的源代码和Neuronpedia上的演示版本,邀请科学界验证结果。

Cryptalist专家观点

这一发现并非单纯的学术趣闻。它证实了复杂神经网络能够发展出我们并未明确预设的自身协调机制。对AI行业而言,这既是挑战也是机遇:我们获得了审计"黑箱"的新工具,但同时面临模型组件之间可能存在隐藏"通信渠道"的现实。在DeFi协议和加密基础设施的安全背景下——AI越来越多地被用于分析和决策——理解这类内部结构变得至关重要。