Anthropic 的研究人员在理解大型语言模型内部架构方面取得了突破性进展。在分析自家模型 Claude 的过程中,他们发现了一种并非由开发者在设计阶段预设、而是在训练过程中自发形成的结构。这个内部机制被命名为 「J-space」,它像一个通用工作空间,神经网络的不同组件都会访问它。
什么是 J-space,它是如何工作的?
想象一下人工智能内部的一块虚拟「白板」。当 Claude 收到请求、解决问题或遵循指令时,关键信息就会汇集到 J-space 中。这使得模型的不同部分能够高效地交互和共享数据。为了发现这一结构,Anthropic 开发了一种名为「J-lens」的特殊工具。借助它,科学家们能够实时观察信息在模型执行任务时的流动情况。
值得注意的是,J-space 并非由工程师编程实现——它是作为学习的副产品而涌现出来的。这一概念与认知神经科学中的「全局工作空间理论」(Global Workspace Theory)惊人地相似,该理论描述了人脑如何整合来自不同区域的信息以做出决策。研究人员证明,他们不仅可以读取 J-space 的内容,还可以对其进行修改,这直接影响模型的回答和行为。
为什么这对人工智能的安全性和可解释性至关重要?
这一发现对于人工智能的未来安全具有重大意义。追踪 J-space 活动的能力为我们提供了一种全新的工具,可以「深入探究」神经网络的内部运作。我们将能够识别人工智能行为中的隐藏动机,发现系统开始不可靠运行的时刻,并且尤为重要的是,能够识别出诸如 prompt-injection(注入恶意指令以劫持模型回答的控制权)之类的攻击企图。
尽管目前 Claude 中的大部分信息处理仍然发生在 J-space 之外,且能力有限,但这已经是巨大的一步。Anthropic 不仅发表了科学论文并开源了 J-lens 的实现代码,还在 Neuronpedia 平台上提供了演示版本,邀请整个科学界来验证结果。需要强调的是:该公司并未声称 Claude 拥有意识或主观体验。术语「意识可访问信息」借用于认知科学,并不意味着存在真正的意识。
专家评论: J-space 的发现,可以说是迈向创建真正可解释和可控人工智能的最重要步骤之一。如果我们能够学会在如此基础的层面上「读懂模型的想法」,这不仅会提高它们的安全性,还可能催生新一代算法,使其能够进行更复杂、更透明的推理。所有关心技术未来的人都应该密切关注这一发现。