Anthropic 开发团队在理解大型语言模型内部机制方面取得了突破性进展。在对 Claude 工作过程的分析中,发现了一种工程师在设计阶段并未预先植入的结构。这种被称为“J-space”的内部机制,就像一个通用工作空间,神经网络的不同组件会访问它,以交换和处理关键信息。
这项于7月6日发表的研究,是人工智能可解释性领域向前迈出的重要一步。J-space 就像是人工智能内部的一块虚拟白板,在解决问题、回答问题或执行指令时,关键数据会汇聚于此。得益于此,模型的不同部分能够同步处理相同的信息。
J-space 如何运作,为何引起轰动
Anthropic 借助一种名为“J-lens”的特殊工具发现了 J-space。通过它,研究人员观察到了 Claude 在执行任务时信息在其内部的流动情况。令人惊讶的是,J-space 是在训练过程中自发产生的——它并非由开发人员直接编程设定。这一概念惊人地类似于认知神经科学中人类大脑所谓的“全局工作空间”。
在人类大脑中,该系统确保多个思维过程能同时访问重要数据。例如,当我们听到一个问题、回忆一个事实并组织答案时,大脑会将所有必要信息整合在一起。Claude 展现出了类似的模式。此外,研究人员能够通过手动更改 J-space 的内容来影响模型的回答。当这个虚拟空间的内容发生变化时,人工智能的回答及其执行任务的行为也会发生根本性改变。
安全性与可解释性的未来
J-space 的发现对人工智能安全具有重大意义。能够追踪这个“工作空间”中的活动,为识别模型行为中的隐藏动机和不良模式开辟了道路。特别是,监控 J-space 有助于实时检测提示注入攻击,即攻击者试图在请求中植入恶意指令。
尽管 Claude 的大部分信息处理仍在 J-space 之外进行,但这一结构的存在本身就是未来研究的强大工具。Anthropic 已经发布了 J-lens 实现的源代码,并在 Neuronpedia 平台上提供了演示版本,邀请科学界验证其结果。
分析师评论: 这一发现可能从根本上改变人工智能系统的审计和安全方法。能够“窥视”模型的中央决策过程,不仅是一个科学趣闻,更可能成为验证任何商业神经网络可靠性的潜在标准。然而,必须强调的是,尽管使用了拟人化的术语,Anthropic 明确声明:Claude 不具备意识或主观体验。“可意识访问的信息”这一术语借用于认知科学,并不代表其拥有真正的意识。