Anthropic的研究人员有了一个意外发现:在其旗舰语言模型Claude内部,形成了一种开发者最初并未在架构中预设的内部结构。这一被称为"J-space"的机制,就像一个通用工作空间,模型的不同组件在执行任务时会访问它。
什么是J-space?
本质上,J-space是神经网络内部的一块虚拟"黑板",在处理请求时,关键信息会汇聚于此。当Claude回答问题或解决问题时,关键数据会出现在这个区域,以便模型的不同部分能够与之交互。Anthropic的分析人员通过一种名为"J-lens"的特殊工具发现了这一结构,该工具能够实时观察模型内部的信息流动。
值得注意的是,J-space是在训练过程中自发形成的——工程师并未对此进行编程。这一概念与神经科学中所谓的"全局工作空间"惊人地相似——这是一种机制,在人类身上,它使多个思维过程能够同时访问重要信息。例如,当你听到一个问题、回忆一个事实并组织答案时,你的大脑会将所有这些数据汇集到一点。
实验表明,Claude不仅能够根据请求描述J-space的内容,还能对其进行修改。此外,手动干预这一结构会直接影响模型的回答和行为。
为何这对人工智能安全至关重要
这一发现对人工智能的安全性和可解释性具有重大意义。追踪J-space活动的能力,为识别模型行为中的隐藏动机以及发现异常(包括提示注入攻击,即恶意指令试图劫持回答控制权)开辟了道路。
当然,目前的能力有限:Claude中的大部分信息处理仍在J-space之外进行。然而,团队已经发布了J-lens实现的源代码,并在Neuronpedia上提供了演示版本,邀请研究社区验证结果。
这项研究是Anthropic探索模型"内部生命"的更广泛系列工作的一部分。该公司正稳步推进对人工智能"引擎盖下"情况的理解,在我看来,这是当前行业最重要的趋势之一。
专家观点:发现J-space不仅仅是一个学术趣闻。这是朝着创建真正可控且透明的人工智能迈出的一步。如果我们能够在模型内部工作空间的层面上"读懂它们的想法",我们就掌握了解决当前整个行业面临的根本安全问题的钥匙。