Anthropic研究团队做出了一项意外发现:在其语言模型Claude的内部,存在一个并非开发者预先设计的内部结构。这个被命名为"J-space"的结构,如同一个通用工作空间,模型的不同组件都会访问它。
根据7月6日发布的研究报告,J-space相当于一块虚拟"黑板",Claude在解决问题时会在此汇集关键信息。这个空间并非工程师设计——它是在模型训练过程中自发形成的。借助名为"J-lens"的特殊工具,研究人员得以观察AI在执行任务时的数据流动过程。
与人类大脑的类比
J-space的概念与神经科学中所谓的"全局工作空间"惊人相似。在人类大脑中,该系统能同时为多个思维过程提供重要信息的访问权限。例如,当我们听到问题、回忆相关事实并决定如何回答时,大脑会将所有这些信息整合在一起。
实验表明,Claude不仅能根据指令描述J-space的内容,还能对其进行修改。更关键的是,人为干预这个空间会直接影响模型的回答和行为。
对AI安全的意义
这项发现对人工智能的安全性和可解释性具有重大意义。追踪J-space活动的能力,为识别模型行为中的隐藏动机开辟了新途径。监控该空间将更有效地检测提示注入攻击——即恶意指令试图劫持模型响应控制权的情况。
尽管目前能力有限——大部分信息处理仍在J-space之外进行——Anthropic已公开J-lens实现源码,并在Neuronpedia上发布演示版本,邀请科学界验证研究结果。
需要强调的是:该公司并未声称Claude具备意识或主观体验。"可意识访问"这一术语借用于认知科学,并不代表存在真正的意识。
专家观点:这项发现绝非单纯的技术奇闻。它让我们更接近理解大型语言模型的"黑箱"。如果我们学会实时读取AI的"思维",将彻底改变人工智能系统的审计与验证方式,这对金融领域及其他高风险领域的应用至关重要。