Anthropic的研究人员在理解大型语言模型实际工作原理方面取得了突破。在研究Claude的内部运行过程时,他们发现了一种工程师最初并未设计在架构中的结构。这就是所谓的"J-space"——模型在学习过程中自行创建的内部工作空间。

J-space的功能类似于一种"虚拟白板"或共享工作空间,在执行任务时,关键信息会汇集于此。模型的不同组件会访问这个空间,以协调行动并生成一致的响应。研究人员通过一种名为"J-lens"的特殊工具观察到了这一机制,该工具能够实时追踪模型内部的数据流动。

尤为重要的是,J-space并非预先设计而成。它是作为复杂系统的涌现特性自然产生的。这一发现与认知科学中"全局工作空间"的概念相呼应——该理论解释了人脑如何整合来自不同来源的信息以做出决策。当Claude回答问题、解决任务或执行指令时,关键数据会出现在J-space中,供模型的不同部分处理。

这对人工智能安全为何重要

J-space的发现对人工智能的安全性和可解释性具有重大意义。追踪该空间活动的能力为识别模型行为中的隐藏动机和异常开辟了道路。例如,可以更有效地检测提示注入攻击——即恶意指令试图劫持模型响应控制权的情况。监控J-space可以观察到模型遭遇干预尝试的时刻。

此外,实验表明,手动修改J-space的内容会直接影响Claude的响应及其执行任务时的行为。这为研究人员提供了进行微调和控制的强大工具。

Anthropic已公开发布了J-lens实现的源代码以及Neuronpedia上的演示版本,邀请科学界验证其结果。这是该公司自2025年4月以来开展的一系列关于模型"新兴意识"与福祉研究工作的延续。

专家观点: J-space的发现并非仅仅是学术上的奇闻。对于加密货币和DeFi市场而言——人工智能代理已开始管理投资组合并分析风险——理解模型的内部逻辑已成为资产安全的关键问题。能够"窥探引擎盖内部"并观察模型如何做出决策,是迈向创建真正透明且可控的人工智能系统的一步。