OpenAI的新模型Astra成为了人工智能研究社区关注的焦点。讨论的起因并非其性能,而是其内部流程透明度可能降低,这引发了人们对现有监督机制有效性的质疑。

问题的核心:“循环深度”

根据我所获得的信息,Astra采用了一种被称为“循环深度”的技术。与标准推理模型不同——后者将逻辑步骤以可分析的文本链形式呈现——循环深度意味着在生成下一个文本步骤之前,对模型的内部表征进行重复处理。这意味着很大一部分计算发生在神经网络的隐藏状态中,并未以显式形式体现,从而可能减少监控系统可获取的信息量。

这里的关键风险在于,依赖推理链来识别不良行为迹象(例如撒谎或试图绕过限制)的研究人员和自动化安全系统,可能会失去这一至关重要的能力。如果模型能够在潜在空间中“思考”而不在文本中暴露其意图,对其进行监督将变得极其困难。

专家评估与OpenAI的立场

这一消息引起了顶尖专家的严重担忧。Redwood Research的首席科学家瑞安·格林布拉特称这种架构决策可能是“人工智能安全领域最糟糕的事件”。他的主要担忧在于,“不透明推理”的规模化可能导致模型完全在潜在空间中思考,从而使推理链对监控失去实际价值。

面对批评,OpenAI首席科学家雅库布·帕霍茨基迅速向公众保证,Astra的计算图深度与GPT-4的差异不超过两倍。他强调,公司致力于保持监控推理链的能力,尽管他承认这种能力是“脆弱的”,可能因与架构无关的原因而退化。

尽管有这些保证,局势仍然令人担忧。需要提醒的是,8月份OpenAI曾因网络风险而暂时放缓了新模型的扩展,而Astra本身被赋予了严重的网络能力等级。这表明公司意识到了潜在威胁的严重性。

我的分析:OpenAI将所有问题归结为与GPT-4的“两倍因素”的立场显得有些回避。即使潜在空间中计算“深度”的微小增加,也可能使外部系统的解释任务呈指数级复杂化。关键问题不在于架构与之前相比有多大差异,而在于有多少关键推理仍处于监控视野之外。公众需要对此进行更详细和独立的评估,以便我们能够充分评估真实风险。