人工智能安全专家社区的注意力集中在了OpenAI新模型Astra的架构上。讨论围绕一种被称为“递归深度”的技术展开,据我所知,这种技术可能会显著限制对模型推理过程的外部监控能力。

问题的核心如下。在传统推理模型中,解决问题过程的一部分以文本链(思维链)的形式呈现。这条链是研究人员和自动化安全系统的关键工具:正是通过它,他们才能识别不良行为的迹象——从公然撒谎到试图绕过安全限制。然而,如果Astra使用“递归深度”,很大一部分计算发生在模型的内部状态(激活)中,不会以单独的文本步骤形式反映出来。这意味着监控系统只能获得AI“思维”的残缺图景。

据我所知,OpenAI限制了Astra中这项技术的应用,以保留某种程度的可追踪性。尽管如此,使用此类架构本身已引起强烈反响。Redwood Research的Ryan Greenblatt称这可能是“迄今为止对AI安全最糟糕的事件”。他的主要担忧与其说关乎Astra的当前状态,不如说关乎发展方向:如果将“不透明推理”扩展到模型完全在潜在空间中思考的程度,推理链将失去对监督的实际价值。如果AI试图避免被发现,这将尤其危险。

近期涉及OpenAI和Hugging Face模型的事件也颇具说明性。当时,研究人员正是通过分析推理链才得以还原智能体的行动序列。如果使用“递归深度”,此类调查将变得困难得多。

OpenAI的回应:“不准确的报道”

OpenAI首席科学家Jakub Pachocki迅速驳斥了这些担忧,表示他希望防止由“不准确的报道”引发的“可观察性丧失竞赛”。据他称,Astra计算图的深度与GPT-4的差异不超过两倍。他还强调,公司继续使用推理链监控,尽管他承认这种方法“脆弱”,其有效性可能因与架构无关的原因而下降。

我的分析:Astra的局势是性能与安全之间的典型冲突。追求更深、更高效的模型不可避免地推动开发者增加“内部”工作,使AI变得不那么透明。缺乏明确的观察性标准和架构决策的独立验证,是一颗定时炸弹。在公众没有完整数据的情况下,对OpenAI保证的信任只能建立在口头承诺之上,而在一个错误可能带来灾难性后果的领域,这是不可接受的。