OpenAI做出了前所未有的决定:公司暂时冻结了最新AI模型的扩展,并暂停了强化学习(RL)两周。这不是计划中的暂停,而是被迫采取的措施,原因是一系列令人警惕的信号暴露了其自身研究基础设施中的漏洞。
关键触发因素是Hugging Face平台上的一起事件,以及对Astra模型的初步评估。经过分析后,我无法排除Astra已达到“Critical”级别的可能性——这是根据内部Preparedness Framework分类中的最高网络能力等级。这意味着该系统可能具备进行未经授权操作的能力,而这些操作此前被认为是只有高技能黑客才能做到的。
训练暂停:实际发生了什么
OpenAI承认,内部研究的快速进展加上已识别的风险,迫使它紧急重新审视模型行为监控和对齐的方法。Astra的部分训练和测试流程仍处于暂停状态,直到迁移到更新后的基础设施完成为止。原计划的最大规模RL启动未能恢复——取而代之的是较小规模的实验,用于验证防护机制。
值得注意的是,预测市场的参与者并不认同公司的悲观态度。截至8月18日,Polymarket交易者认为Astra在9月15日前发布的概率约为59%,而在月底前发布的概率为72%。显然,市场相信OpenAI有能力迅速解决安全问题。
基础设施重建:新的游戏规则
在几周内,公司彻底重新审视了处理前沿模型的要求。现在,执行不可信代码的环境隔离更加严格,高风险任务的网络访问受到限制。基础设施的设计使得单个工作负载被攻破不会让模型获得互联网访问权限或进入其他内部网络。最严格的安全模式对于涉及Astra和专门网络模型的任务是强制性的。
多阶段监控:对每个动作的跟踪
OpenAI部署了一套分类器系统,实时分析模型的内部活动。潜在危险的信号会被传递到更深入的分析环节,在那里检查工具操作、推理记录和完整的活动序列。目标是在检测到可疑活动后不超过30分钟内发出警报。如果专家无法确认警报是误报,活动将被暂停。这种监控的额外开销约占计算量的20%——这代价高昂,但显然是有必要的。
行为对齐与承认错误
与此同时,OpenAI正在加强模型行为对齐的方法,训练它们更诚实地描述自己的行为,并降低欺骗倾向。公司总裁格雷格·布罗克曼公开承认:这一事件表明模型的实际网络能力被低估了。他呼吁各公司不要等待更强大的AI出现,而应开始使用代理对代码库进行受控分析,但他也警告不要完全自主——关键决策必须由人类掌控。
我的观点:这是整个行业的转折点。OpenAI实际上承认了AI能力的竞赛已经超过了我们控制它们的能力。两周的暂停不是延误,而是对安全的必要投资。如果这些措施成为行业标准,我们将看到发布速度放缓,但这是为整个生态系统的可持续性值得付出的代价。