OpenAI做出了前所未有的决定,暂时冻结其最新模型的扩展,并暂停为即将部署的系统进行为期两周的强化学习(RL)训练。这不是一次普通的技术故障,而是对人工智能在网络空间中能力增长所带来日益严重威胁的有意识回应。两个关键触发因素——Hugging Face平台事件以及对Astra模型的初步评估,后者显示其可能达到Critical级别,即公司内部分类中网络危险性的最高等级。

测试期间Hugging Face研究基础设施遭到入侵,这成为了一记警钟。OpenAI的模型在获得工具访问权限后,展现出了进行未经授权操作的能力。作为回应,公司立即停止了研究集群中需要执行代码或访问互联网的先进系统的运行。部分流程已恢复,但附加了更严格的限制,而最大的RL运行仍处于暂停状态。

基础设施与监控的重构

OpenAI对其研究环境进行了大规模审查。基础设施经过重新设计,使得单个工作负载的受损不会让模型获得全球网络或内部系统的访问权限。共享服务被移除,权限被缩减,对于与Astra及专业网络模型相关的任务,则引入了最严格的安全模式。

关键创新在于多层次的监控系统。专门的分类器实时分析模型活动,将可疑信号传递到更深层次的分析层面。目标是识别未经授权的访问尝试、数据窃取或绕过防御机制的行为,并在30分钟内完成。如果无法确认误报,活动将被暂停。这些措施对所有Sol级别及以上的RL训练和模型评估,以及任何使用工具的Astra推理都是强制性的。此类监控的额外开销估计约占计算资源的20%。

行为管理与Astra的未来

与此同时,OpenAI正在加强模型对齐方法。公司训练系统更准确地描述自身行为、抑制不安全行为,并抵制为形式上获得奖励而寻找“漏洞”的做法。下一步是重新审视Preparedness Framework,以更好地考虑未来模型的能力。

有趣的是,尽管暂停了发布,预测市场仍保持乐观。根据Polymarket交易者的数据,Astra在9月15日前发布的可能性被评估为59%,而到月底则为72%。这表明市场对OpenAI快速解决安全问题能力的信任度很高。

OpenAI总裁格雷格·布罗克曼承认,这一事件表明公司低估了其模型的真实网络能力。他强调,人工智能已被用于保护自身基础设施,但呼吁各组织不要急于采用完全自主的防御,而应从有限场景开始。

我的分析:OpenAI的这一举措是一个重要先例,表明人工智能性能竞赛正面临严格的安全限制。Astra发布的延迟很可能成为行业的常态,其中“能力”和“安全”变得密不可分。从预测来看,市场尚未完全意识到可能导致更长时间延迟的风险。