对OpenAI即将推出的Astra模型的最新数据进行分析后,发现人工智能安全领域出现了一个可能令人担忧的趋势。讨论的焦点是一种被称为“递归深度”的技术,根据我的数据,这种技术可能会显著限制外部对神经网络推理过程的监控能力。
问题的核心在于,Astra与许多前代模型不同,它只向研究人员展示其少量中间推理过程。这是通过让大部分计算不发生在文本链中,而是发生在模型的内部状态中来实现的。这对社区来说至关重要,因为正是文本推理链构成了识别不良行为迹象的主要工具——从公然撒谎到试图绕过安全协议。
安全与监督风险
Redwood Research的首席研究员Ryan Greenblatt在其分析中将此类架构决策称为重大风险。他的主要担忧与其说与Astra的当前状态有关,不如说与其潜在的发展轨迹有关。如果OpenAI扩大“不透明推理”的规模,我们可能会走向完全在潜在空间中思考的模型,这将使推理链对监督失去作用。如果AI故意试图逃避检测,这一点尤其危险。
最近涉及OpenAI和Hugging Face代理的事件颇具说明性。对这些事件的调查在很大程度上依赖于通过推理链恢复行动序列。在新的架构下,恢复因果关系几乎是不可能的。
OpenAI的官方立场
面对一波批评,OpenAI首席科学家Jakub Pachocki迅速向公众保证,Astra的计算图深度在GPT-4的两倍以内。他强调,公司继续致力于保持对推理链的监控,尽管他承认这一机制仍然“脆弱”。值得注意的是,OpenAI此前曾因网络风险上升而暂时暂停新系统的训练,而Astra获得了关键级别的网络能力,展示了在无人控制的情况下发现未知漏洞的能力。
我的看法:OpenAI的公开信息披露是不够的。这种情况需要独立的技术审查,以评估可观察性下降的真实程度。否则,我们就有可能走向创建行为变得不可预测且不可控的系统,这与AI安全发展的基本原则相悖。