AI安全研究界关注的焦点落在了OpenAI新模型Astra的架构上。讨论的不仅是其性能,更是一个根本性问题:我们究竟能在多大程度上控制这类系统的推理过程?
潜在问题的核心在于一种被称为“循环深度”的技术应用。模型并非完全以文本形式构建逻辑链条,而是可能在未显式显示的内部状态中执行大量计算。这形成了一种“不透明推理”,直接影响用于检测潜在危险行为(如绕过安全限制或撒谎)的监控方法。
安全的关键问题
AI安全领域的顶尖专家对此表示担忧。Redwood Research的Ryan Greenblatt称Astra可能的架构是对AI控制最严重的风险之一。他的担忧与其说是针对模型当前的状态,不如说是针对其发展方向。
他认为,主要风险在于扩展此类方法可能导致系统完全在潜在空间中推理。这将使研究人员和自动化监督系统几乎无法解释模型的行为并及时干预。在近期事件中,调查人员依赖文本推理链来分析AI代理行为的背景下,这一点尤其令人不安。
值得注意的是,面对批评,OpenAI首席科学家Jakub Pachocki迅速安抚公众。他表示Astra计算图的深度不超过GPT-4相应指标的两倍,并强调公司始终致力于保持监控的可能性。但他也承认,这种控制的可能性本身是“脆弱的”,可能会恶化。
这一局面揭示了AI发展的核心悖论:追求日益强大和自主的系统,不可避免地与可控性问题相冲突。OpenAI已将Astra评为关键级别的网络能力,这意味着模型能够自主寻找漏洞。我们能在多大程度上信任具备这种能力的“黑匣子”,已不仅仅是技术问题,而是关乎存亡的问题。
我的专业观点:围绕Astra的公开讨论是一个重要信号。我们正站在一个门槛上,模型的能力开始超越我们理解它们的工具。要求独立评估和公开架构技术细节,并非出于无聊的好奇,而是确保AI发展下一阶段安全的必要措施。