9月3日,OpenAI公司正式发布了其新的旗舰模型——GPT-6 Astra。此次发布不仅标志着计算能力的演进,更是向AI代理完全自主化方向的一次质的飞跃。在初始阶段,该模型的访问权限仅限于“Trusted Access”计划中的选定组织,但未来几天内,它将向ChatGPT Plus、Pro、Business和Enterprise用户开放,同时也可通过API和Amazon Bedrock使用。与此同时,微软公司也将Astra集成到其Microsoft Foundry平台中,扩大了对Azure企业客户的访问范围。

新一代代理智能

Astra与其前身GPT-5.6 Sol的关键区别在于其自主与计算机环境交互的能力。该模型能够操作浏览器和应用程序:填写表单、更新CRM记录、分析数据,甚至测试软件。测试结果令人印象深刻:在OSWorld 2.0子集上,Astra得分72.6%,而Sol为65.7%;在延迟模拟任务中,其执行速度提升了47%(约40分钟对比75分钟)。在Agents’ Last Exam基准测试中,Astra取得了59.3%的成绩,高于GPT-5.6 Sol(53.6%)和Claude Opus 5(55.5%)。

科学领域的进展尤其值得关注。在FrontierMath Tier 4测试中,该模型达到了惊人的97.6%。此外,开发人员声称Astra帮助改进了数论中的两个结果,其中一个已超过80年未有变化。这是AI首次为基础数学做出如此重要的贡献,为科学研究开辟了新的视野。

关键级别的网络能力

然而,主要的争议焦点在于安全性。Astra成为OpenAI首款在其内部Preparedness Framework中达到“关键”级别网络能力的模型。在ExploitBench测试中,它在无生产限制的情况下达到了100%的成功率,在专家测试中能够为零日漏洞创建漏洞利用代码。这迫使公司在公开版本中实施严格限制:模型将拒绝高级网络任务,而防御性场景的访问将通过新的Daybreak计划提供。

公司承认,监控Astra的书面推理变得更加困难,这需要额外的控制措施。这引发了一个根本性问题:我们是否准备好迎接一个既能防御又能以同等效率攻击的AI的出现?

安全投资与商业化

在发布的同时,OpenAI还宣布了一项价值10亿美元的Daybreak for Frontline Defenders计划。该倡议旨在为美国的关键基础设施运营商、银行和开源软件开发者补贴AI工具的使用费用。考虑到网络空间的军备竞赛正进入新阶段,这是一个及时的举措。

模型的使用成本也引发了疑问。以每百万输入令牌10美元和每百万输出令牌50美元的价格,再加上长查询的加价系数,高复杂度的分析任务可能会变得相当昂贵。105万令牌的上下文窗口是一个令人印象深刻的指标,但它需要大量的计算资源。

我的专家评估:GPT-6 Astra不仅仅是又一次更新,而是向新范式的过渡,AI在此成为真正的数字员工。然而,达到“关键”级别的网络能力是一把双刃剑。市场需要密切关注OpenAI如何在创新与安全之间取得平衡,以及这项技术是否会成为恶意行为者的新战场。