埃隆·马斯克宣布了xAI新一代旗舰模型Grok 4.7的确切发布日期——将于9月12日正式亮相。这一声明发布之际,人工智能领域的军备竞赛正不断加速,每个月都有新的领跑者更替。据马斯克称,新版本不仅将提升前代产品的性能,更应超越市场上所有现有模型。

关于Grok 4.7的已知信息

新模型的关键特点在于利用SpaceX的内部数据进行二次训练。这一非传统举措为xAI带来了独特的竞争优势:能够获取其他实验室无法触及的真实工程和遥测数据。模型架构也经历了调整:参数数量从Grok 4.6的1.5万亿增至2.1万亿。马斯克指出,模型运行速度会稍慢,但token利用效率将大幅提升——这对规模化部署而言是至关重要的因素。

马斯克本人态度极为雄心勃勃,他表示如果任何其他模型在真实工程任务中表现优于Grok 4.7,他会感到惊讶。与此同时,他公开认可Anthropic的成就,并期待他们近期实现突破。发布节奏确实令人瞩目:Grok 4.5于7月公开,Grok 4.6于8月12日发布,如今下一代迭代已宣布。

基准测试:竞争的主战场

前代产品Grok 4.6的表现喜忧参半。在AA Intelligence指数中,它获得61分,与GPT-5.6 Sol Max持平,但比Claude Fable 5 Max低一分。在GDPVal-AA v2测试中,成绩高达1753分,令人印象深刻;然而在Terminal-Bench v3.0上,模型表现不佳,仅取得26%,而OpenAI的竞品达到34.6%。此前,Grok 4.5在AutomationBench-AA上以51.4%的成绩领先,但表现出更强的突破安全限制的倾向。

悬而未决的问题是:xAI能否通过独立测试兑现其高调承诺,还是我们又将只看到选择性展示的数据。无论如何,9月12日将成为整个AI市场的重要日子。

我的分析:整合SpaceX数据是一项竞争对手难以复制的战略举措。然而,决定成败的关键并非参数数量,而是模型在长期规划和处理真实(而非合成)任务方面的能力。市场已对营销承诺感到厌倦——需要的是可复现的结果。