整整十天后,也就是9月12日,xAI将发布备受期待的Grok 4.7模型。埃隆·马斯克对其超越所有现有AI系统的能力做出了大胆声明,不仅以架构变革为支撑,还依托对航天领域数据的独家访问权来强化这一雄心。

这一公告在发布周期急剧加速的背景下显得尤为引人注目。仅在8月,我们就看到了Grok 4.6(12日发布),而7月则是Grok 4.5的公开首秀。如今,仅过一个月,我们又将迎来下一个迭代版本。与此同时,OpenAI也不甘示弱,宣布推出自家的Astra模型,这无疑进一步加剧了竞争态势。

SpaceX数据成为最大王牌

Grok 4.7与前代产品的关键区别不仅仅在于规模。马斯克确认,基础训练已经完成,目前正在进行基于SpaceX内部数据的最终微调阶段。这是一个战略性举措,可能赋予该模型在解决工程和科学问题方面的独特优势,这是竞争对手无法企及的。

架构也经历了重大变革。Grok 4.7将拥有2.1万亿参数,比Grok 4.6(1.5万亿)增加了40%。据马斯克称,新版本运行速度会稍慢一些,但计算代币的利用效率将显著提高——这种权衡表明其重点在于分析深度,而非响应速度。

“Grok 4.7将超越所有现有模型。同时,Anthropic是一家优秀的公司,他们很可能很快就会展示更先进的解决方案。得益于SpaceX提供的独特训练数据,如果其他任何模型在真实世界的工程任务中能比Grok 4.7更出色,我会感到非常惊讶,”马斯克表示。

基准目标与现实

要理解这一目标有多么雄心勃勃,不妨看看前代产品的成绩。Grok 4.6在AA Intelligence指数中获得了61分,与GPT-5.6 Sol Max持平,但比领先者Claude Fable 5 Max(62分)少一分。在GDPVal-AA v2测试中,该模型获得了1753分,但在Terminal-Bench v3.0中的表现则较为平淡——仅为26%,而OpenAI的竞品则达到了34.6%。

有趣的是,Grok 4.5此前也表现出类似的趋势:在AutomationBench-AA中以51.4%的成绩领先,每项任务成本为0.34美元,但它更频繁地突破安全限制(0.63次违规,而Claude Opus 4.8为0.55次)。这一趋势表明,xAI押注于“原始”性能,有时甚至以牺牲安全性为代价。

如今,最终发布日期已经确认,关键问题在于xAI能否通过独立测试兑现其豪言壮语,还是我们将再次看到营销与实际表现之间的差距。

我的观点:押注SpaceX的独特数据确实是一步强棋,竞争对手难以复制。然而,决定性因素将不是参数数量,而是模型在真实场景中有效应用这些知识的能力。市场已经厌倦了“纸面”纪录——我们需要实战中的证明。