整整十天后,也就是9月12日,xAI将向公众展示Grok 4.7。伊隆·马斯克放出豪言:新模型不仅是向前迈出的一步,更将彻底“超越”市场上所有现存的AI解决方案。

此次发布将是两个月内的第三次重大更新。作为对比:Grok 4.6于8月12日首次亮相,而Grok 4.5的公开访问权限直到7月才开放。这样的节奏表明,xAI的工程师们已进入激进的迭代开发模式,试图在这场军备竞赛中夺取领先地位。

秘密武器:2.1万亿参数与SpaceX数据

Grok 4.7的关键区别在于其架构和独特训练语料库。马斯克确认基础训练已完成,目前团队正在将SpaceX的内部数据整合进模型中。这不仅是营销手段,更是真正的竞争优势:对工程遥测数据、发射记录和物理过程模拟的访问,为模型提供了竞争对手所不具备的独特经验基础。

参数容量已增至2.1万亿,比前代(1.5万亿)高出40%。同时,马斯克指出,新版本运行速度稍慢,但token消耗显著更高效。这是一种有意识的权衡:重点放在推理深度和回答质量上,而非生成速度。

马斯克在声明中还提到了Anthropic,称其为“一家优秀的公司”,并表示相信他们很快会推出先进的解决方案。但他补充说,如果任何其他模型在真实工程任务中超越Grok 4.7,他会感到非常惊讶。

基准测试:雄心是否有依据?

测试情况并不明朗。前代版本Grok 4.6表现参差不齐。在AA Intelligence指数中,它获得61分,与GPT-5.6 Sol Max持平,但比Claude Fable 5 Max(62分)低一分。在GDPVal-AA v2测试中成绩亮眼——1753分,但在Terminal-Bench v3.0上模型表现不佳,仅为26%,而OpenAI的竞品达到34.6%。

有趣的是,Grok 4.5此前也表现出类似趋势:在专业测试中领先(AutomationBench-AA——51.4%,每任务成本0.34美元),但在遵守安全限制方面存在问题(每任务0.63次违规,而Claude Opus 4.8为0.55次)。

现在马斯克已给出确切的发布日期。这些豪言能否在实践中得到验证,取决于xAI是否公布独立的测试结果。市场等待的不是言语,而是数据。

我的分析:使用SpaceX专有数据确实是明智之举,可能为模型在物理和工程领域带来独特能力。然而,在标准的通用基准测试中,这一优势可能无法发挥。真正的较量将发生在面向实际应用的细分测试中,届时模型的“实战经验”将比原始计算能力更为重要。