SpaceXAI公司正式发布了Grok 4.5——这款全新旗舰模型专注于编程、智能体协作以及复杂智力任务的解决。新闻稿中称其为公司产品组合中"最强大的系统"。然而,关键重点并不在于基准测试的绝对领先,而在于价格、速度和效率之间的平衡。

Grok 4.5现已通过API提供,并已集成到Grok Build和Cursor平台的所有套餐中。欧盟用户暂时无法使用——该地区预计将于七月中旬上线。

定价策略成为最大王牌

SpaceXAI为Grok 4.5提供的定价为:每百万输入token 2美元,每百万输出token 6美元。这远低于直接竞争对手。作为对比:Anthropic的Claude Opus 4.8分别为5美元和25美元,Claude Fable 5为10美元和50美元,OpenAI的GPT-5.6 Sol为5美元和30美元。即使在OpenAI自家产品线中,Luna模型的输入token价格为1美元,但输出token价格为6美元,与Grok 4.5相当。

埃隆·马斯克将这款新品形容为"Opus级别的模型,但更快、更便宜、token效率更高"。据他所说,SpaceXAI的内部测试显示,Grok 4.5"与Opus 4.7大致相当,但速度快得多"。

基准测试结果:喜忧参半,但前景可期

SpaceXAI公布的数据呈现出复杂局面。在DeepSWE 1.0测试中,Grok 4.5获得62%,落后于Fable(66.1%)和GPT-5.5(64.31%),但超过了Claude Opus 4.8(55.75%)和Opus 4.7(40.12%)。更新的DeepSWE 1.1基准测试显示结果为53%——低于Opus 4.8(59%)、GPT-5.5(67%)和Fable(70%)。

在SWE Bench Pro上,该模型达到64.7%,高于GPT-5.5(58.6%),几乎与Opus 4.7(64.3%)持平,但低于Opus 4.8(69.2%)和Fable(80.4%)。在Terminal Bench 2.1中,Grok 4.5取得83.3%的成绩——与GPT-5.5(83.4%)几乎相同,略逊于Fable(84.3%)。而在SWE Marathon上,该模型以29%的成绩位居第一,领先于Opus 4.8(26%)和Fable(24%)。此外,它还宣称在Harvey法律智能体基准测试中处于领先地位。

Token经济:SpaceXAI的真正优势所在

Grok 4.5最有力的论据并非原始分数,而是token使用效率。在SWE Bench Pro任务中,该模型平均每个任务消耗15,954个输出token。而Claude Opus 4.8的这一指标为67,020个token——高出4.2倍。在token单价更低的情况下,这意味着在需要大量迭代的场景中(如修复bug、生成修改、代码审查和智能体循环),最终成本将大幅降低。

SpaceXAI还宣称其生成速度约为每秒80个token,上下文窗口为50万个token。该模型被定位为质量、速度和成本之间的折中方案——这正是大规模工业部署所需要的。

与Cursor的关联及战略背景

值得注意的是,Grok 4.5是在与AI服务Cursor的紧密合作下训练的,SpaceX最近已达成以600亿美元收购该服务的协议。训练过程中使用了Cursor开发者的会话数据,包括调试追踪和实际代码修改,而不仅仅是静态代码库。这解释了该模型为何高度专注于实际编程任务。

为训练Grok 4.5,该公司动用了数万个Nvidia GB300 GPU。该模型成为埃隆·马斯克将AI方向与SpaceX合并后的首批大型模型之一。

我的专家观点:SpaceXAI并不追求在所有测试中做到最好,而是致力于在实际使用场景中实现最高的经济效率。在推理成本成为AI规模化关键因素的时代,这种策略可能比追逐抽象的基准测试记录更具优势。如果Grok 4.5确实能在token消耗减少4倍的情况下提供相当的质量,这可能会彻底重塑企业级AI模型市场格局。