SpaceXAI 正式发布了 Grok 4.5——一款专注于编程、智能体任务和智能工作的新型语言模型。该公司将其定位为迄今为止最强大的系统。该模型已通过 API、Grok Build 以及开发环境 Cursor 在所有付费套餐中开放使用。欧盟用户暂时无法访问,该地区的上线时间计划在七月中旬。
据开发者称,Grok 4.5 的核心优势在于将高性能与激进定价策略相结合。该模型的成本为每百万输入 Token 2 美元,每百万输出 Token 6 美元。相比之下,Anthropic 的 Claude Opus 4.8 分别为 5 美元和 25 美元,Claude Fable 5 为 10 美元和 50 美元,而 OpenAI 的旗舰模型 GPT-5.6 Sol 为 5 美元和 30 美元。在同一系列中,GPT-5.6 Luna 提供了更低的价格——输入 1 美元,输出 6 美元——但处于有限预览模式。这使得 Grok 4.5 成为同类产品中最实惠的解决方案之一。
埃隆·马斯克将这款新品描述为“Opus 级别的模型,但速度更快、成本更低、Token 效率更高”。据他称,SpaceXAI 的内部测试显示,Grok 4.5“大致与 Opus 4.7 相当,但快得多”。
基准测试结果:褒贬不一,但具有竞争力
SpaceXAI 公布的基准测试数据呈现出喜忧参半的局面。在 DeepSWE 1.0 上,该模型获得了 62%,落后于 Fable(66.1%)和 GPT-5.5(64.31%),但超过了 Claude Opus 4.8(55.75%)和 Opus 4.7(40.12%)。在更复杂的 DeepSWE 1.1 上,结果较低——53%,而 Opus 4.8 为 59%,Fable 为 70%。在 SWE Bench Pro 上,Grok 4.5 获得了 64.7%,高于 GPT-5.5(58.6%),与 Opus 4.7(64.3%)持平,但低于 Opus 4.8(69.2%)和 Fable(80.4%)。
然而,在某些测试中,该模型表现更强。在 Terminal Bench 2.1 上,它获得了 83.3%,几乎与 GPT-5.5(83.4%)持平,仅略低于 Fable(84.3%)。在 SWE Marathon 上,Grok 4.5 以 29% 的成绩位居第一,领先于 Opus 4.8(26%)和 Fable(24%)。该公司还声称在 Harvey's Legal Agent Benchmark(一个面向法律智能体任务的测试)上处于领先地位。
经济性——王牌优势
Grok 4.5 最有力的论据不在于峰值性能,而在于经济性。SpaceXAI 提供的数据显示,在 SWE Bench Pro 任务中,该模型平均每个任务使用 15,954 个输出 Token,而 Claude Opus 4.8 使用 67,020 个 Token,是其 4.2 倍。在 Token 单价显著更低的情况下,这使得 Grok 4.5 对于需要大量迭代的场景极具吸引力:修复 Bug、生成补丁、代码审查和智能体循环。
此外,官方宣称生成速度约为每秒 80 个 Token,上下文窗口为 500,000 个 Token。SpaceXAI 将该模型定位为质量、速度和成本之间的最佳平衡点。
与 Cursor 的关联及战略背景
值得注意的是,Grok 4.5 是与 AI 服务 Cursor 共同训练的,SpaceX 近期已同意以 600 亿美元收购后者。该交易将以 A 类股票进行,预计于 2026 年第三季度完成。模型训练使用了 Cursor 开发者的真实会话数据,包括调试追踪和代码修改,这使其在理解实际编程任务方面具有独特优势。训练动用了数万个 Nvidia GB300 GPU。
此次发布是埃隆·马斯克的 AI 业务与 SpaceX 合并后的首批重大举措之一。Grok 4.5 并未试图在所有测试中成为无可争议的领导者,而是提供了一种务实的方案:以可能颠覆企业应用经济学的价格,提供足够高的质量。在一个推理成本正成为 AI 规模化主要障碍的世界里,这种方法不仅看起来合理,而且具有潜在的统治力。