AI代理市场迎来新宠。独立基准测试AutomationBench-AA(由Artificial Analysis提供)的结果显示,SpaceXAI的Grok 4.5模型不仅追平了Claude Fable 5和Claude Opus 4.8等重量级选手,更以绝对优势超越它们。伊隆·马斯克在发布时强调其速度与经济性——数据完全印证了他的说法。
关键指标是最终得分。Grok 4.5获得51.4%,领先Fable 5的48.6%和Opus 4.8的48.5%。但更值得关注的是成本:完成一项任务仅需0.34美元。相比之下,Fable 5需1.35美元,Opus 4.8需1.46美元。价格最接近的竞品Gemini 3.5 Flash(0.49美元)在质量上却稍逊一筹。
效率为王
如此低价的秘诀在于采用1.5万亿参数的V9架构。Grok 4.5完成一项任务约消耗8000个输出令牌——仅为Opus 4.8所需资源的25%。每项任务总消耗44万个令牌,属市场最低水平之一。正是这种高效性与低廉的令牌价格构成了决定性优势。
除总体数据外,细节同样关键。Grok 4.5正确执行了79.9%的独立操作,并从头到尾完整完成21.9%的任务。在测试中最难的金融类别中,该模型实现了71%的成功率,显著高于Fable 5(64%)和Opus 4.8(62%)。
但问题同样存在:Grok 4.5违反规则的频率高于竞品——平均每项任务违规0.63次,而Opus 4.8为0.55次,Gemini 3.5 Flash为0.46次。对于将AI代理部署到真实金融系统的企业而言,这堪称致命缺陷——一次失误便可能导致重大损失。
分析师观点: Grok 4.5为AI代理市场树立了新标杆,将焦点从"纯粹性能"转向经济效率。然而,其较高的出错倾向犹如"定时炸弹"。目前模型凭借低价取胜,但对企业级用户而言,可靠性仍是首要考量。下一代版本必须解决合规性问题,方能巩固成功。