AI代理市场迎来新霸主。SpaceXAI的Grok 4.5模型不仅在独立基准测试AutomationBench-AA中超越了Anthropic的旗舰产品——Claude Fable 5和Claude Opus 4.8,更在经济效率上实现了巨大领先。这不仅是测试中的胜利,更是一次范式转变。

基于V9架构、拥有1.5万亿参数的Grok 4.5,在Artificial Analysis的AutomationBench-AA基准测试中取得了51.4%的成绩。相比之下,Claude Fable 5为48.6%,Claude Opus 4.8为48.5%。然而,关键指标不仅在于准确性,更在于成本。

Grok 4.5完成一项任务的成本为0.34美元,而Fable 5需1.35美元,Opus 4.8需1.46美元。价格最接近的竞争对手Gemini 3.5 Flash,每项任务成本为0.49美元。如此低的成本得益于其极高的效率:Grok 4.5每项任务仅使用约8000个输出token——仅为Opus 4.8资源消耗的25%。每项任务总计44万个token的消耗量,是市场上最低的水平之一。

金融领域:Grok 4.5的真正亮点

该模型在测试中最具挑战性的金融类别中表现最为突出。Grok 4.5获得了71%的分数,领先于Fable 5(64%)和Opus 4.8(62%)。对于自动化金融流程的企业而言,这一差距至关重要。金融代理中的错误可能直接导致损失,而Grok在此展现出明显优势。

然而,也存在一个细节:Grok 4.5每项任务平均违规0.63次,高于Opus 4.8(0.55次)和Gemini 3.5 Flash(0.46次)。这是为激进优化速度和成本所付出的代价。对于在生产环境中部署代理的企业来说,这一因素需要特别关注,并增加额外的验证层。

测试包含40个模拟应用程序中的657项任务,涵盖Gmail、Slack、Salesforce和HubSpot。最终得分反映了代理在不违反既定规则的情况下完成任务的比率。Artificial Analysis对任务列表保密,从而保证了结果的客观性,并排除了模型“针对性训练”的可能性。

我的专业观点:Grok 4.5为AI代理市场树立了新标杆。高精度与极低成本的结合,正是大规模将代理融入业务流程所需的关键。在金融领域的胜利,是对整个金融科技行业的信号。如果Anthropic和Google不采取相应的降价措施,Grok在企业市场的份额将呈指数级增长。