加密新闻

23.07.2026
17:30

Grok 4.5 领跑浏览器AI助手排行榜:自主性新标准

能够自主与网站交互的AI代理市场正在迅猛发展。这些数字助手不再仅仅生成文本——它们可以打开页面、点击按钮、填写表单并收集数据,代表用户执行操作。由Browser Use服务创始人格雷戈尔·祖尼奇进行的最新对比测试,揭示了该类别中的明显领先者:xAI的Grok 4.5模型。

在实验中,分析师根据关键标准——在网站上无错误成功完成任务的比例——评估了五种不同的工具。结果显示性能存在显著差距。

测试结果:Grok无可匹敌

绝对赢家是Grok 4.5,它正确完成了76.42%的任务。这使其超越了直接竞争对手:

  • OpenAI (GPT 5.5): 72.70%
  • Anthropic Opus 4.8 (版本1): 70.75%
  • Anthropic Opus 4.8 (版本2): 67.92%
  • 通过OpenClaw插件的GPT: 60.38%

值得注意的是,所有助手都使用了相同的Browser Use框架来管理浏览器。效率差异完全源于基础语言模型的质量及其实时做出正确决策的能力。

为什么Grok 4.5表现更优?

这次对比的关键结论是,起决定性作用的并非与浏览器集成的方法,而是模型本身的“智能”。Grok 4.5展现了对网页上下文更深刻的理解,以及在执行多步骤指令时的精准度。即使是同一开发者(Anthropic)的两版助手,结果也相差近3个百分点,这证实了对模型架构的高度敏感性。

这次测试不仅仅是数字竞赛。它标志着新时代的开始,AI代理正成为数字经济的全面参与者。Grok 4.5为该领域所有后续开发设定了标杆。

专家观点:自主AI代理市场正从实验阶段转向实际应用。对于加密行业而言,这意味着出现了用于自动化DeFi操作、套利和数据分析的强大工具。投资者和开发者应密切关注Grok的进展——其在浏览器任务中的优势可能成为整个xAI生态系统的重要竞争优势。