加密新闻

23.07.2026
17:14

Grok 4.5 领跑浏览器AI助手排行榜:自主性新标准

人工智能自主与网页交互的能力——从预订机票到数据收集——已不再是科幻小说。然而,最新基准测试显示,并非所有模型都能同样出色地完成这项任务。在这一领域,xAI旗下的Grok意外成为领跑者,超越了业界公认的巨头。

Browser Use服务创始人格雷戈尔·祖尼奇对五款领先的AI助手进行了对比测试,评估它们在网站上无差错执行操作的能力。关键标准是任务执行的准确性:点击按钮、填写表单和导航。在这方面,Grok交出的成绩单为整个行业树立了新标杆。

谁表现最佳

根据分析数据,Grok 4.5成功完成了76.42%的任务——这是所有测试方案中的绝对最高分。第二名是基于OpenAI的助手,成绩为72.70%,使用了GPT 5.5模型。紧随其后的是Anthropic基于Opus 4.8模型的两款方案,成绩分别为70.75%和67.92%。排名第五的是通过OpenClaw插件运行的GPT,成绩为60.38%。

值得注意的是,助手的效率直接取决于两个因素:基础语言模型和与浏览器的集成方式。正如Anthropic的测试所示,同一供应商的不同连接方法,其准确率差异可能高达近三个百分点。

需要考虑的因素

结果清楚地表明,在基础设施相同的情况下,AI模型的选择成为决定性因素。由xAI开发的Grok 4.5不仅追赶上了竞争对手,而且自信地超越了它们。这是对自主浏览器代理技术领域领导地位的严肃宣示——这项技术将在未来几年彻底改变用户与互联网的交互方式。

作为分析师,我想指出,Browser Use的测试并非抽象的基准测试,而是对AI实际实用性的直接衡量。如果Grok 4.5保持这样的发展速度,我们可能会看到xAI在网页自动化企业解决方案市场中占据相当大的份额。OpenAI和Anthropic将不得不认真反思其策略,以免失去优势地位。