加密新闻

23.07.2026
16:12

Grok 4.5 击败所有对手:新一代AI助手占领浏览器

开发者正在创建能够自主访问网站并代替人类执行操作的AI助手:打开页面、点击按钮、填写表单和收集信息。你可以让这样的助手预订机票或从网站收集数据——它都能独立完成。

基于Grok模型的工具在这一任务中表现最佳。这一结论来自Browser Use服务创始人格雷戈尔·祖尼奇。

分析师们根据一个关键标准对五款工具进行了比较——AI在网站上无差错执行任务的频率。图表中柱状图越高,代表工具运行越可靠。

Grok取得了最佳成绩——76.42%的任务正确完成。紧随其后的是OpenAI的助手(72.70%),以及Anthropic的两款助手(70.75%和67.92%)。排名最后的是通过OpenClaw插件运行的GPT,正确率为60.38%。

每款助手都基于各自的AI模型运行。Grok使用Grok 4.5模型,OpenAI的助手使用GPT 5.5模型,Anthropic的助手使用Opus 4.8模型。模型就是负责思考和决策的人工智能本身,而助手则为其增加了操控浏览器的能力。

从对比中可以看出,在相同条件下,AI模型的选择起着决定性作用,而Grok 4.5在此方面超越了竞争对手。与浏览器的连接方式同样重要——Anthropic的同一款助手,根据其连接网站方式的不同,结果差异接近三个百分点。

需要考虑的因素

AI代理市场不仅是模型之间的竞赛,更是生态系统的较量。Grok 4.5表明,在浏览器层面实现原生工具集成,即使面对竞争对手最强大的模型也能占据优势。当OpenAI和Anthropic依赖第三方插件时,xAI构建了垂直整合的解决方案——这带来了回报。但不应忘记,测试是在受控环境中进行的。在包含动态页面、验证码和JavaScript负载的真实场景中,差距可能会缩小。