Grok 4.5 在浏览器AI代理测试中击败竞争对手:自主性新霸主
开发者们正积极创建能够自主与网站交互的AI助手:打开页面、点击按钮、填写表单以及收集信息。这类代理可以根据用户指令预订机票或分析网站数据——全程无需人工参与。
近日,由Browser Use服务创建者格雷戈尔·祖尼奇主持的对比测试显示,基于xAI公司Grok模型的工具在此类任务中表现远超竞争对手。这不仅是基准测试的胜利,更标志着自主浏览器代理领域范式的转变。
谁取得了最佳成绩
分析师们根据统一标准——在网站上无差错完成任务的成功率——对五款工具进行了评估。成功率越高,代理越可靠。
Grok以显著优势领先:其代理正确完成了76.42%的任务。排名第二的是OpenAI的助手,成功率为72.70%。紧随其后的是Anthropic的两款代理,成功率分别为70.75%和67.92%。榜单末尾是通过OpenClaw插件运行的GPT,仅有60.38%的成功执行率。
每款助手都基于各自的底层AI模型运行。Grok使用Grok 4.5模型,OpenAI工具采用GPT 5.5,而Anthropic的解决方案则基于Opus 4.8。正是作为系统"大脑"的模型负责决策,而代理本身仅增加了浏览器控制功能。
需要注意的事项
测试结果直观表明,在其他条件相同的情况下,AI模型的选择起着决定性作用。Grok 4.5在自主网页浏览任务中客观优于对手。然而,与浏览器的连接方式同样重要:Anthropic同一款助手因网站集成方法不同,结果差异近三个百分点。
我的专家观点:Grok 4.5在此次基准测试中的优势并非偶然。这体现了xAI在提升模型于真实数字环境中执行连贯操作能力方面的针对性努力。对加密行业而言,这一点尤为重要:自主代理可以彻底简化与DeFi协议、DEX和NFT市场的交互,为用户执行常规操作。如果这一趋势持续,我们将迎来Web3领域AI自动化的爆发式增长。