加密新闻

23.07.2026
16:44

Grok 4.5在浏览器操控方面超越竞争对手:Browser Use测试结果

现代AI助手正在快速进化:它们不再仅仅回答问题,而是能够自主访问网站,代替用户执行操作——打开页面、点击按钮、填写表单并收集数据。只需下达指令,例如"预订机票"或"从门户网站收集信息",神经网络就能独立完成所有工作。

近期,由Browser Use服务创始人格雷戈尔·祖尼奇进行的一项对比研究显示,在五款测试的AI工具中,基于Grok模型的助手表现最佳。关键指标是在网站上准确无误地完成任务的能力。数值越高,工具在实际工作中的可靠性越强。

Grok以令人瞩目的成绩位居榜首——76.42%的任务正确完成。紧随其后的是OpenAI的助手,准确率为72.70%。Anthropic的两款工具分别以70.75%67.92%的成绩位列第三和第四。排名垫底的是通过OpenClaw插件运行的GPT,仅为60.38%

数据背后的含义

每位助手都基于其底层AI模型运行:Grok使用Grok 4.5模型,OpenAI的工具基于GPT 5.5,而Anthropic的解决方案则采用Opus 4.8。正是模型——助手的"大脑"——负责决策和思考,而助手本身仅增加了控制浏览器的能力。结果清晰表明:在界面选择条件相同的情况下,模型质量成为决定性因素。Grok 4.5稳稳超越所有竞争对手。

同样值得注意的是,与浏览器的连接方式会影响最终精度。对于同一款Anthropic助手,根据集成方法的不同,结果差异接近三个百分点。这表明,围绕模型优化"外围框架"同样是一项关键任务。

我的分析:网络自动化领域的AI助手市场正进入成熟阶段,而Grok 4.5的领先地位对整个行业发出了重要信号。xAI的技术不仅在追赶,更在关键场景——与互联网的实际交互中——超越了巨头。这对加密社区尤为重要:能够与DeFi协议和交易所协同工作的自主代理正变得越来越现实。