23.07.2026
18:00
Grok 4.5 跃居领先地位:谁最擅长操控浏览器?
AI助手市场正在快速演进。如今,我们看到的智能体不仅能回答问题,还能自主浏览网站:打开页面、点击按钮、填写表单并收集数据。它们已不再是简单的聊天机器人,而是能够根据你的需求预订机票或分析竞争对手的全功能虚拟助手。
在Browser Use开发团队进行的独立分析中,基于不同AI模型的五款领先工具接受了测试。关键指标是网站任务执行的准确率——即无错误成功尝试的百分比。
测试结果:Grok领先
毫无争议的冠军是基于xAI公司Grok 4.5模型的助手。其准确率达到76.42%,是所有参与者中的最佳成绩。第二名是OpenAI基于GPT 5.5的智能体,结果为72.70%。第三和第四名由Anthropic的两款助手(Opus 4.8模型)占据,成绩分别为70.75%和67.92%。第五名是通过OpenClaw插件运行的GPT,仅完成了60.38%的任务。
需要强调的是,所有智能体均在相同条件下运行,这使得结果具有最大客观性。性能差异直接源于基础模型的质量及其与浏览器的集成方式。即便是同一开发者Anthropic,其不同连接方式的结果也相差近三个百分点。
这对市场意味着什么?
结果清晰地表明,AI模型的竞争已进入新阶段——实际应用阶段。能够高效与网页界面交互的模型将获得巨大竞争优势。Grok 4.5不仅追赶上了公认的巨头,还自信地超越了它们,这证实了xAI深厚的技术储备。
我的分析:Grok在浏览器任务中的优势是对整个市场的信号。我们看到,未来不属于"会说话的脑袋",而属于能够行动的智能体。投资者和开发者应密切关注这项技术如何实现商业化,因为自主网络智能体可能彻底改变电子商务、物流和数据收集领域。