Grok 4.5 碾压竞争对手:新一代AI代理攻占浏览器
人工智能市场正进入新阶段。如今讨论的已不仅是文本或图像生成——AI正在学习自主在互联网上行动。开发者们正在打造"浏览器助手",它们能够无需人类参与地访问网站、点击按钮、填写表单并收集数据。而据我掌握的信息,Grok已成为这场竞赛的领跑者。
Browser Use服务创始人格雷戈尔·祖尼奇对五大领先AI工具进行的对比分析,揭示出明确的领先者。评判标准十分严苛:在网站上成功完成任务且不出任何差错的频率。基于Grok 4.5模型的Grok在此项测试中交出了令人瞩目的成绩单——76.42%的任务正确完成率。
浏览器代理排行榜上的各方势力
为全面了解局势,这里给出完整排名。排名第二的是基于GPT 5.5模型的OpenAI助手,成绩为72.70%。第三、四位由Anthropic基于Opus 4.8模型的两款工具包揽,成绩分别为70.75%和67.92%。垫底的是通过OpenClaw插件运行的GPT,成绩为60.38%。领先者与末位者之间近16个百分点的差距,在高精度算法领域堪称鸿沟。
需要强调的是,所有助手均在相同条件下运行。唯一的变量是负责决策的AI模型本身。正是助手的"大脑"——其分析语境并选择正确行动序列的能力——决定了最终结果。这些数据直观表明,模型选择至关重要。
这对市场意味着什么
有趣的是,即便同属Anthropic公司,两种连接方案之间的效率差异也接近三个百分点。这说明集成架构和浏览器连接方式的重要性丝毫不亚于神经网络本身。我们看到Grok 4.5不仅获胜,更以显著优势胜出,这令竞争对手在代理AI领域的地位受到质疑。
我的分析:自主浏览器代理市场正在快速成熟。Grok 4.5已证明自身实力,但我不会急于将OpenAI和Anthropic排除在外。AI领域的军备竞赛才刚刚开始,每次新的训练周期都可能彻底改变力量格局。不过对用户而言这无疑是利好——竞争将加速真正实用的数字助手的诞生。