加密新闻

23.07.2026
17:46

Grok 4.5 领跑AI智能体排行榜:浏览器自主导航的新阶段

打造能够自主浏览网站、点击按钮、填写表单并收集数据的完全自主AI助手,已不再是科幻幻想。最新测试显示,xAI公司的Grok模型在该领域展现出最高效率,超越了OpenAI和Anthropic的解决方案。

基于Grok模型构建的工具,在成功完成任务方面取得了76.42%的惊人成绩,在五款受测助手中位居榜首。紧随其后的是OpenAI的助手,成功率为72.70%,而Anthropic的解决方案以70.75%和67.92%的成绩分列第三和第四位。排名垫底的是搭载OpenClaw插件的GPT,仅完成了60.38%的任务。

此次对比得出的关键结论是:在其他条件相同的情况下,基础AI模型的选择至关重要。在本测试中,Grok 4.5在上下文理解和操作准确性方面展现出优势。值得注意的是,即便是同一开发者Anthropic,其两种浏览器连接方式之间的结果差异也接近三个百分点,这凸显了集成架构的重要性。

数据背后的含义

这些助手各自使用其旗舰模型:Grok基于Grok 4.5,OpenAI基于GPT 5.5,而Anthropic则基于Opus 4.8。正是助手的"大脑"负责决策逻辑,而浏览器控制界面仅增加了与网页进行物理交互的能力。结果明确表明,在当前阶段,Grok 4.5最适合担任浏览器代理的角色。

自主AI代理市场刚刚兴起,Grok的领先地位是一份强有力的宣言。如果xAI能够将这一成功规模化,并将该技术整合到从机票预订到营销数据收集等实际业务流程中,我们将见证互联网交互模式的范式转变。竞争对手需要深思:仅仅改进语言模型已经不够了。