Meta 发布了其全新的旗舰多模态模型 Muse Spark 1.1。这不仅仅是一次常规更新,更是公司战略转向封闭式专有解决方案的标志。Muse Spark 1.1 被定位为 Opus 4.8 和 GPT-5.5 的直接竞争对手,从基准测试来看,它完全有理由如此定位。与此同时,Meta Model API 的公开预览版也已上线,这是 Meta 首次向第三方开发者提供付费访问其自有模型的渠道。
智能体能力:规划与多任务处理
Muse Spark 1.1 的关键特性在于其专为智能体任务设计的架构。该模型能够充当主智能体,负责收集上下文、制定计划,并将任务分配给并行的子智能体执行。它无需预先训练即可使用新工具、MCP 服务器和用户自定义技能。百万级别的上下文窗口使模型能够记住操作、从早期工作阶段提取信息,并压缩上下文以保留关键步骤。这使其成为处理复杂、多阶段操作的理想工具。
计算机使用:适应性与策略
Muse Spark 1.1 经过训练,可在多应用场景下操作桌面。它不再依赖逐步点击,而是自行选择策略:对于常规操作,它会编写脚本;对于简单操作,则直接通过界面工作。该模型能在长时间会话中保持上下文,并在最少人工干预下适应陌生界面。在每一步,它都能生成批量操作,从而显著加快任务执行速度。
编程:虽有进步,但未领先
开发者声称该模型在处理大型代码库方面取得了显著进步。Muse Spark 1.1 能够诊断复杂错误、在企业系统中植入功能,并执行大规模代码迁移。它支持流行的编码智能体框架,如 Replit、Cline 和 Box。然而,在 Terminal-Bench 2.0 基准测试中,该模型得分为 59.0,落后于 GPT-5.5(82.7)、Gemini(68.5)和 Claude Opus 4.8(65.4)。Meta 承认了这一差距,但表示将继续在该领域进行投资。
多模态与应用示例
该模型可处理文本、图像和视频。其宣称的能力包括从视觉设计稿生成代码以及详细描述视频内容。Meta 展示了一个 Facebook Marketplace 的示例:模型通过智能手机拍摄商品视频,从中提取照片,生成描述,并代表用户通过浏览器发布商品列表。这生动展示了智能体 AI 如何自动化复杂的操作链条。
基准测试与定价
在智能体测试中,Muse Spark 1.1 表现领先:在 MCP Atlas 上得分为 88.1,而竞争对手约为 80;在 JobBench 上得分为 54.7,竞争对手分别为 48.4 和 38.3。访问价格为:每百万输入代币 1.25 美元,每百万输出代币 4.25 美元。API 兼容 OpenAI 和 Anthropic 的格式。公开预览版目前仅面向美国开发者开放。
我的专家意见: Muse Spark 1.1 不仅仅是一个模型,更是一份意图声明。Meta 正从开源策略转向构建封闭生态系统,API 将成为其主要变现来源。如果该公司能够缩小在编码领域的差距,它将成为 OpenAI 和 Anthropic 的有力竞争对手。目前的结果表明,他们完全有机会做到这一点。