Meta 推出了多模态模型 Muse Spark 1.1,其基准测试表现与 Opus 4.8 和 GPT-5.5 相当。与此同时,该公司首次向外部开发者开放了付费 API 访问权限——这是 Meta 首次出售自家模型的访问权限,而非像以往那样以开放权重形式免费分发。
智能体基础
Muse Spark 1.1 专为需要协调多个应用的复杂多步骤任务而设计。该模型既可以充当主智能体,负责收集上下文并在并行子智能体之间分配子任务,也可以在必要时作为执行者将控制权交回。100 万 token 的上下文窗口使其能够在长时间会话中保持信息,压缩数据并保留关键步骤。
电脑操控与多模态能力
该模型经过训练,可在条件不断变化的多应用场景中操控桌面。Muse Spark 1.1 不会逐一点击,而是自行选择策略:对于常规操作编写脚本,对于简单操作则直接通过界面完成。它还支持多模态——文本、图像和视频。例如:模型通过智能手机拍摄商品视频,提取照片,生成商品描述,并代表用户通过浏览器发布。
编程能力进步
开发者声称,该模型在处理大型代码库方面有显著改进。Muse Spark 1.1 能够诊断复杂错误、在企业系统中植入功能,并执行大规模代码迁移。它支持流行的智能体框架:规划模式、子智能体委派、目标条件设定和上下文压缩。早期合作伙伴包括 Replit、Cline 和 Box。
基准测试与定位
在智能体测试中,该模型处于领先地位:MCP Atlas 得分 88.1(竞争对手约 80 分),JobBench 得分 54.7,而 Opus 4.8 为 48.4,GPT-5.5 为 38.3。但在编程方面,它表现逊色:Terminal-Bench 2.0 得分 59.0,而 GPT-5.5 为 82.7,Gemini 为 68.5,Opus 4.8 为 65.4。Meta 承认这一差距,并表示将继续在该领域投入。
价格与可用性
访问费用:每百万输入 token 1.25 美元,每百万输出 token 4.25 美元。这低于 Claude Sonnet 4.6,但高于 OpenAI 和 Anthropic 的入门级模型。注册时,开发者可获得 20 美元的免费额度。API 兼容 OpenAI SDK 和 Anthropic Messages 格式。目前预览版仅对美国开发者开放。
我的看法:推出付费 API 是 Meta 的战略转向,此前该公司一直依赖 Llama 等开放模型。如果 Muse Spark 1.1 真能在智能体场景中与 Opus 和 GPT 竞争,这可能会改变 AI 智能体市场的格局,尤其是在企业自动化领域。然而,编程能力的落后是一个严峻挑战,若不克服,该模型可能仍将局限于小众工具。