Meta 正式发布了其最新的图像生成模型 Muse Image,并首次展示了 Muse Video 的早期预览版本。这两项成果均由 Meta 超级智能实验室研发,标志着该公司在 AI 媒体领域取得了重大进展。
Muse Image:智能体方法与社交语境
Muse Image 现已登陆 Meta AI 应用、meta.ai 平台,以及面向美国用户的 Instagram Stories 和部分国家的 WhatsApp。Meta 称其为旗下最先进的图像生成模型。其核心区别在于智能体架构:Muse Image 能够利用互联网搜索、编写和执行代码的工具,并在生成过程中对图像进行优化。该模型能更精准地遵循提示词,具备编辑图像、整合多个参考元素构建场景的能力,同时还能考虑 Instagram 的社交语境。
与 Muse Spark 的集成及新功能
Muse Image 已与 Muse Spark 集成。这一模型组合通过代码和媒体生成技术,能够创建动画 GIF、内嵌图像的网站,甚至交互式视觉游戏。这使生成式 AI 从单纯的图像创作工具,转变为一个功能全面的多媒体创意平台。
Muse Video:预览与愿景
与此同时,Meta 展示了 Muse Video 的早期预览版本。据公司介绍,该模型基于与 Muse Image 相同的预训练基础,具备高视觉质量,并原生支持音频。然而,Meta 承认仍在优化音视频同步以及快速运动场景的物理精确呈现。这表明视频生成功能的全面上线可能还需要数月时间。
安全措施与性能指标
Meta 已引入版权保护系统:所有通过 Meta AI 应用内 Muse Image 生成的图像,都将添加不可见的 Content Seal 水印。据公司称,该水印在裁剪、压缩、调整大小或截屏后依然保留。未来,Meta 计划将这一标记扩展到视频领域。
根据内部平台 Arena 的数据,Muse Image 在文生图、单图编辑和多图编辑类别中均排名第二,仅次于 OpenAI 的 GPT Image 2。这证实了该解决方案具有强大的竞争力。
作为分析师,我认为 Muse Image 的智能体方法是一次进化性的进步。该模型能够自主使用外部工具并理解社交网络语境,使其不仅是一个生成器,更是一个完整的创意助手。然而,Muse Video 的音视频同步问题仍然至关重要——若无法解决,视频生成效果将显得粗糙。总体而言,Meta 正在生成式 AI 竞赛中稳步巩固其地位,我预计未来几个季度,我们将看到这些模型与公司生态系统的更深度融合。