阿里巴巴将人工智能带入物理世界:推出用于机器人控制的Qwen-Robot Suite模型栈

阿里巴巴正式发布了Qwen-Robot Suite——一套旨在解决物理环境任务的综合性基础AI模型集。该套件包含三个专用模型:用于导航的Qwen-RobotNav、用于物体操作的Qwen-RobotManip以及用于场景发展预测的Qwen-RobotWorld。开发者将此项目定位为“具身人工智能(embodied AI)的完整技术栈”。这些软件模型使物理代理(即机器人)能够感知周围空间、规划行动并执行自然语言指令。目前,Qwen-Robot Suite正在阿里巴巴云选定的机器人领域企业客户中进行试点测试。
阿里巴巴为何将Qwen引入物理世界
当前的大型语言模型和多模态模型在处理文本、图像和视频方面表现出色,但对于机器人而言这远远不够。物理代理不仅需要理解指令,还需将其转化为精确的动作,同时考虑空间限制、物体属性、传感器噪声以及每个动作的后果。阿里巴巴将此方向称为“物理AI”或“具身智能”,其中模型不仅处理数字数据,还操作真实的物理环境。
Qwen-RobotNav:单一模型中的五项导航任务
基于Qwen3-VL构建、并在1560万个样本上训练的Qwen-RobotNav模型,整合了五项关键导航任务:指令跟随、目标点移动、物体搜索、目标追踪和自主驾驶。结果令人印象深刻:在VLN-CE RxR基准测试中成功率达76.5%,在EVT-Bench上达90%。关键特性在于,该模型可作为更大代理系统的执行工具,上层模型规划任务,而Qwen-RobotNav负责物理移动。演示中展示了在室内寻找丢失物品或检查特定物体状态的场景,机器人不仅移动,还收集视觉证据。
Qwen-RobotManip:物体操作与技能迁移
Qwen-RobotManip解决了机器人技术的一个根本问题——不同类型设备(机械臂、双臂平台、移动系统)之间指令格式的不兼容性。该模型将数据统一为通用表示,使得在一个机器人类型上习得的技能可以迁移到另一个类型上。训练使用了超过38100小时的数据,包括11320小时的开源机器人数据、1933小时的人类动作视频以及24808小时的合成演示。该模型在RoboChallenge Table30 v1中排名第一,并展示了对新指令和陌生物体的鲁棒性。
Qwen-RobotWorld:用于预测的世界视频模型
Qwen-RobotWorld是一种由自然语言驱动的世界视频模型。给定当前观测和文本指令,它能生成环境可能的未来状态。用于训练的具身世界知识语料库包含860万对“视频-文本”数据及超过2亿帧画面,涵盖20种机器人平台和500个动作类别。该模型在EWMBench和DreamGen Bench中排名第一,并在WorldModelBench和PBench上超越所有开源同类产品。开发者声称,该模型与基本物理规律(运动、质量守恒和重力)高度一致。
距离大规模机器人应用仍很遥远
尽管宣称的指标令人印象深刻,Qwen-Robot Suite仍是一套研究模型,而非成熟的消费级平台。实际部署面临传感器噪声、驱动磨损以及基准测试无法模拟的大量罕见场景。阿里巴巴尚未透露访问成本、公开发布时间表或测试系统的具体客户名单。
专家观点:阿里巴巴将导航、操作和预测整合为统一技术栈,是战略上正确的一步。然而,市场上曾出现过许多有前景的机器人平台,最终却未能走出实验室。成功的关键因素不在于基准测试的精度,而在于模型适应真实物理世界混乱状态的能力。目前,这向行业发出了强烈信号,但并非革命。