阿里巴巴将人工智能带入物理世界:推出用于机器人控制的Qwen-Robot Suite模型栈

阿里云在物理人工智能(Physical AI)领域迈出了重要一步,推出了Qwen-Robot Suite。这不仅仅是一个语言模型,而是一个由三种专用模型组成的完整技术栈,每种模型都解决机器人技术中的特定任务:导航、物体操作和物理场景预测。Qwen团队将该项目称为“具身智能的完整技术栈”。
这一突破的核心在于,大型语言模型(LLM)在处理文本、图像和视频方面已经表现出色,但对于与现实世界交互来说,这还不够。机器人不仅需要理解自然语言指令,还需要将其转化为物理动作:移动、抓取、考虑重力和物体属性。Qwen-Robot Suite旨在弥合数字世界与物理世界之间的这一鸿沟。
Qwen-RobotNav:通用导航器
技术栈中的第一个模型Qwen-RobotNav基于Qwen3-VL构建,是一个针对五种导航任务的通用解决方案:指令跟随、目标点移动、物体搜索、目标跟踪和自主驾驶。该模型在1560万个与视觉语言推理相关的样本上进行了训练。
结果令人印象深刻:在复杂的VLN-CE RxR基准测试中成功率达到76.5%,在EVT-Bench上达到90%。在实际场景中,这意味着机器人不仅可以移动,还能例如在办公室中找到丢失的物品并向用户提供视觉证据。Qwen-RobotNav可以作为更大规模智能体系统的执行模块,其中上层模型规划任务,而该模型负责移动。
Qwen-RobotManip:操作大师
第二个模型Qwen-RobotManip解决了机器人技术中的一个关键问题——设备异构性。不同的机器人(机械臂、双臂平台、移动系统)使用不同的坐标系和指令格式。Qwen-RobotManip试图创建一个统一表示,从而在不同类型的机器人之间迁移技能。
训练使用了超过38100小时的数据,包括11320小时的公开机器人数据、1933小时的人类动作视频和24808小时的合成演示。该模型已在RoboChallenge Table30 v1中排名第一,并展现出对新型指令和陌生物体的鲁棒性。
Qwen-RobotWorld:未来预测器
第三个模型Qwen-RobotWorld是一个由文本驱动的视频世界模型。它接收当前观察和指令,然后生成环境可能的未来状态。这对于动作规划和生成用于训练的合成数据至关重要。
用于训练该模型的具身世界知识语料库包含860万对“视频-文本”对和超过2亿帧,涵盖20种机器人类型和500个动作类别。Qwen-RobotWorld已在EWMBench和DreamGen Bench基准测试中取得第一名,并在WorldModelBench和PBench上超越了所有开源模型,展现出对物理(运动、重力、流体)的深刻理解。
我的分析:Qwen-Robot Suite是一个战略上正确的举措。阿里云并非试图制造一个玩具机器人,而是在为未来构建一个基础平台。然而,距离大规模应用还有很长的路要走。现实环境充满噪声、磨损和模拟器无法考虑的非标准情况。尽管如此,正是这样的“技术栈”才是未来的关键——人工智能不再只是聊天,而是能够行动。