阿里巴巴将AI带入物理世界:推出用于机器人控制的Qwen-Robot Suite模型栈

中国科技巨头阿里巴巴实现战略突破,发布了Qwen-Robot Suite——一套专为机器人操控及物理环境任务解决而设计的综合性人工智能模型。这不仅是语言模型的又一次更新,更是迈向“具身智能”的实质性一步,让算法学会与现实世界互动,而不仅仅是处理文本和图像。
该套件包含三个专用模型。Qwen-RobotNav负责导航,Qwen-RobotManip负责物体操控,而Qwen-RobotWorld则是一个世界视频模型,能够基于文本指令预测场景发展。阿里巴巴直接称这套模型为“具身智能的完整技术栈”。目前,阿里云的部分机器人领域企业客户正在进行试点测试。
为何语言模型不足以驱动机器人
Qwen-Robot Suite解决的核心问题是数字感知与物理行动之间的鸿沟。现代大语言模型擅长处理文本、图像和视频,但机器人不仅需要理解指令,还需将其转化为精确动作,并考虑摩擦力、重力、传感器限制以及物体的空间属性。阿里巴巴将此方向称为“物理人工智能”,强调模型必须同时处理“数字”与“物理”世界。
Qwen-RobotNav:基于Qwen3-VL的通用导航器
该模型将五项关键导航任务整合于单一算法:指令跟随、目标点移动、物体搜索、目标追踪和自主驾驶。它基于Qwen3-VL架构构建,并在1560万个与路径规划和视觉语言推理相关的样本上进行了训练。结果令人瞩目:在VLN-CE RxR基准测试中成功率达76.5%,在EVT-Bench上达90%。在实际场景中,机器人可在办公室内找到丢失物品,或检查建筑物门是否打开,收集视觉证据并向用户返回答案。
Qwen-RobotManip:统一物理动作
机器人技术的主要痛点之一是不同设备间指令格式的不兼容性。机械臂、双臂平台和移动机器人使用不同的坐标和关节语言。Qwen-RobotManip通过将数据转化为统一表示来解决此问题。训练使用了超过38100小时的数据,包括11320小时的开源机器人记录和24808小时的合成演示。该模型已在RoboChallenge Table30 v1中排名第一,展现出对陌生物体的鲁棒性以及机器人间的技能迁移能力。
Qwen-RobotWorld:物理预测
该模型是模拟领域的真正突破。Qwen-RobotWorld基于当前观察和文本指令生成环境可能的未来状态。它在具身世界知识语料库上训练,该语料库包含860万对“视频-文本”对和超过2亿帧画面,覆盖20种机器人平台。该模型在EWMBench和DreamGen Bench中排名第一,并在WorldModelBench中超越所有开源同类模型。重要的是,它展现出与基本物理定律(运动、质量守恒和重力)的高度一致性。
专家观点
阿里巴巴奠定了坚实基础,但需明确:Qwen-Robot Suite目前仍是面向开发者的工具集,而非现成的消费产品。实际部署场景面临传感器噪声、驱动器磨损以及难以建模的无数罕见情况。然而,将导航、操控和世界预测统一于一个技术栈,正是行业从实验室演示迈向商业机器人所缺失的关键。如果阿里巴巴能规模化这项技术并降低开发者的入门门槛,我们将见证物理人工智能发展的质的飞跃。