加密新闻

17.06.2026
09:55

阿里巴巴将Qwen引入物理世界:推出用于机器人控制的AI模型集

Tool_AI

中国科技巨头阿里巴巴在所谓的“具身人工智能”(Embodied AI)领域迈出了重要一步,推出了Qwen-Robot Suite。这不仅仅是一款普通的语言模型,而是一个由三种专门基础模型组成的完整软件栈,旨在赋予机器人在物理世界中感知、规划和行动的能力。这三款模型分别是:用于导航的Qwen-RobotNav、用于物体操作的Qwen-RobotManip,以及用于预测行动后果的世界模型Qwen-RobotWorld。

这种方法与传统大语言模型(LLM)的关键区别在于,物理智能体仅仅理解文本或图像是不够的。它们需要将自然语言指令转化为精确的动作,同时考虑三维空间、物体物理特性以及自身传感器的限制。阿里云已在机器人领域的企业客户中启动了该套件的试点测试。

Qwen-RobotNav:通用导航器

基于Qwen3-VL构建的Qwen-RobotNav模型,在单一架构内解决了五项关键导航任务:指令跟随、目标移动、物体搜索、目标追踪和自动驾驶。该模型在1560万个样本上训练,展现出令人印象深刻的成果:在VLN-CE RxR基准测试中成功率达76.5%,在EVT-Bench上达90%。本质上,这是一个用于移动的“大脑”,可集成到更大的智能体系统中,由上层模型设定任务,而Qwen-RobotNav负责物理实现。

Qwen-RobotManip:交互大师

第二款模型Qwen-RobotManip专注于与物体的物理交互——抓取、移动和放置。其核心创新在于尝试解决不同类型机器人(机械臂、双臂平台、移动系统)之间的数据不兼容问题。该模型在超过38100小时的海量数据上学习,包括人类第一人称视角的动作视频。成果是在RoboChallenge Table30 v1通用模型赛道中夺得第一,更重要的是,它对新指令具有鲁棒性,并能在不同机器人平台之间迁移技能。

Qwen-RobotWorld:预测未来

Qwen-RobotWorld是一种由文本驱动的视频世界模型。它接收当前观测和指令,然后生成环境可能如何变化的视频。这对于规划复杂动作以及生成用于训练的合成数据至关重要。该模型训练的具身世界知识语料库包含860万对“视频-文本”数据,涵盖500多个动作类别。该模型已在EWMBench和DreamGen Bench基准测试中夺得第一,据开发者称,它还与基本物理定律表现出高度一致性。

分析评论:毫无疑问,Qwen-Robot Suite是在Physical AI领域争夺领导地位的有力宣言。然而,不应过于乐观:从实验室基准测试到仓库或家庭中的实际应用,仍有巨大差距。传感器噪声、机械磨损以及数百万种罕见场景仍然是严峻的挑战。阿里巴巴尚未公布访问成本或公开发布时间表,这表明基于Qwen的“智能”机器人距离大规模应用还很遥远。尽管如此,全球最大云服务提供商之一推出这样的“软件栈”这一事实,为整个行业设定了新的发展方向。