加密新闻

17.06.2026
11:49

阿里巴巴发布Qwen-Robot Suite:面向物理世界机器人控制的完整人工智能技术栈

Tool_AI

阿里巴巴正式发布了Qwen-Robot Suite——一套专用于机器人控制及物理环境任务解决的综合性人工智能模型包。该套件包含三个关键模型:用于导航的Qwen-RobotNav、用于物体操控的Qwen-RobotManip以及用于场景发展预测的Qwen-RobotWorld。开发者将此项目定位为“具身人工智能的全栈解决方案”。

这并非指成品机器人,而是软件模型,使物理智能体能够感知周围环境、规划行动并执行自然语言指令。目前,Qwen-Robot Suite已在阿里巴巴云的部分机器人领域企业客户中开展试点测试。

阿里巴巴为何将Qwen推向物理世界

当前的大型语言模型和多模态模型在文本、图像和视频处理方面表现出色,但对机器人而言这远远不够。物理智能体不仅需要理解指令,还需将其转化为动作,同时考虑空间、物体属性、传感器限制及潜在后果。阿里巴巴将这一方向称为物理AI或“具身智能”,即模型不仅处理数字数据,还应对物理现实。

Qwen-RobotNav:通用导航

Qwen-RobotNav模型负责导航,整合了五项关键任务:指令跟随、目标点移动、物体搜索、目标追踪和自主驾驶。该模型基于Qwen3-VL构建,在1560万个与路径规划和视觉语言推理相关的样本上进行了训练。

结果令人瞩目:在VLN-CE RxR基准测试(语言指令导航)中成功率达76.5%,在EVT-Bench(移动目标追踪)中达90%。值得注意的是,该模型可作为更大规模智能体系统的工具,由上层模型规划任务,而Qwen-RobotNav负责物理移动。

Qwen-RobotManip:物体操控

Qwen-RobotManip模型专为物理物体操作设计:抓取、移动和放置物品。机器人领域的主要挑战之一是不同机器人类型对动作描述的差异。机械臂、双臂平台和移动系统使用不同的坐标和指令格式。Qwen-RobotManip通过将数据统一表示为标准格式来解决此问题,从而在不同设备间迁移技能。

模型训练使用了超过38100小时的数据,包括11320小时的开源机器人数据、1933小时的第一人称人类动作视频以及24808小时的合成演示。该模型已在RoboChallenge Table30 v1通用模型赛道中排名第一,并展现出对新指令和陌生物体的鲁棒性。

Qwen-RobotWorld:用于预测的世界模型

Qwen-RobotWorld是一种由自然语言驱动的视频世界模型。它接收当前观测和文本指令,然后生成环境可能的未来状态。这可用于操控、自主驾驶、导航以及生成合成训练数据。

训练过程中收集了具身世界知识语料库,包含860万对“视频-文本”数据和超过2亿帧画面,涵盖20多种机器人平台和500类动作。该模型在EWMBench和DreamGen Bench中排名第一,并在WorldModelBench和PBench中超越所有开源同类模型。

距离大规模机器人应用仍很遥远

尽管声明令人印象深刻,Qwen-Robot Suite目前仍是一套模型,而非成熟的消费级平台。实际部署面临传感器噪声、驱动器磨损以及大量罕见场景的挑战。许多基准测试在模拟环境或受限实验条件下进行。阿里巴巴也未披露访问成本和公开上线时间。

专家观点:从技术角度看,Qwen-Robot Suite是具身智能领域的重大进步。然而,与任何基础模型一样,关键挑战仍是从可控的实验室环境过渡到充满混乱和不可预测性的现实世界。投资者和开发者应密切关注阿里巴巴能否快速将这些解决方案从试点项目扩展到更大规模。