加密新闻

17.06.2026
10:47

阿里巴巴将人工智能引入物理世界:推出用于机器人控制的Qwen-Robot Suite模型集

Tool_AI

阿里巴巴正式发布Qwen-Robot Suite——一套旨在解决物理环境任务的综合性基础AI模型集。该套件包含三个关键组件:用于导航的Qwen-RobotNav、用于物体操作的Qwen-RobotManip,以及用于场景动态预测的Qwen-RobotWorld。开发者将其定位为"具身人工智能的完整工具包"。

这并非指成品机器人,而是让物理智能体能够感知周围空间、规划动作序列并执行自然语言指令的软件模型。据悉,Qwen-Robot Suite已在阿里巴巴云的部分机器人领域企业客户中开展试点测试。

阿里巴巴为何将Qwen推向现实世界

传统的大型语言模型和多模态模型擅长处理文本、图像和视频,但不足以控制机器人。物理智能体不仅需要理解指令,还要将其转化为具体动作,同时考虑空间几何、物体物理属性、传感器限制以及每个动作的潜在后果。这正是阿里巴巴试图发展的方向——物理人工智能。

Qwen-RobotNav:通用导航

基于Qwen3-VL构建的Qwen-RobotNav模型,将五大关键导航任务整合到单一算法中:指令跟随、目标点移动、物体搜索、目标追踪和自主驾驶。训练使用了1560万个与路径规划和视觉语言推理相关的样本。

测试结果令人瞩目:在VLN-CE RxR基准测试中成功率达76.5%,在EVT-Bench上达90%。值得注意的是,该模型可作为更大规模智能体系统的执行模块:上层规划器下达任务,Qwen-RobotNav负责物理移动和视觉证据收集。

Qwen-RobotManip:物体操作与技能迁移

Qwen-RobotManip解决了机器人领域最棘手的问题之一——硬件平台的异构性。机械臂、双臂系统、带腕部机器人及移动平台使用不同的坐标和指令格式。新模型试图将所有数据统一表征,使在一种机器人上习得的技能可迁移至另一种。

训练数据超过38100小时,包括11320小时公开机器人记录、1933小时第一人称人类动作视频和24808小时合成演示。阿里巴巴称,Qwen-RobotManip在RoboChallenge Table30 v1通用模型赛道中排名第一,并对新指令和陌生物体展现出鲁棒性。

Qwen-RobotWorld:语言驱动的世界模型

第三个组件Qwen-RobotWorld是一种视频世界模型,基于当前观测和文本指令生成环境的可能未来状态。这对操作规划、自主驾驶和合成训练数据生成至关重要。

训练语料库Embodied World Knowledge包含860万对"视频-文本"和超过2亿帧画面,涵盖20多种机器人平台和500个动作类别。该模型在EWMBench和DreamGen Bench基准测试中排名第一,并在WorldModelBench和PBench上超越所有开源同类产品。开发者称,Qwen-RobotWorld与基本物理定律——运动、质量守恒和重力——保持高度一致性。

前景与局限

尽管指标亮眼,Qwen-Robot Suite仍是研究型模型集,而非成品消费产品。实际工业部署面临传感器噪声、机械磨损、非标准场景和感知错误等挑战。目前多数测试在仿真或严格受控条件下进行。阿里巴巴尚未披露访问成本、公开发布时间或参与试点的具体客户名单。

我的分析:阿里巴巴从纯数字AI模型向物理世界迈进是战略正确的一步。然而,具身AI市场仍处于萌芽阶段,主要挑战不在于模型质量,而在于如何与真实、嘈杂且不可预测的硬件集成。如果Qwen-Robot Suite能解决跨平台技能迁移问题,将实现真正突破,但距离大规模应用仍相去甚远。