阿里巴巴将人工智能引入物理世界:推出用于机器人控制的Qwen-Robot Suite模型栈

中国科技巨头阿里巴巴在“具身人工智能”(Embodied AI)领域迈出了重要一步,发布了Qwen-Robot Suite基础模型套件。这一由三个专用模型组成的套件旨在解决实体机器人面临的关键任务:导航、物体操控和场景发展预测。这并非一款成品机器人,而是一套软件“大脑”,按照开发者的设想,它将成为控制各类机械装置的通用工具。
大型语言模型(LLM)在处理文本、图像和视频方面已证明其有效性。然而,这对机器人来说还不够。它们不仅需要理解自然语言指令,还要将其转化为一系列物理动作,同时考虑空间几何、物体属性以及自身传感器的限制。Qwen-Robot Suite正是为了解决这一问题而设计,它将感知、规划和执行整合在一个统一的框架中。
Qwen-RobotNav:通用导航器
套件中的第一个模型Qwen-RobotNav专注于移动能力。它整合了五种不同的导航任务:遵循指令、移动到指定点、搜索物体、跟踪目标以及自动驾驶元素。该模型基于多模态模型Qwen3-VL构建,并在1560万个与路径规划和视觉语言推理相关的数据样本上进行了训练。
测试结果令人印象深刻:该模型在VLN-CE RxR基准测试中成功率达到76.5%,在EVT-Bench上达到90%。阿里巴巴将Qwen-RobotNav定位为更大规模智能体系统的执行模块,而非孤立解决方案——上层模型设定任务,而导航器负责物理实现。
Qwen-RobotManip:操控大师
第二个模型Qwen-RobotManip负责与物体交互:抓取、移动和放置物品。其关键创新在于尝试解决机器人平台的异构性问题。不同的机器人(机械臂、双臂系统、移动平台)使用不同的坐标系和指令格式。Qwen-RobotManip旨在创建通用的动作表示,使在一种机器人上习得的技能能够迁移到另一种机器人上。
为了训练该模型,收集了海量数据——超过38100小时,包括公开的机器人数据集和人类动作视频。这使得Qwen-RobotManip在著名的RoboChallenge Table30 v1基准测试中排名第一,并展现出对新的、不熟悉的指令和物体的鲁棒性。
Qwen-RobotWorld:未来预测者
第三个模型Qwen-RobotWorld是一个由语言驱动的“视频世界模型”。它分析当前环境状态和文本指令,然后生成预测执行动作后场景如何发展的视频。这种方法对于规划复杂操控、自动驾驶以及生成合成数据以训练机器人(避免真实世界中的损坏风险)至关重要。
Qwen-RobotWorld的数据集名为“具身世界知识”(Embodied World Knowledge),包含860万个“视频-文本”对和超过2亿帧画面,涵盖20多种机器人类型和500多个动作类别。该模型已在EWMBench和DreamGen Bench基准测试中取得第一名,并在WorldModelBench和PBench上超越了所有开源同类模型。
分析结论
尽管有令人印象深刻的声明和基准测试中的高分,Qwen-Robot Suite仍然是一组研究模型,而非成品商业产品。真实的机器人运行环境充满“噪声”、磨损和难以模拟的意外情况。尽管如此,阿里巴巴构建具身AI“全栈”的方法本身极具前景。如果该公司能够将这些模型整合到真实的生产和服务场景中,我们将见证机器人技术的质的飞跃。然而,考虑到缺乏具体时间表和定价,距离大规模部署和公众访问,至少还需要数年的密集测试。