伦敦公司Humanoid推出KinetIQ Ascend——一种基于在真实生产环境中直接试错的人形机器人训练创新方法。开发者声称,该技术能以媲美甚至超越人类的速度,将操作精度提升至99.9%。
KinetIQ Ascend的工作原理
KinetIQ Ascend扩展了Humanoid机器人核心框架KinetIQ的能力。关键区别在于采用强化学习(RL)。与被动模仿人类动作不同,系统自主重复任务,接收成功或错误的反馈,并据此优化行为算法。
重要的是,Humanoid不仅在模拟环境中启动RL,还在真实设备和生产场景中全天候运行。据我所知,这是首个基于视觉的端到端RL演示,用于在部署条件下基于真实双臂人形平台训练的视觉-语言-动作(VLA)模型。这从根本上改变了技能训练的方式。
为何押注RL是合理的
此前,Humanoid与多数竞争对手一样,通过模仿人类演示来训练机器人。但这种方法存在根本性局限:复制演示的模型无法在速度或质量上超越演示者,也无法从错误中学习。该公司认为,最后几个百分点的可靠性提升以及向超人类速度的跨越需要不同的方法。KinetIQ Ascend通过在实际任务中持续练习来弥合这一差距,将过程比作大型语言模型的扩展——训练时间越长,成功率越高。
测试结果
Humanoid在三个生产任务中进行了测试。第一个任务中,机器人需从容器中取出钢制轴承环并放置在传送带上。经过RL训练后,吞吐量提升42%,达到每小时412个环,而基础模型为291个。第二个任务——将物品从容器传递给人类——吞吐量提升85%,平均任务时长减少35%,成功率从80%升至98%。第三个任务——以任意方向从桌面双手抬起容器——经过数天训练后,吞吐量从每小时122个增至279个,平均任务时长从22.9秒缩短至12.8秒,成功率从77.6%升至98.9%。
该公司强调,测量是通过与当前基础模型进行并行A/B对比完成的,而非与旧基线对比。这对真实生产环境至关重要,因为结果可能因光照、物体位置或设备磨损而变化。
专家观点
Humanoid的突破不仅是机器人领域的又一步,更是范式转变。从被动复制到基于真实任务的主动强化学习,可能成为将人形机器人从实验室推向大规模工厂的催化剂。如果该公司能规模化这一方法,我们将见证工业自动化的急剧加速。