伦敦公司Humanoid推出KinetIQ Ascend——一种革命性的类人机器人训练方法,基于在实际生产任务中直接进行试错学习。开发者声称,该技术能将操作精度提升至99.9%,同时达到或超越人类速度。

KinetIQ Ascend扩展了现有框架KinetIQ。与传统模仿学习(机器人仅复制人类动作)不同,新方法采用强化学习(RL)。系统自主重复任务,接收成功或失败信号,并据此持续优化行为。关键区别在于:RL并非在模拟环境中运行,而是全天候在真实设备和生产场景中执行。Humanoid表示,这是首个公开演示的基于视觉的端到端RL,用于在真实双臂类人平台上训练的VLA模型,且部署于实际生产环境。

为何押注RL是范式转变

此前,Humanoid与许多竞争对手一样依赖模仿人类演示。但公司指出:“复制演示的模型无法超越演示者的速度或质量,也无法学习错误的代价。”最后几个百分点的可靠性提升以及向超人类速度的跨越,需要全新方法。KinetIQ Ascend通过在实际任务中持续练习填补了这一差距。这类似于大语言模型的扩展:训练时间越长,成功率越高。

KinetIQ Ascend在三个生产任务中的测试展示了令人瞩目的成果:

  1. 轴承环堆叠:经过RL训练后,吞吐量提升42%——从基础模型的每小时291个增至412个。
  2. 向人类传递物品:吞吐量提升85%,平均任务时长缩短35%,成功率从80%升至98%。
  3. 双手举升容器:经过数天训练,吞吐量从每小时122个增至279个,平均任务时长从22.9秒降至12.8秒,成功率从77.6%升至98.9%。

公司还指出,优化操作中最复杂的环节可提升整体任务效果,且技能可迁移至RL训练中未见过的物体。同时,性能提升通过并行A/B测试与当前基础模型对比得出,这对实际生产环境至关重要——因为光照、物体位置或设备磨损等因素可能改变结果。

工业扩张与巨头竞赛

Humanoid正积极在欧洲构建产业链。公司拥有超过250名工程师和研究人员。近期宣布与博世合作,后者将成为合同制造伙伴,在欧洲市场生产HMND 01机器人。此外,与舍弗勒签署了分阶段约束性协议,计划到2032年在合作伙伴的全球生产基地部署1000至2000台机器人。

KinetIQ Ascend的发布正值类人机器人竞赛加速之际。Figure融资超10亿美元,估值达390亿美元;Apptronik完成9.35亿美元融资;中国自2024年起已向该行业投入至少200亿美元。然而,实际销售仍有限——去年仅售出约12000台类人机器人,主要用于研究目的。

专家观点:KinetIQ Ascend正是将实验室实验与工业应用区分开来的关键一步。从模仿转向基于真实错误的自主学习,是打造真正自主、能在不可预测环境中工作的机器人的唯一途径。如果Humanoid能成功扩展这一方法,我们将见证生产自动化新时代的开端。