伦敦公司Humanoid正式推出KinetIQ Ascend——一种基于真实生产环境中试错法的仿人机器人训练创新方案。据开发者称,该技术能将操作效率提升至99.9%,同时达到或超越人类速度。
KinetIQ Ascend是Humanoid所有机器人核心框架KinetIQ的扩展版本。新方法的关键区别在于采用强化学习(RL)。与简单模仿人类动作不同,系统会自主重复任务、接收成功或失败的反馈,并通过迭代优化自身行为。Humanoid并非在虚拟仿真中运行RL,而是直接在真实设备上、全天候在生产场景中开展训练。据我所知,这是首个公开演示的基于视觉的端到端RL技术,用于在真实双臂仿人平台上训练的视觉-语言-动作(VLA)模型,且部署于实际生产环境。
为何选择强化学习而非模仿学习?
此前,Humanoid与多数竞争对手一样依赖人类示范的模仿学习。但该公司指出,复制示范的模型本质上无法超越示范者的速度或质量,也无法学习错误的代价。要实现最后几个百分点的可靠性提升并达到超人类速度,需要根本性的不同方法。KinetIQ Ascend旨在通过真实任务中的持续实践来弥合这一差距。该公司将此过程比作大型语言模型的规模化:训练时间越长,成功率越高。
Humanoid已在三项生产任务中测试KinetIQ Ascend,成果显著:
- 抓取钢制轴承环:经过RL训练后,吞吐量提升42%——从每小时291个增至412个。
- 向人类传递物品:吞吐量提升85%,平均任务时长缩短35%,成功率从80%升至98%。
- 双臂搬运容器:经过数天训练,吞吐量从每小时122个增至279个,平均任务时长从22.9秒降至12.8秒,成功率从77.6%升至98.9%。
值得注意的是,Humanoid与当前基线模型进行了并行A/B对比测试,这对真实生产环境至关重要——因为结果可能受光照、物体位置和设备磨损影响。该公司还得出两个关键结论:优化操作中最困难的环节可提升整体任务表现,且习得的技能可迁移至RL训练中未见过的物体。
产业链与竞争格局
Humanoid正积极在欧洲构建产业链。公司拥有超过250名专家,办公室分布于伦敦、波士顿和温哥华。今年5月,该公司宣布与博世达成合作,后者将成为其欧洲市场HMND 01型号的合同生产伙伴。此外,Humanoid与舍弗勒签署了分阶段约束性协议,计划到2032年在合作伙伴的全球生产基地部署1000至2000台机器人。
KinetIQ Ascend的发布正值仿人机器人竞赛加速之际。美国Figure公司已融资超10亿美元,Apptronik融资超9.35亿美元,而中国自2024年以来已向该行业投入至少200亿美元。尽管如此,实际销售仍有限:去年共售出约12000台仿人机器人,主要用于研究目的。
专家观点:KinetIQ Ascend是向前迈出的重要一步,解决了现代机器人技术的核心问题:从实验室演示过渡到可靠的工业应用。在真实环境中而非仿真中从自身错误中学习的能力,使机器人能够适应不可预测的条件。如果Humanoid能成功扩展这一方法,我们将见证的不仅是进化,而是生产自动化领域真正的革命——机器人将不再是简单的工具,而是能够自主学习、全面协作的团队成员。