机器人看一段视频,29秒学会新技能
图:HOST作者项目页(官方任务图裁切)北京理工大学等团队开源HOST,让机器人在推理时从一段人类演示视频获取新操作技能。论文报告平均准备时间29秒,在基准对比子集上的平均成功率为62%,但结果仍来自受控实验而非开放场景部署。
北京理工大学等机构的研究团队7月22日在arXiv提交HOST论文,并开放项目页和训练代码。它要解决的问题是:机器人遇到新任务时,能否只看一段人类演示,而不为每项任务重新采集大量机器人数据和微调模型。
HOST全称为Human-to-robot One-Shot Skill AcquisiTion。使用者录制一次人类操作视频后,系统在推理阶段读取这段演示,不修改共享策略的参数,再把视频中的任务进展转换成机器人自己的动作。
方法分成三步:先判断机器人执行到了演示流程的哪个位置,再预测机器人视角下接下来应看到的状态,最后由这些未来观测生成动作。人类视频与机器人轨迹会被映射到同一个任务进度空间,以处理动作速度、视角和身体结构不同的问题。
项目资料称,HOST在50项此前未见的真实机器人操作任务上测试,每项执行20次。论文用于基准对比的任务子集平均成功率为62%,相对论文中的零样本基线提高45%;这些都是作者报告的实验结果。
从演示录制到技能可执行,平均耗时为29秒。与论文中每项任务使用50段机器人演示再微调的较强基线相比,HOST使用的演示数量少50倍,技能获取速度快507倍,并在该比较中取得更高成功率。
新任务通过外部视频上下文提供,而不是写回共享策略权重,因此新增技能不会直接覆盖原有参数。项目还测试了光照变化、陌生物体、场景替换和执行过程中的人为干扰,但这不等于机器人已经能在任意环境中一次看会。
官方项目页公开了多项操作视频,包括放花、擦盘子、整理袜子、清理键盘和收纳物品;GitHub仓库则提供数据预处理、进度对齐、目标耦合和策略训练模块。复现仍需要两套CUDA与PyTorch环境,以及研究者自己的机器人数据。
HOST的价值在于把新技能的现场适配从训练循环移到推理阶段。下一步要看第三方能否复现实验、62%的成功率能否继续提升,以及面对更长任务、失败恢复和真实生产节拍时是否仍能保持速度与稳定性。