看一遍翻煎饼视频,机器人自己翻了:Skild发布S1
图:Skild AI官方技术博客S1发布页配图Skild AI发布基础模型S1,用一段视频演示代替语言指令指定机器人任务。不做微调即可执行预训练中从未出现过、长达10分钟的任务;官方对照实验显示,在未见过的任务上,10万小时数据规模时语言提示成功率9%,S1的上下文学习为66%。
给机器人看一遍人翻煎饼的视频,它就自己翻了一个——而"翻煎饼"这件事根本不在它的训练数据里。8月25日,美国机器人创业公司Skild AI公开了旗舰机器人基础模型S1,主打一件事:任务不再靠语言描述,而是用一段视频演示来指定。
按现在通行的做法,让机器人稳定完成一个新任务,通常要先收集几十到几百小时的遥操作(teleoperation,人远程操控机器人录数据)数据,再针对该任务微调一个专用策略。Skild把这套流程比作语言模型的"BERT时代"——每换一个应用就要重新收数据、重新微调。S1走的是另一条路:上下文学习(In-Context Learning,即"看例子现学",对应大模型里的提示词),演示进入模型的上下文窗口,模型据此推断意图,再按自己的身体和当前场景生成动作,权重一动不动。
Skild称,这是机器人基础模型第一次在预训练中完全没见过、且长达10分钟的超长任务上展示上下文学习能力。官方公布的四个未训练任务是植物上盆、煎饼、手冲咖啡和套件组装,每个都跨越几十个操作步骤,全部由单次视觉演示驱动,过程中出现了演示里没有明确教的动作,比如挖开土壤给植物腾位置、把滤纸压进滤杯。官方给出的植物上盆时间线是:20点54分,土、花盆、水壶和植物送到办公室;21点16分布景完成开始录制;21点22分录完一段第一人称人类演示;21点27分机器人开始自主执行——从演示到自主执行,11分钟。
支撑这套说法的是一组对照实验。Skild在1000小时到10万小时的数据规模上分别训练了上下文学习策略和语言条件策略,两者使用相同的数据、架构和算力。在预训练见过的任务上,1000小时规模时语言策略成功率53%、上下文学习43%,语言方案更占优;但在未见过的任务上,数据加到10万小时时,语言提示的成功率停在9%,上下文学习达到66%,约7倍差距。公司还称,单次演示的表现大致相当于用约380条后训练数据做微调。
另外几项行为来自公司披露的定性观察:执行中把物体推走、换成别的物体、改变灯光,任务仍能完成;失败时会重试而不是硬着头皮往下走;演示里用水壶浇花但现场只有杯子,它就用杯子;演示者提前把鸡蛋摔了,它反而做了个更稳的动作。Skild的解释是,模型把演示理解成目标的说明,而不是必须逐帧复制的轨迹。
这条路线不止Skild在走。据本站此前报道,Generalist在8月发布的GEN-1.5同样主打"看一次3到12秒的演示就学会新动作"。Skild在技术博客中把这类并行方案列为参照,并称它们覆盖的任务大多是短时的、或本就在预训练分布之内。S1建在英伟达的AI基础设施上,公司表示已与部分合作伙伴把模型投入真实现场测试。
Skild AI称S1的训练细节将在后续系列文章中披露。