Dyna-2发布:100万小时人类视频,把机器人带进Scaling Law时代
图:Dyna Robotics官方发布图(由人类操作视频帧拼合)Dyna Robotics发布世界行动模型Dyna-2:用超100万小时人类视频预训练,首次给出'人类数据→机器人能力'的可预测缩放规律;在陌生客户现场零样本部署通过率87%,远超前代VLA架构的46%。这被多位研究者称为今年最重要的机器人学习进展之一。
机器人学习领域迎来一个里程碑式的发布。8月11日,Dyna Robotics推出世界行动模型(WAM)Dyna-2——用超过100万小时的人类操作视频做预训练,并宣称首次证明了机器人领域的'缩放规律'(Scaling Law,即数据规模可预测地换来能力提升):喂给模型的人类视频越多,它控制一台从未见过的机器人的零样本能力就越强。
机器人学习的老大难一直是数据。遥操作(人拿设备操控机器人示教)能产出高质量带动作标注的数据,但又慢又贵;而互联网上的海量人类视频没有动作标签,此前一直难以直接用于训练。Dyna-2的核心主张,就是把'人类视频'变成了可规模化的主力燃料。
官方公布的数字相当激进:在全新客户现场的零样本部署中,Dyna-2生产环境通过率达87%,大幅超过前代VLA(视觉-语言-动作)架构模型Dyna-1的46%;视频协同训练把语言指令跟随成功率从35%提到67%,继续扩大语料后在内部基准上冲到96%。
架构层面,这次发布正面挑战了行业主流。过去一年,物理智能圈一直在'微调现有语言模型(VLA路线)'与'从头构建世界模型'之间激辩,Dyna-2把宝押在后者:以视频预测(预判画面接下来会怎样)为核心能力,公司称这是跨机器人本体泛化的关键;同时通过一步视频生成蒸馏,把推理延迟降低了两个数量级。
配套动作也说明其野心:同日发布的Mantis UMI手持数据采集设备,让数据采集不再依赖真机遥操作——人拿着采集器干活就是在给机器人'录教材'。多位研究者当天评论称,'机器人预训练的门槛时刻已经跨过',明年可能出现上亿小时级别的预训练。
需要说明证据边界:87%、96%等数字均来自公司自报与内部基准,尚无第三方复现;'缩放规律是否长期成立'也要更大规模验证。但方向意义已经足够清晰——如果人类视频真能持续换来机器人能力,数据竞赛的下一站将不在实验室,而在每个人的日常劳动画面里。
截至2026年8月11日发稿,Dyna-2技术报告已公开,业界评测尚在进行中。