宇树放出全自主搏击视频:世界模型实时开打,不再靠遥控和预设动作
图:宇树科技官网(人形机器人资料图,非本次演示画面)宇树科技9月7日晚发布视频,称其UnifoLM-X2-1.0模型实现了世界模型实时驱动的人形机器人全自主搏击,为全球首次。官方表述是该模型突破了世界-动作大模型在瞬时规划、决策和动态交互执行上的瓶颈,能实时预测和规划未来,验证了世界模型驱动的人形机器人大规模落地部署的基础可行性。
人形机器人打拳,这两年已经不算新闻。真正的分水岭在于,拳是谁打的——是后台的遥控手,还是机器人自己。宇树科技9月7日晚放出的这段视频,给的答案是后者。
据第一财经、界面新闻9月7日报道,宇树科技当晚发布视频称,公司实现了全球首次由世界模型实时驱动的全自主人形机器人格斗。官方表述是:UnifoLM-X2-1.0突破了世界-动作大模型在瞬时规划、决策和动态交互执行等环节的瓶颈,实现高动态、强交互,能够实时对未来进行预测和规划,从而实现人形机器人的全自主搏击。宇树同时表示,这验证了世界模型驱动的人形机器人大规模落地部署的基础可行性。
把术语拆开看。世界模型(world model)指的是让AI在脑子里建一个“接下来会发生什么”的模拟器:给定当前画面和自己要做的动作,先在内部推演出未来几帧的样子,再据此挑动作。它和过去主流的VLA(Vision-Language-Action,视觉-语言-动作模型)路线的区别在于,后者更像看到什么就直接输出什么动作,而世界模型多了一步“先想再动”。搏击之所以是个狠考题,是因为对手在动、接触力在变,留给这套推演的时间以毫秒计——慢一点,预测就作废了。
对比之前的公开演示,这次的差别在“谁在做决定”。2025年11月5日第八届进博会首日,两台宇树人形机器人就在展台上做过擂台格斗表演;此后各类机器人格斗赛事里,机器人多依赖预设动作库或人工遥控。宇树此次强调的是不再依赖预设程序与遥控,由模型实时完成决策与动态交互执行。
从命名也能看出这条线的延续。宇树此前已开源过UnifoLM系列的世界模型+动作方案(UnifoLM-WMA-0)以及UnifoLM-VLA-0,把自己从单纯的硬件厂商往具身智能软件生态上推。X2-1.0是这条线上的新版本,目前公司公布的是演示视频和结论式描述。
宇树在具身智能上的动作值得放在更长的时间线里看。本站此前报道过宇树科技的科创板上市进程,以及其人形机器人累计下线约1.8万台的量产数字。硬件规模跑在前面之后,模型能力能不能跟上,正是这家公司接下来要回答的问题。