⬢ RobotJia
☰
🇺🇸 美国·2026-09-24

在模拟器里踢了140年球:Skild让机器人跟自己对打,练出了铲球和护球

在模拟器里踢了140年球:Skild让机器人跟自己对打,练出了铲球和护球

Skild AI发布“物理自我对弈”结果:让基础模型S1在英伟达Isaac Sim里和自己最近的版本踢足球,累计模拟140多年后,学会了带球过人、护球、铲球和摔倒后爬起来,再把策略搬到真人形机器人上和人对踢。

Skild AI给机器人找了一个会越变越强的陪练:它自己。这家匹兹堡的机器人公司发布了一项叫“物理自我对弈”(physical self-play)的训练结果,让基础模型S1在模拟器里和自己踢足球,累计踢了140多年。

规则只有一条:进球。S1在英伟达Isaac Sim搭出的虚拟球场里,和自己最近的几个版本对抗;它每进步一点,对手也跟着进步一点,所以每一次变强,都会换来一个更难缠的对手。

Skild描述了这段“成长史”:最初几个模拟月里,它几乎走不稳;到了相当于“上大学”的年纪,它学会了摔倒后自己站起来;再往后,带球过人、用身体护球、铲断对手这些动作陆续冒了出来。公司说,这些战术没有单独设计奖励,是因为能帮它进球才被学会的。

需要分清两个阶段。进入自我对弈之前,S1先练了基本功:不同速度、不同方向的带球和射门,每个动作有自己的奖励,也参考了人类动作示范。自我对弈阶段才不再给示范,只看进球。模型每秒输出50次人形机器人各关节的角度。

踢完这140年,团队把策略搬进了一台真的人形机器人,让它和人、和别的机器人对踢。在四个智能体一起踢的比赛里,已经出现了早期的传球和配合。

S1是Skild上个月发布的基础模型,当时主打看一段示范视频就能做没见过的操作任务(本站此前报道)。Skild的判断是:靠人类数据预训练的模型,上限就是人类水平,要超过人,得让机器人自己跟自己练。公司拿AlphaGo作类比——AlphaGo Zero开始自我对弈三天后,就以100比0击败了原版AlphaGo。联合创始人兼CEO迪帕克·帕塔克(Deepak Pathak)的说法很直接:“这个方法能扩展,我们也会去扩展它。”

足球只是试验场。Skild说,同样的方法正在往日常机器人任务上推,下一次发布会讲更大规模团队里出现的协作行为,从多台机器人一起搬东西,到城市尺度的导航。这家公司本月早些时候刚公布,首次商业部署10个月后,年化收入突破1亿美元(本站此前报道)。

#Skild AI#S1#自我对弈#强化学习#机器人足球#Isaac Sim#英伟达