RobotJia
🇺🇸 美国·2026-07-16

Claude接管宇树机器狗:会写代码,却站不起来

Claude接管宇树机器狗:会写代码,却站不起来

Anthropic红队实测把Claude接上宇树Go2四足、G1人形和Franka机械臂:让它直接控制关节几乎全败,人形机器人瘫倒后站起的成功率为零;但换成让它写代码、指挥预训练策略,成绩立刻大幅改善,且新一代模型进步明显。研究的结论是:机器人的成绩既取决于AI大脑,也同样取决于身体和控制接口。

把大模型往机器人身上装,已经成了行业潮流,但"语言天才"接上真实身体到底行不行,一直缺一份系统实测。7月9日,Anthropic(Claude背后的AI公司)的前沿红队(Frontier Red Team,专门给AI"挑刺"的团队)发布了一份研究,把自家模型真的接上了机器人。

试验台有三种机器人:宇树Go2四足机器狗(12个关节,部署在真机上)、宇树G1人形机器人(29个关节,在模拟环境里跑)、Franka Panda机械臂(7个关节,德国研究用机械臂),另外还有倒立摆这类经典控制关卡。

测试分四层接口,像四种不同的上岗方式:最底层是直接控制,AI亲手拧每一个关节的力道;往上一层是写代码,AI编一段Python控制程序让机器自己跑;再往上是指挥,AI给预训练好的动作策略下命令;最高层是当教练,AI去训练一套自己的强化学习(让机器自己反复试错练出来的)策略。

最底层的结果是惨败。直接控制关节时,模型大多数时候都失败:G1人形机器人从瘫倒姿势站起来,成功率是零;Go2机器狗靠直接控制保持平衡,最多撑2秒。

被测平台之一:宇树 Go2 四足机器狗,12 个关节,部署在真机上
被测平台之一:宇树 Go2 四足机器狗,12 个关节,部署在真机上

机械臂上也一样。在LIBERO(机械臂操作任务基准)测试里,直接控制的完整任务成功率只有0到5.5%。

可一换接口,立刻翻身。让Claude写控制代码,或者去指挥预训练的VLA(视觉-语言-动作模型),表现明显改善,Opus 4.6在VLA监督下的操作任务拿到了有意义的成功率。研究者一句话点破:模型的机器人成绩,既取决于模型本身,也同样取决于机器的身体和控制接口。

导航测试暴露了软肋。让模型找到25英尺(约7.6米)外的目标,它认得出目标,却常常提前"以为自己到了";绕办公室一圈的导航任务,所有受测模型全军覆没。瓶颈不在"看",而在"知道自己在哪":空间自我定位和长程规划是最大短板。有意思的是,给模型配一个指南针式的方位工具,比给深度图、第三人称视角都更管用。

代际进步也很明显。Opus 4.6、4.7和Mythos Preview在重试时调整策略的能力明显更强;综合"具身得分"上,Mythos Preview拿到0.389(满分1分),是受测模型里最高的,也是强化学习环节里少数能持续训练出有效策略的模型。

研究还有个耐人寻味的细节:模型主要依赖最近的上下文,把更早的交互记录删掉,对成绩影响很小;给更多思考时间,对大多数任务的帮助也有限。换句话说,这不是"多想想"就能解决的问题。

这份报告给"大模型直接开机器人"的想象泼了盆冷水,也给行业主流路线背了书:高层交给大模型当"大脑",底层交给专门控制器当"小脑",分工协作在可见的将来仍是现实解。还值得一提的是,测试里的两台主角都来自中国的宇树科技——它们已经成了全球AI实验室的标准试验台。

#Claude#Anthropic#具身智能#宇树
信息来源:Anthropic Research · 本站综合整理改写