RobotJia
🇺🇸 美国·2026-09-13

GPT-6开机械臂:粗活成功95%,精活仍卡在10%

GPT-6开机械臂:粗活成功95%,精活仍卡在10%图:RoboCurve测评报告配图,GPT-6 Astra与Claude Fable 5.1、Fable 5在两项机械臂任务中的完成率与单次成本对比

OpenAI的GPT-6 Astra在真机械臂测试里,把积木放进碗的成功率做到95%,但插拼图这类毫米级精细活只有10%。据公益机构RoboCurve 9月4日公布的测评,Astra在放积木任务中20次成功19次,同条件下Anthropic的Claude Fable 5.1为8次;插拼图任务两者都只成功2次。

大语言模型能不能直接开机器人?RoboCurve给OpenAI新模型GPT-6 Astra做了一轮真机测试,答案一半是惊喜,一半是老问题:粗活几乎包圆,精细活还是卡在最后几毫米。

据RoboCurve 9月4日发布的测评报告,测试用的是I2RT的YAM双机械臂,在其开源评测框架Inspect Robots下运行。模型扮演高层决策策略:每一步读取三路摄像头画面(一路俯视、两路腕部视角)和机器人自身状态,输出机械臂末端的6自由度目标位姿,再交给逆运动学(IK,把目标位置换算成各关节角度)求解器执行。任务有两个:把红色积木放进碗里;捏住圆形拼图中心的小把手,把它放进板上对应的圆槽。

放积木这一项差距很大。报告显示,GPT-6 Astra 20次试验完成19次,成功率95%;Anthropic的Claude Fable 5.1为8次(40%),Fable 5为1次(5%)。Astra平均每次只输出约2100个token(大模型生成的文字单位),Fable 5.1约1.29万个;平均每次用时2.5分钟,Fable 5.1为6.8分钟;按官方标价估算,Astra每次约0.94美元,Fable 5.1约2.12美元。

换成插拼图,差距消失了。Astra 20次只成功2次,和Fable 5.1一样是10%,Fable 5为0次。Astra依然更快更省——每次3.4分钟、约1.36美元,Fable 5.1为5.9分钟、约2.18美元——但就是插不进去。Humanoids Daily在报道中把原因归到行业共性难题:数字世界里的模型不怕误差,真实接触中每个动作都会积累微小偏差,没有高频触觉反馈和柔顺控制,最后几毫米很难纠正。

测试之外,Astra还有一段更出圈的演示。据韩国机器人新闻援引Humanoids Daily报道,OpenAI机器人工程师Thijs只给了Astra一台市售机械臂、一支画笔和一个摄像头,让它去画旧金山金门大桥;Astra没有人工编写关节轨迹,自己摸索出控制方法,并借助摄像头的闭环视觉反馈逐次改进,完成了一幅红蓝水彩风格的画。报道称,这幅画是OpenAI CEO萨姆·奥特曼要走的。本站此前报道过,奥特曼在播客中确认OpenAI“一定会做一台人形机器人”。

RoboCurve的Jay Chooi对趋势给了一个判断:如果目前的进步曲线保持下去,大语言模型可能在两到三年内具备实时控制机械臂的能力。

#OpenAI#GPT-6 Astra#机械臂#大模型