宇树开源第二天,智元也开源:3万小时喂到成功率44.1%
图:Humanoids Daily报道配图,智元机器人GE-Act 2.0实验室测试场景智元机器人开源了世界-动作模型GE-Act 2.0,零样本成功率从17.1%升至44.1%。据Humanoids Daily报道,该模型从零在具身操作数据上预训练,而不是给文生视频模型外挂机器人控制;零样本测试覆盖100个操作任务,训练数据从300小时加到30000小时。发布时间紧跟宇树开源UnifoLM-WLA-1.0的第二天。
中国两家头部人形机器人公司,过去一年比出货量比得面红耳赤,这个星期突然都开始比开源——而且只隔了一天。
据Humanoids Daily 9月11日报道,上海的智元机器人(AGIBOT,智元机器人)正式开源了Genie Envisioner Act 2.0(GE-Act 2.0),一个用来训练通用操作策略的世界-动作模型(World-Action Model,简称WAM)。就在前一天,宇树刚开源了60亿参数的UnifoLM-WLA-1.0。据本站此前报道,宇树那款模型主打一个模型同时管桌面机械臂和全身人形;智元这次给的是另一条路子。
区别在“从哪来”。报道称,目前多数具身智能模型的做法是拿现成的文生视频模型,再给它外挂一套机器人控制;GE-Act 2.0则是把视觉分词器、未来状态预测器和动作生成器全部从零开始、直接在具身操作数据上训练。
常规的VLA(视觉-语言-动作)模型把摄像头画面和语言指令直接映射成电机指令,相当于把物理交互当成文字接龙来做——它没有显式地建模“物体被碰到之后会怎么动”。世界-动作模型的思路是先想象下一帧画面应该长什么样,再决定怎么动。麻烦是视频生成慢、吃显存,塞不进实时控制回路。GE-Act 2.0的解法拆成三块:视觉分词器把画面压缩64倍、只留几何轮廓和运动、扔掉背景装饰;视觉规划器一次前向就把未来画面“想”出来,不做几十步迭代去噪;再由一个逆动力学模型把想象出的画面变化反推成关节动作。
报道里最有意思的是智元命名的“有效性鸿沟”(validity gap)。让机器人抓杯子,从左边伸手和从右边伸手都对,但人类示教数据只录下了其中一条路。如果模型想象的是从右边靠近,录下来的示范却是从左边,传统训练就会一边让它看着右边的想象、一边逼它做左边的动作——两种正确策略互相抵消,策略要么卡住,要么平均成一堆没用的动作。智元为此做了KASO(知识对齐的选择性优化):训练时让视觉规划器想出好几种未来,再由动作网络筛出真正和示范对得上的那一个,才拿去更新权重。真机消融测试里,加上KASO后抓取成功率从22.5%升到37.5%。
规模效应这块给了完整的阶梯数据。智元按300、1200、5000、30000小时四档交互数据分别训练,语料混合了双足G1-OP和工业轮式G2平台的遥操作记录、Genie Sim 3.0合成仿真、开源数据集,以及大约2000小时未经筛选的失败数据。评测不做针对性微调,直接零样本跑分布外任务,覆盖20个操作类别下的100个原子任务,桌面布置、光照和物体都是没见过的。结果:G1-OP的成功率从300小时的17.1%一路升到30000小时的44.1%,能完成的技能数从39项升到76项;工业轮式G2-90D从13.4%升到31.1%。曲线一直在涨,还没有走平。跨本体迁移也出现了:G2-90D在联合训练数据里占比不到2%,成功率却涨了17.7个百分点;像分纸杯、翻杯垫这类它自己训练数据不到1小时的任务,靠的是从别的机器人身上学到的空间动力学。数据审计还看到一条可预测的对数线性曲线——擦桌面这类喂了824小时的高频类别可靠性到76.7%,而扫地这类只有64小时的类别停在3.3%左右,喂多少大致决定学成什么样。
智元此前已开源AGIBOT WORLD 2026数据集与Genie Studio工具链。