宇树开源60亿参数具身基座模型:一个模型管桌面也管全身
图:宇树科技(Unitree Robotics)发布的 UnifoLM-WLA-1.0 真机评测画面,G1 机器人搬运衣物走向洗衣机,右侧为头部/腕部视角与推理延迟日志宇树科技9月10日宣布完全开源60亿参数具身基座模型 UnifoLM-WLA-1.0。这是一个视觉-语言-动作(VLA)模型,用一份权重同时覆盖桌面操作和移动全身操作,在 Unitree G1 上跨 64 项真机任务完成评测,训练数据约 2500 小时真实机器人数据。距上一款 UnifoLM-X2 世界模型发布只隔三天。
机器人厂商发模型不稀奇,把整个基座模型连权重一起丢出来才稀奇。9月10日,宇树科技宣布完全开源 UnifoLM-WLA-1.0——一个 60 亿参数的具身基座模型,一份权重同时管桌面操作和整机移动干活。
据第一财经9月10日报道,宇树科技宣布完全开源 UnifoLM-WLA-1.0 具身基座模型,称该模型刷新全球开源模型多项评测 SOTA(state-of-the-art,即当前最好成绩),单模型统筹桌面与全身移动操作,支持跨任务、跨末端执行器泛化。“跨末端执行器”的意思是,换了夹爪还是换成灵巧手,同一个模型都能接着用,不用重训一遍。
架构上这是个两段式的东西。据 Humanoids Daily 9月10日报道,UnifoLM-WLA-1.0 属于 VLA(Vision-Language-Action,视觉-语言-动作)模型,底座是一个叫 UnifoLM-ER-1-4B 的具身推理模块(基于 Qwen3-VL-4B),上面接一个 MMDiT 流式动作专家(flow-based action expert)负责把想法变成关节指令。训练数据约 2500 小时真实机器人数据,其中包含 BitRobot-HIW-500 数据集。
推理那一层的数字也公开了。同一报道称,4B 参数的 ER 模块在 Spatial-Bench、Pixmo-Point、BLINK 等测试上,跑赢了几个体量更大的开源基线模型,包括 RoboBrain2.0-7B、Pelican-7B 和 Cosmos-R1-7B。它的训练配方是把常规图文数据和超过 500 万条具身样本混着练——具身样本包括 3D 边界框、2D 轨迹预测和多图空间问答,目的是既保住通用的多模态理解,又把物理空间感练细。
评测是在真机上做的,不是仿真里。报道称模型在 Unitree G1 平台上跨 64 项真机任务评测,其中 54 项是桌面任务、10 项是全身任务,动作输出同时覆盖末端轨迹、灵巧手/夹爪和下肢移动。宇树公布的评测画面里,策略推理延迟记录在 100 毫秒上下(画面日志显示 97.12 毫秒、100.09 毫秒、104.04 毫秒几档)。抓取、收拾、叠衣服、用工具这类活,恰恰是人形机器人过去最容易翻车的地方。
放在时间线上看,这是三天里的第二发。本站此前报道过,宇树9月7日晚才刚放出 UnifoLM-X2-1.0 的全自主搏击视频,主打的是世界模型驱动的高动态对抗;WLA-1.0 换了个方向,冲的是工业和家务场景里的操作活。本站也报道过英伟达以 129.3 亿美元收购 Hugging Face——开源具身生态正在被两头同时加码,一头是算力和平台,一头是模型权重本身。
宇树科技已宣布 UnifoLM-WLA-1.0 完全开源,公司此前公布的人形机器人累计下线量超过 1.8 万台。