蚂蚁给机器人配了双"火眼金睛":LingBot-Depth 2.0 连玻璃镜面都测得准
量子位蚂蚁集团旗下灵波科技 2026 年 7 月 7 日发布空间感知模型 LingBot-Depth 2.0:训练数据从 300 万扩到 1.5 亿,室内缺失场景深度误差 RMSE 从 0.132 减半到 0.062,16 项深度补全测评拿 12 项第一,专攻玻璃、镜面、透明物体等传统深度相机失灵的场景,同步开源视觉基座 LingBot-Vision。
机器人要在物理世界里干活,第一步是"看懂"眼前的空间——哪里是墙、哪里是桌子、物体离自己多远。蚂蚁集团旗下灵波科技 7 月 7 日发布的 LingBot-Depth 2.0,干的就是这件事:给机器人一双能算准距离的"眼睛"。
最直接的进步是数据管够。这一代把训练数据从上一代的 300 万,一口气扩到 1.5 亿——多了近 50 倍。见过的场景越多越杂,模型对陌生环境的判断就越稳。
精度也实打实。在室内大面积信息缺失的场景里,深度误差(RMSE)从 0.132 降到 0.062,几乎砍掉一半;在 16 项深度补全的公开测评里,它拿下 12 项第一。
它专治一个老大难:玻璃、镜面、透明物体。传统深度相机遇到这些会"失灵"——要么反射乱成一团,要么直接看穿过去测不到距离。LingBot-Depth 2.0 把这些最难啃的场景当成主攻方向。
同步发布的还有视觉基座模型 LingBot-Vision,用 1.6 亿张图像做预训练——比业界常用的 DINOv3 小了一个数量级,却是业界第一个把"边界结构"当预训练目标的模型,还开源了 ViT-G/L/B/S 四个版本,方便开发者按需取用。

落地也有着落。灵波与深度相机厂商奥比中光深度合作,把 LingBot-Depth 集成进 SDK 供端侧设备使用,计划年底推出一体化相机产品,RGB-D 版设备已适配优化版本。
把这条放进大图看:具身智能这两年拼"大脑"(决策模型)拼得凶,但"眼睛"(视觉感知)才是机器人干精细活的地基。蚂蚁从视觉底座切入,走的是"卖眼睛"的路子——机器人越多,对这种底层感知模型的需求就越大。