RobotJia
🌐 全球·2026-07-12

法国AI大厂杀进机器人:一个摄像头,让机器听懂人话自己走

法国AI大厂杀进机器人:一个摄像头,让机器听懂人话自己走

法国AI公司Mistral在2026年7月8日发布首个机器人导航模型Robostral Navigate:80亿参数,只靠一个普通RGB摄像头,就能听懂'走到走廊尽头第二个货架前'这种大白话指令自主导航,不用昂贵的激光雷达。它全程在仿真里训练,在权威基准R2R-CE上拿到76.6%成功率,反超了用多摄像头和深度传感器的方案。

一直以来,机器人要在陌生环境里自己走路,标配是激光雷达(LiDAR,靠激光测距建图)加一堆传感器,又贵又复杂。以做大模型出名的法国公司Mistral,7月8日抛出了一个反方向的答案:只用一个普通摄像头,也能让机器人听懂人话、自己找路。

这个模型叫Robostral Navigate,是Mistral的第一个具身智能(embodied AI,让AI控制实体机器的技术)导航模型,参数规模80亿(8B)。它是一个视觉-语言模型(能同时看懂画面和文字),输入就两样东西:摄像头拍到的实时画面,加一句大白话指令。

指令可以很日常,比如'离开大厅,穿过走廊,进入储物间,停在第二个货架前'。模型会把画面和这句话一起理解,当场算出该往哪走,不需要事先给它一张地图,也不用接激光雷达或深度相机。

省掉传感器不等于偷工减料。Mistral说Robostral Navigate完全在仿真环境里训练:用了约40万条行进轨迹、覆盖6000个不同场景,再通过在线强化学习(让模型在试错中自己变强)持续打磨。

成绩单也拿得出手。在业内权威的室内导航基准R2R-CE上,它的成功率达到76.6%,比此前最好的单摄像头方案高出9.7分,更关键的是——比用了深度相机或多摄像头的最强方案还高4.5分。用更少的硬件,做到了更好的结果。

它还不挑机器人:轮式、足式、飞行平台都能用,不限机器大小。Mistral点名的落地场景包括制造、配送、物流和酒店服务,都是'把东西从A搬到B'需求最密集的地方。

对Mistral来说,这一步的野心不止导航。公司把它定位成迈向'统一具身智能平台'的第一块砖——先让机器人学会自己走路,再逐步往通用机器人大脑上叠。作为欧洲对标OpenAI的AI旗手,Mistral这次是正式把战线拉到了物理世界。

冷静地看,'纯仿真训练'恰恰是最大的问号。仿真里再逼真,也和真实世界的光照、反光、玻璃门、突然窜出的人有差距,这就是业内说的'仿真到现实鸿沟'(sim-to-real gap)。单摄像头在昏暗、空旷或高度重复的真实环境里能不能稳住,基准分数之外,还得看真机长期跑下来的表现。

#Mistral#具身智能#机器人导航#视觉语言模型
信息来源:Mistral AI · 本站综合整理改写