Mistral 正式踏入机器人赛道,推出 Robostral Navigate——一个 8B 参数的视觉语言模型,仅需单个 RGB 摄像头即可让机器人在未知环境中自主导航。这一动作标志着 Mistral 从纯语言模型向具身智能的延伸。
发生了什么
Robostral Navigate 是一个 8B 参数的模型,专门用于机器人视觉导航。其核心能力是:仅通过单目 RGB 摄像头输入的图像,模型就能理解环境并生成导航指令,引导机器人到达目标位置。模型在仿真环境中训练,并通过名为 CISPO 的强化学习方法进行优化。在 R2R-CE(Room-to-Room Continuous Environment)基准测试中,Robostral Navigate 达到了 76.6% 的成功率。Mistral 尚未公布该模型的开放时间或具体可用形式。
为什么重要
机器人导航传统上依赖多种传感器(如激光雷达、深度相机、多目视觉)或预先构建的地图。Robostral Navigate 仅使用单目 RGB 摄像头,大幅降低了硬件成本和系统复杂度。这得益于 Mistral 在语言模型上的积累——将视觉输入直接映射为导航决策,本质上是将大模型的推理能力迁移到空间感知任务。
Mistral 选择从导航切入机器人领域,而非直接做人形机器人或机械臂控制,是一个务实策略。导航是机器人移动的基础能力,且与视觉语言模型(VLM)的强项(理解场景、生成指令)高度契合。此外,76.6% 的 R2R-CE 成绩虽非顶尖(当前 SOTA 约 80%+),但考虑到模型规模(8B)和传感器简化,这一结果具有竞争力。
影响与看点
对机器人行业而言,Robostral Navigate 展示了一条低成本、低门槛的导航方案。开发者或厂商可能无需昂贵传感器,仅用普通摄像头即可实现类人导航能力。这尤其利好服务机器人、仓储机器人等成本敏感场景。
对 Mistral 自身,此举验证了其模型在物理世界中的泛化能力。未来若将 Robostral 系列扩展到更复杂的操作任务,Mistral 可能成为具身智能领域的重要玩家。值得关注的是:模型何时开放、是否开源、以及在实际物理机器人上的表现(仿真到现实的迁移效果)。
一个独立判断:Mistral 的入局可能加速“大模型+机器人”的融合趋势,但单摄像头方案在光照变化、动态障碍物等真实环境中的鲁棒性仍需验证。


