AI 快讯 编译自 marktechpost #模型发布#机器人#导航

Mistral AI 发布 Robostral Navigate:8B 参数机器人导航模型,单 RGB 摄像头即可在复杂环境中自主移动

Mistral AI 推出 Robostral Navigate,一个 8B 参数的具身导航模型,仅用单 RGB 摄像头和自然语言指令即可驱动机器人。在 R2R-CE 基准上达到 76.6% 成功率,无需 LiDAR 或深度传感器。本文详解其 Pointing 决策机制、Prefix-caching 高效训练和 CISPO 强化学习,并分析对中文机器人开发者的实际意义。

编译发布 2026/07/14 原文发布 2026/07/14

一句话看懂

Mistral AI 发布 8B 参数机器人导航模型 Robostral Navigate,仅用单 RGB 摄像头和自然语言指令,在复杂环境中达到 76.6% 成功率,无需 LiDAR 或深度传感器。

详细发生了什么

Mistral AI 于 2026 年 7 月 14 日发布了 Robostral Navigate,这是其首个面向具身导航的模型。该模型拥有 8B 参数,仅需一个普通 RGB 摄像头和一句自然语言指令(如“离开大厅,穿过走廊,进入储藏室,停在第二个架子前”),就能驱动机器人在办公室、住宅、商业建筑和户外等复杂环境中自主移动。

Robostral Navigate 的核心创新在于其“Pointing”决策方法:模型预测目标在当前画面中的像素坐标,并据此规划移动方向。当目标超出视野时,则回退到局部坐标系下的位移指令(如“前进 2 米,左移 1.5 米,左转 25 度”)。训练方面,Mistral 使用基于 Prefix-caching 的树状注意力掩码策略,将整个轨迹压缩为单个序列,训练 token 量减少 22 倍,将原本数月的训练缩短至数天。随后通过 CISPO 在线强化学习进一步提升 3.2% 的成功率。

在 R2R-CE(Room-to-Room in Continuous Environments)基准上,Robostral Navigate 在验证未见场景中达到 76.6% 的成功率,比最佳单摄像头方案高 9.7 个百分点,甚至比使用深度传感器或多摄像头的系统高出 4.5 个百分点。模型支持轮式、足式和飞行机器人,且对相机内参差异具有鲁棒性。

中文圈视角

Robostral Navigate 对中文机器人开发者有几点直接意义:

  1. 硬件门槛降低:国内许多机器人团队受限于成本,难以配备 LiDAR 或多摄像头系统。单 RGB 方案可大幅降低硬件成本,尤其适合仓储物流、酒店引导等场景。不过,模型本身需要 Mistral 的 API 或本地部署,目前 Mistral 在国内访问可能存在网络限制,需关注其是否提供中国区服务或开源版本。

  2. 与国产方案的对比:国内类似工作如旷视的“河图”导航系统、华为的“盘古”具身模型,多依赖深度传感器或地图先验。Robostral Navigate 的纯视觉端到端方法更具通用性,但训练数据完全来自仿真(6000 场景、40 万轨迹),在真实中文环境(如中国办公楼、住宅)中的泛化能力尚需验证。国内团队可借鉴其 Pointing 机制和 Prefix-caching 训练思路,但需注意仿真到现实的迁移问题。

  3. 监管与合规:机器人导航涉及数据采集(如室内图像),在中国需遵守《数据安全法》和《个人信息保护法》。使用 Robostral Navigate 时,若摄像头采集到人脸或敏感信息,需进行本地化处理或脱敏。此外,模型输出指令直接控制物理设备,安全性要求极高,需额外增加碰撞检测等安全模块。

  4. 中文场景的盲点:原文未提及对中文指令的支持。虽然 Mistral 模型通常支持多语言,但中文导航指令的语义理解(如“穿过走廊”与“走到底”的差异)可能需要额外微调。国内开发者可关注其是否提供中文预训练版本。

几条值得记住的细节

  • 单 RGB 摄像头:无需 LiDAR 或深度传感器,硬件成本大幅降低。
  • R2R-CE 验证未见场景成功率 76.6%:比最佳深度/多摄像头系统高 4.5 个百分点。
  • 训练效率提升 22 倍:通过 Prefix-caching 将数月训练缩短至数天。
  • CISPO 强化学习:额外提升 3.2% 成功率,帮助模型从失败中学习。
  • 支持多种机器人形态:轮式、足式、飞行机器人均可使用,且对相机内参差异鲁棒。

一句话总结

Robostral Navigate 用单摄像头实现了超越多传感器方案的导航性能,为低成本机器人部署提供了新思路,但中文场景的适配和合规问题仍需关注。