跳到正文
北京时间
原文
Mistral AI:News·· 2026-07-07精选AI 评分62

Mistral AI 发布 Robostral Navigate 具身导航模型

Research Introducing Robostral Navigate Robostral Navigate, our first model built for embodied navigation. July 8, 2026 By Mistral

AI 导读

Mistral AI 发布其首个具身导航模型 Robostral Navigate,为 8B 模型,仅用单个 RGB 相机即可根据自然语言指令驱动机器人自主导航,在 R2R-CE validation unseen 上达到 76.6% 成功率,比最佳单相机方法高 9.7 个百分点,比使用深度或多相机的最佳系统高 4.5 个百分点。

推荐理由

官方发布具备完整技术细节,单 RGB 相机在 R2R-CE 上超越多传感器方案,训练方法对机器人导航团队有直接参考价值。

正文 · AI 翻译

Thinking

Summary

Robostral Navigate 是一个 8B 模型,使机器人仅使用单个 RGB 摄像头即可在复杂环境中自主导航,在未见过的 R2R-CE 基准测试上达到 76.6% 的成功率——超越多传感器方案,同时更加高效。它完全由内部构建,使用模拟数据和 token 高效技术,可跨机器人类型泛化,并适应训练中未见过的真实世界障碍物。该模型将基于指向的导航与强化学习相结合以实现持续改进,为机器人领域的统一具身 AI 铺平了道路。

今天我们推出 Robostral Navigate,这是我们首个为具身导航构建的模型。它是一个 8B 模型,接收 RGB 图像和自然语言指令,并驱动机器人穿越环境:

“离开大厅,穿过走廊,进入补给室,然后停下并面向第二个货架。”

为执行此类任务,其他模型通常采用深度传感器、LiDAR 或多个摄像头协同工作。Robostral Navigate 仅使用一个普通 RGB 摄像头,不使用深度传感器,却在 R2R-CE(Room-to-Room in Continuous Environments)验证未见集上达到 76.6%,该基准用于在训练中未包含的环境中遵循指令。因此,它比最佳单摄像头方案高出 9.7 个百分点,比使用深度或多摄像头的最佳系统高出 4.5 个百分点,尽管它两者都未使用。

导航

我们的模型专为机器人导航而设计,使机器人能够在复杂环境中自主导航,包括办公室、住宅和商业建筑以及户外环境。

Robostral Navigate 在一个正在使用的办公室中,完全自主地执行一条长时程指令路线。

这项技术为制造业、配送、物流和酒店业开启了众多应用,使其成为我们客户当今最需求的能力之一。给 Robostral Navigate 一条指令,它就能自行完成整个任务,穿越一个充满人和从未展示过的障碍物的真实空间,并能够适应任何环境。

亮点

  • 在 R2R-CE 上达到最先进性能

    • 验证已见集上 79.4% 成功率

    • 验证未见集上 76.6% 成功率

  • 仅使用单个 RGB 摄像头运行,无需 LiDAR 或深度传感器

  • 8B 模型,内部构建并完全在模拟中训练

  • 可在轮式、腿式和飞行机器人上运行,并跨机器人尺寸泛化

  • 对摄像头内参差异具有鲁棒性

  • 通过前缀缓存实现 token 高效训练

通过指向进行导航

给定任务和观测历史,Robostral Navigate 通过指向预测机器人下一步应移动到哪里:它推断目标位置在机器人当前摄像头视图中的图像坐标,以及到达时的期望朝向。与依赖度量位移的命令不同,指向使策略天然对摄像头内参和世界尺度的变化具有鲁棒性。

然而,该方法无法处理目标位置位于当前视野之外的情况。当指向不适用时,模型回退到机器人局部坐标系中的位移,例如:

“向前移动 2 米,向左移动 1.5 米,然后向左转 25 度。”

从零构建

Robostral Navigate 完全由内部构建,不依赖现有的开源 VLM。

该模型从我们的视觉语言模型初始化而来,该模型专门针对指向、计数和物体定位等 grounding 任务进行了优化。导航能力是这些能力的自然延伸:一旦它理解了物体的位置,就能学会如何移动。

我们完全在仿真环境中构建了一条高效的数据生成流水线。这使我们能够快速迭代数据,最终生成了一个约 240 万条轨迹、覆盖 35 万个场景的数据集。

高效监督训练

Robostral Navigate 的一个关键要素是基于前缀缓存的高效训练算法。通过基于树的注意力掩码策略,我们的方法将整个 episode 压缩为单个序列,从而能够在单次前向传播中训练所有时间步,同时防止时间步之间的信息泄漏。

与每个时间步训练一个样本相比,我们的方法在保留所有学习信号的同时,将训练 token 数量减少了 22 倍。在实践中,该方法将原本需要数月的训练运行转变为数天即可完成的运行。

在线强化学习

我们利用在大规模后训练 LLM 方面的知识,使用在线强化学习来提升 Robostral Navigate 的性能。在监督训练阶段之后,我们使用 CISPO 这一在线强化学习算法进一步提升模型性能。这使模型能够从试错中学习、从失败中恢复,并获得探索行为,有效缓解了原始行为克隆的分布偏移问题。仅此一项就将成功率提升了 3.2%。我们尚未看到任何平台期,因此我们相信更多的训练和实验将继续推高这一数字。

下一步

Robostral Navigate 只是迈向统一具身智能体的第一步。

我们相信导航是通用机器人的一项基础能力。通过结合大规模仿真、高效训练和强大的 grounding 先验,Robostral Navigate 证明,仅凭一个紧凑模型和单个 RGB 摄像头即可实现最先进的具身导航。

开启您通往具身前沿 AI 的旅程,与我们的团队交流。

顺便说一句,我们正在招聘!

我们导航模型的发布标志着向前迈出了重要一步,但我们的旅程远未结束。我们的目标是让机器人能够自主导航复杂环境——办公室、家庭、商业建筑和户外空间——还有很多工作要做。我们正在积极扩充机器人团队,寻找与我们志同道合的优秀研究科学家和工程师。

如果您有兴趣加入我们,共同实现为各地机器人带来无缝导航的使命,欢迎您申请加入我们的团队!

作者:Théo Cachet、Arjun Majumdar、Srijan Mishra、Thomas Chabal、Chris Bamford、Elliot Chane-Sane、Benjamin Tibi、Ludovic Ho Fuh、Olivier Duchenne - AI Science Robotics

来源:Mistral AI:News · mistral.ai