Qwen-Robot Suite:面向物理世界智能的基础模型套件
Qwen-Robot Suite: A Foundation Model Suite for Physical World Intelligence
Qwen 发布三款基础模型——Qwen-RobotNav、Qwen-RobotManip 和 Qwen-RobotWorld。Nav 通过可控观测协议统一指令跟随、点/物体目标导航、目标追踪和自动驾驶五类任务,在 VLN-CE RxR 上达 76.5% SR,HM3Dv2 物体目标导航(仅 RGB)75.6% SR,EVT-Bench 追踪率 90.0%,NAVSIM 91.4 PDMS。Manip 利用规范状态-动作空间对超 38,100 小时异构开源机器人数据进行跨本体训练。World 通过自然语言动作接口协同训练 20 余种本体,预测操控、驾驶和导航的物理未来。三者共同将通用智能转化为物理行动。
Qwen把导航、操作和世界模型打包成机器人基础套件,用统一语言接口串起来,这是具身智能从单点突破走向系统化的信号,虽然离真实世界还有距离,但方向很清晰。
简而言之,通义千问(Qwen)系列基础模型已经能够对物理世界进行强大的感知与推理。但看得见并不等于做得到:视觉与语言理解和物理控制之间的鸿沟,仍然是具身智能的核心瓶颈。Qwen-Robot Suite 通过三个基础模型弥合这一鸿沟——Qwen-RobotNav、Qwen-RobotManip 和 Qwen-RobotWorld。Nav 通过可控制的观测协议统一了五个导航任务族。Manip 将异构机器人数据转化为一致的规范空间,从而实现大规模的跨具身训练。World 在单一世界模型下,通过自然语言动作接口对 20 多种具身形态进行联合训练。三者共同构建了一个智能体系统,让通用智能直接转化为物理动作。
通义千问(Qwen)系列多模态基础模型在理解物理世界方面取得了显著进展。Qwen-VL 能够解析复杂的空间关系、在杂乱场景中识别物体、遵循多步视觉指令,并对物理构型进行推理,为物理智能体提供了初步的认知基础。VLM 已经能够用语言进行规划:“去厨房,找到红色杯子,把它拿起来,放到架子上。”
但理解物理世界并不等同于在其中行动。一个能够规划这些步骤的 VLM,无法生成执行这些步骤的运动指令。这从根本上是一个对齐挑战:语言指令与物理动作信号处于不同的表示空间,而弥合二者所需的远不止感知本身。让这件事更难的是,弥合这一差距所需的具身数据与互联网文本有着本质不同。它天然具有异构性,采集成本高昂,且多样性狭窄。一条导航轨迹、一次遥操作抓取、一段行车记录仪视频,分别处于互不兼容的动作空间、观测格式和具身形态之中。简单地把它们汇聚在一起,产生的是冲突而非协同。
Qwen-Robot Suite 通过三个基础模型弥合了这一差距——Qwen-RobotNav、Qwen-RobotManip 和 Qwen-RobotWorld——每一个都将语言与不同的物理动作领域对齐。我们追求跨语言指令的泛化能力以及对物理规律的遵循,并在这两方面都取得了显著进展。在这篇文章中,我们还探讨了这些模型作为构建通用智能体系统的底层工具的潜力。
Qwen-RobotNav:物理智能体的移动之门——通过可控观测编码和面向智能体系统的工具接口,将视觉-语言表示空间桥接到移动动作,统一了指令跟随、点/物体目标导航、目标跟踪与自动驾驶。Qwen-RobotManip:物理智能体的交互之基——通过规范化的状态-动作空间和相机坐标系下的增量位姿,将视觉-语言表示空间桥接到操作动作,从而能够在超过 38,100 小时的开源语料上进行连贯的跨具身训练。Qwen-RobotWorld:物理智能体的无限世界——通过自然语言动作接口,将视觉-语言表示空间桥接到世界动态,使单一世界模型能够跨操作、驾驶和导航预测具有物理依据的未来。
每一个都有各自的技术报告和深度解析博客。本文讲述的是它们如何彼此契合的故事。
Qwen-RobotNav:物理移动之门#
导航
在智能体能够操作任何东西之前,它必须先到达那里。移动导航涵盖的任务对记忆的需求有着根本性的不同:指令跟随需要长时程上下文,而目标跟踪几乎只关心最近的帧。没有任何一种固定的观测策略能同时满足两者。
Qwen-RobotNav 基于 Qwen3-VL 构建,通过一个参数化导航接口解决了这一问题,该接口包含两个互补的维度:用于选择导航行为的任务模式(指令跟随、物体搜索、目标跟踪、自动驾驶),以及可控的观测参数(token 预算、时间衰减、各摄像头权重、帧采样模式),这些参数决定了视觉历史如何被编码。Qwen-RobotNav 在 1560 万个样本上进行训练,并在视觉-语言数据上联合训练以保持有根基的感知,它将五个任务族统一在一组权重之下。该参数化接口还使 Qwen-RobotNav 成为智能体系统的天然构建模块。一个上层规划器(Qwen3.7-Plus)将长时程目标分解为子任务,并在任务执行过程中动态切换 Qwen-RobotNav 的任务模式和上下文策略,通过对同一模型的重复调用来组合出复杂行为。这将系统扩展到具有持久记忆的长时程推理,使其能够解决需要多步导航、证据收集和有根基响应生成的复杂用户意图。
5 个领域
8 项 SOTA
一个模型统一 VLN、ObjNav、
跟踪、驾驶与 EQA
上下文
= 接口
4 轴观测协议
零架构改动
智能体
将导航作为工具调用
- 两级记忆
提升了 EQA 的新标准
泛化能力
真实场景单摄像头
在未见环境中的部署
统一多域导航:单一模型、单一套权重在 5 个导航域上均达到 SOTA:VLN-CE RxR 上 76.5% SR,HM3Dv2 object-goal 上 75.6% SR(仅 RGB,超越基于深度的方法),EVT-Bench 上 90.0% 跟踪率,NAVSIM 上 91.4 PDMS,并在 3 个 EQA 基准上创下新最佳成绩,且从 2B 到 8B 参数呈现一致的扩展性。可控观测协议:四个维度(视觉 token 预算、时间衰减、逐相机加权、帧采样模式)作为推理时参数暴露,并在训练时对每个样本随机化,从而无需重新训练或修改架构即可实现任意推理时配置。智能体导航系统:被设计为双层系统中可重构的导航原语,其中上层规划器(Qwen3.7-Plus)分解长时程目标并派发可配置的导航调用,同时维护两级记忆,在 EXPRESS-Bench 上取得 +15.4% 的提升,且相比此前最佳方法导航步数减少 77%。真实环境泛化:以零样本方式部署在 Unitree Go2 四足机器人上,仅使用其单个低分辨率内置摄像头,展现出对真实环境和无约束自然语言指令的强大泛化能力,且无需任何针对特定环境的微调。
对 Qwen-RobotNav 进行基准测试
部署
以零样本方式部署在 Unitree Go2 四足机器人上(NVIDIA Jetson Thor,196ms 延迟),仅使用内置低分辨率摄像头。该机器人能够在一个此前未见过的公寓中跨多个房间执行逐步口头指令。
我们在一个未见过的展厅中评估一项往返导航任务:机器人首先按照语言指令从客厅导航 21.78 m 到达医院病房,随后接收反向指令,必须精确地沿整条路线原路返回。这项任务尤其具有挑战性,因为它要求模型在长距离上保持空间感知,在正向和反向两个方向上对多样化的视觉地标进行 grounding,并纯粹依据语言执行精确的双向位置控制。
跨具身
同一套权重同时服务于腿足机器人导航和自动驾驶。在 NAVSIM 闭环驾驶中,Qwen-RobotNav-4B 达到 91.4 PDMS。
阅读 Qwen-RobotNav 博客 →
Qwen-RobotManip:物理交互的基础#
操作
物理智能体需要与真实世界交互——例如,用机械臂完成操作任务。然而,生产线上的工业机械臂和厨房中的服务机械臂可能执行视觉上相似的抓取动作,却拥有完全不同的关节配置和动作空间。核心挑战在于让异构具身在本体表示上相互兼容,从而使跨机器人和数据源的规模化扩展产生协同效应而非冲突。
Qwen-RobotManip 基于 Qwen3.5-4B VL 构建,并配备流匹配 DiT 动作头,引入了三种机制来解决这一问题。一个统一的 80 维状态-动作表示在单臂、双臂、灵巧手和移动形态之间共享。相机坐标系下的末端执行器增量位姿动作,使视觉上相似的运动在不同机器人之间在数值上彼此接近,从而抽象掉形态差异。上下文策略自适应将执行历史读取为隐式的形态签名,以实现即时自适应。
一旦表示框架统一,数据壁垒便随之消失。我们在 11,320 小时的开源机器人数据、1,933 小时的开源第一人称人类视频,以及通过我们的 Human-to-Robot 合成流水线从人类视频合成而来的、涵盖 15 种形态的 24,808 小时机器人演示数据上训练 VLA 模型——总计超过 38,100 小时。仅使用开源数据,该模型就已展现出涌现的泛化能力,包括对扰动的鲁棒性、零样本指令遵循、反应式错误恢复以及跨形态迁移。
对齐
表示 · 运动 · 行为
三维对齐
仅使用开源数据
38K 小时操作数据
涵盖 15 种形态
占主导
分布外泛化
在所有基准测试上
RoboChallenge Table30 v1 通用赛道
横扫前二,领先第三名 20%
统一跨具身对齐框架——统一的 80 维状态-动作表示可容纳多种具身形态,相机坐标系下的末端执行器增量位姿使视觉上相似的动作在数值上也相近,而上下文策略自适应将执行历史作为隐式具身标识符来读取——三者共同实现了跨具身形态的一致信号提取。大规模人到机器人合成——一条流水线通过动作重定向、手部移除与图像修复、模拟渲染以及深度引导合成,将 1,933h 的第一人称人类视频转换为覆盖 15 种具身形态的 24,808h 机器人演示数据,并配合多阶段数据筛选流水线以确保数据质量。分布外泛化:LIBERO-Plus 91.4%(较 π0.5 提升 +7.0),RoboTwin-C2R Hard 69.4%(较 π0.5 提升 +21.5),RoboCasa365 Composite-Unseen 14.9%(次优结果的 3 倍),EBench 45.6%(较次优结果提升 +18.5);RoboTwin-IF 72.0%(较 π0.5 提升 +22.4),证实了真正的语言条件控制能力;在 RoboTwin-XE 上达到次优结果的 3 倍,展现出零样本跨具身迁移能力。强劲的真实世界表现:在 RoboChallenge Table30 v1 通用赛道以 45% 成功率位列第一,横扫前二并领先第三名 20%;在真实机器人平台上得到验证,在域内和分布外任务上达到此前 SOTA 的 2 倍,并具备少样本自适应和跨具身技能迁移能力。
关键发现——对齐是规模化的前提。只有具备统一跨具身表示(UnifiedSpace + UnifiedEEF)的模型,才展现出清晰的对数线性数据缩放规律。若缺乏对齐,增加更多数据只会产生 erratic 或平坦的曲线——规模无法弥补一个存在缺陷的公式化设计。
多样化的真实世界任务
单一通用策略即可处理跨越多样任务类别、场景和物体的复杂操作。
在真实世界环境(上排)和仿真环境(下排)中遵循多样化的未见指令。
跨具身迁移
在其他具身上训练的任务可零样本迁移至新具身(上排);少样本演示可实现对全新任务的快速适应(下排)。
阅读 Qwen-RobotManip 博客 →
Qwen-RobotWorld:无限机器人世界#
试想一下,真实世界经验是机器人领域最稀缺的资源。Qwen-RobotWorld 通过直接学习世界的状态转移函数来解决这一问题:给定当前观测和自然语言动作,它预测世界接下来会是什么样子。关键的设计选择是用自然语言表达所有动作——这将末端执行器位姿、转向指令和导航路点转换为统一接口,使得 20+ 种具身类型和 500+ 种动作类别能够在具身世界知识语料库(860 万视频-文本对,2 亿+ 帧)下联合训练。一个 60 层双流 MMDiT 将 Qwen2.5-VL 的语义表示与视频潜变量耦合。使用完整的多模态 LLM 作为动作编码器——而非轻量级文本编码器——是至关重要的:它带来了内化的世界知识,即手臂是刚体、流体会扩散、物体会下落,隐式地将生成约束为物理上合理的未来。每个领域都强化其他领域:操作教会接触物理,驾驶教会 3D 几何,导航教会房间尺度的空间推理。
顶级
横跨
4 项基准测试
20+
机器人具身形态
统一
860 万
跨场景
训练对
1300+
操作
技能
语言驱动的统一动作接口——自然语言将 20+ 种机器人本体和 500+ 种动作类别标准化为统一的训练接口,使操作、驾驶、导航以及人到机器人的迁移能够联合训练;每个领域都强化其他领域 双流 MMDiT + Qwen2.5-VL 动作编码器——以完整的多模态 LLM 作为动作编码器(而非轻量级文本编码器),将复杂的组合指令解析为精确的生成信号,并内化物理世界知识,充当合成数据引擎、闭环策略评估器和动作规划器 排名:在 EWMBench 上综合排名第一(运动保真度比第二名高出 +33%)以及 DreamGen Bench;在 WorldModelBench 上开源排名第一(在牛顿定律、质量守恒、流体动力学方面实现完美的物理遵循)以及 PBBench 能力:细粒度语言 grounding(更改一个关键词 → 不同的未来);跨 8+ 种本体的人到机器人迁移,具备多视角一致生成;在 RoboTwin-IF 上的零样本鲁棒性
任意指令遵循
更改单个关键词——物体、目的地或动作动词——就会产生相应不同的未来。该世界模型真正理解语言,而不仅仅是模式匹配。
不同物体
拿起红色草莓
拿起黄色土豆
不同具身形态
组装相机部件
组装相机部件
不同目标位置
将笔放在木质托盘上
将笔放在白纸上
不同动作
向前挤出胶水
将胶水放入笔筒
多视角一致性生成
给定单条指令,Qwen-RobotWorld 可在多个相机视角下生成时间与空间一致的视频——这对于仿真到现实的迁移以及多相机策略训练至关重要。
查看更多多视角示例(另有 16 个)
人类 → 机器人迁移
给定人类演示,Qwen-RobotWorld 可跨多种具身形态生成逼真的机器人执行过程——无需遥操作。
ARX-L5
人类演示
机器人执行
xArm7
人类演示
机器人执行
Franka Panda
人类演示
机器人执行
Sawyer
人类演示
机器人执行
查看更多实施例(Kinova Gen3、Piper、KUKA iiwa、Kinova Jaco)
Kinova Gen3
人类演示
机器人执行
Piper
人类演示
机器人执行
KUKA iiwa
人类演示
机器人执行
Kinova Jaco
人类演示
机器人执行
自动驾驶与室内导航
驾驶教会模型大规模 3D 几何与多智能体动态;导航教会模型房间尺度的空间推理。每个领域都会强化其他领域。
驾驶
室内导航
阅读 Qwen-RobotWorld 博客 →
从模型到智能体:闭环
每个模型都各自独立可用——但由于三者都提供语言优先的接口,通用 Qwen 模型可以将它们作为物理世界工具进行组合,从而将通用智能与物理行动连接起来。我们有一个内部项目 Qwen-RobotClaw,这是一个机器人智能体框架,允许 Qwen VLM 智能体将 Qwen-Robot Suite 模型作为物理世界工具进行调用,同时妥善管理长时程任务所需的上下文与记忆,推动物理智能迈向更通用、更复杂的真实世界应用。以下是这所能实现的早期示例。
开放式任务执行
Qwen-Omni 观察场景,通过语音随机提出操作任务,并实时判断执行情况。每个视频都展示了 Qwen-RobotManip 在没有预定义任务列表的情况下即时完成任务——这表明通用多模态模型可以充当任务提出者和评估者,而套件模型负责物理执行。
长时程操作
我们开发了一个由 VLM 驱动的智能体式 VLA 系统,其中基础 Qwen-3.5 模型充当高层规划器,Qwen-RobotManip 负责低层执行。借助其在场景理解、空间推理和任务进度评估方面的能力,Qwen-3.5 将复杂的高层指令分解为一系列原子子任务,随后由 VLA 执行。这种分工显著提升了对 OOD 场景和指令的鲁棒性。
我们用一个在杂乱桌面(带有一个篮子)上的清理桌面任务来说明这一点。面对这样一个完全 OOD 的场景和抽象指令,直接使用 VLA 模型会表现出明显异常的行为(右图)。以 Qwen-3.5 作为规划器,系统会实时将任务分解为细粒度的原子子任务(左图),使 VLA 能够一次只专注于一个简单步骤,并展现出组合泛化能力。
我们还观察到,子任务分解有助于系统从失败-重试循环中恢复。当高层 VLM 检测到执行停滞时,它会通过发出新的子任务来重新规划,使系统能够恢复进展并最终成功完成任务。
智能体 + VLA(成功)
仅 VLA(失败)
智能体导航与具身问答
通过将智能体系统与 Qwen-RobotNav 相结合,我们在长时程 3D 物理世界探索任务上相较此前的最优结果取得了大幅提升,涵盖 HM-EQA、MT-HM3D 和 EXPRESS-Bench 等具身问答基准。我们还能将同样的开放世界探索能力部署到真实环境中,如下方演示所示。我们将在后续更新中发布更多技术细节。
在第一个演示中,用户要求智能体在一栋真实建筑中找到一间开放的洗手间。智能体扫描环境,沿着走廊层面的线索寻找洗手间标识,发现第一间洗手间因可见的“Cleaning in Progress / 暂停使用”标牌而不可用,随后重新规划,前往建筑另一侧寻找替代方案。在通过视觉证据确认第二间洗手间开放且可进入后,它返回了一个有证据支撑的答案。
在第二个演示中(此前已随 Qwen3.7-Max 一同发布),智能体调用 Qwen-RobotNav 自主探索一个开放的校园环境,在途中纠正偏差,最终找回了一把丢失的雨伞。
Chat2Robot
我们提供了一项实验性功能——Chat2Robot——你可以直接在浏览器中与机器人对话。只需输入一条自然语言指令,就能观看机器人实时响应。快来试一试,体验 Qwen-Robot Suite 的实际效果!
注意:Chat2Robot 目前仅支持 Qwen-RobotManip。所部署的策略仅在 RoboTwin-Clean 数据集上训练,该数据集只包含 50 个任务——它并非一个完美的策略。我们此处的目标是展示一定程度的零样本指令跟随能力。该功能仍在积极开发中,可能尚未完全打磨完善——我们欢迎你的反馈和建议!
我们感谢 D-Robotics(Digua)对该功能的支持。
下一步是什么#
物理世界智能仍处于起步阶段。富含接触的长时程任务、终身学习、通用规划器与物理世界执行器之间更紧密的集成,以及更丰富的人-机器人-环境交互,这些都仍是未解难题。但路径正变得清晰:从强大的多模态理解出发,将视觉-语言表示空间桥接到每一类物理动作,扩大训练规模,并要求泛化能力。
一个能够去往任何地方、做任何事情、并预见下一步的物理智能体。
那就是终点——而 Qwen-Robot Suite 是我们迈向它的第一大步。
@article{qwenrobotnav, title={Qwen-RobotNav:一种为智能体导航系统设计的可扩展导航模型}, author={Qwen Team}, year={2026}}@article{qwenrobotmanip, title={Qwen-RobotManip 技术报告:对齐释放机器人操作基础模型的规模化潜力}, author={Qwen Team}, year={2026}}@article{qwenrobotworld, title={Qwen-RobotWorld 技术报告:通过语言条件视频生成统一具身世界建模}, author={Qwen Team}, year={2026}}
来源:Qwen:Blog Retrieval(API) · qwen.ai