Qwen-RobotManip:对齐解锁机器人操作基础模型的规模化能力
Qwen-RobotManip: Alignment Unlocks Scale for Robotic Manipulation Foundation Models
Qwen-RobotManip 是通义千问基于 Qwen-VL 的视觉-语言-动作(VLA)基础模型,引入覆盖表示、运动和行为三维度的统一对齐框架。仅使用开源机器人数据集和人演示视频,构建约 38,100 小时预训练语料,涵盖 15 种机器人形态。在 LIBERO-Plus 达 91.4%,RoboTwin-C2R Hard 达 69.4%,RoboCasa365 Composite-Unseen 达 14.9%,EBench 达 45.6%,RoboTwin-IF 达 72.0%,并在 RoboChallenge Table30 v1 generalist track 夺冠。模型采用 80 维状态-动作表示、人-机器人数据合成管道(1,933 小时第一人称视频转 24,808 小时数据)及上下文策略适配。
Qwen 这次发布的机器人模型,用统一对齐框架把跨实体数据规模化训练跑通了,OOD 泛化大幅领先,做具身智能的值得认真看一下。
Qwen-Omni × Qwen-RobotManip — Qwen-Omni 观察场景,通过语音随机提出操作任务,并实时评判执行情况。每个视频都展示了 Qwen-RobotManip 在没有预定义任务列表的情况下即时完成任务,展现了开放式指令遵循与泛化能力。
Qwen-RobotManip 在多种真实机器人平台和任务上经过验证,展现出对新场景、未见过的语言指令以及跨具身迁移的强大泛化能力。
查看真实世界评估图库
语言与多模态领域的基础模型之所以能实现卓越的泛化能力,是因为异构数据源可以在统一的表述下对齐,而且丰富的低成本互联网数据让多样化的训练信号能够在大规模下相互强化。但这一规模化配方能否应用于机器人操作?
这极具挑战性。与文本或图像不同,操作数据本质上就是异构的,采集成本高昂,且多样性有限。在不同机器人具身、传感器和任务领域之间对齐表征,同时还要扩展数据规模,一直是一个未解难题。
Qwen-RobotManip 是一个基于 Qwen-VL 构建的、具备泛化能力的视觉-语言-动作(VLA)基础模型。它引入了一个跨操作的表征、运动和行为维度的统一对齐框架,使大规模多源训练变得协调一致而非相互冲突。Qwen-RobotManip 仅使用开源机器人操作数据集和人类演示视频,不依赖任何专有数据采集,构建了约 38,100 小时的预训练语料库,并已展现出涌现的泛化能力。
如果没有统一的跨具身对齐,扩展数据会产生冲突;如果没有数据多样性,仅靠对齐无法实现泛化。对齐与规模是机器人基础模型紧密耦合的前提条件。
核心亮点#
对齐
表征 · 运动 · 行为
三维对齐
仅使用开源数据
38K 小时操作数据
覆盖 15 种具身形态
领先
OOD 泛化
在所有基准测试上
#1
RoboChallenge Table30 v1 通用赛道
包揽前二,领先第三名 20%
统一跨具身对齐框架——统一的 80 维状态-动作表示可容纳多种具身形态,相机坐标系下的末端执行器增量位姿使视觉上相似的动作在数值上也彼此接近,而上下文策略自适应则将执行历史作为隐式具身标识符来读取——三者共同实现了跨具身形态的一致信号提取。大规模人类到机器人合成——一条流水线将 1,933 小时的第一人称人类视频转换为 24,808 小时的机器人演示数据,覆盖 15 种具身形态,通过动作重定向、手部移除与修复、模拟渲染以及深度引导合成实现,并配合多阶段数据筛选流水线以确保数据质量。分布外泛化:LIBERO-Plus 91.4%(较 π0.5 提升 +7.0),RoboTwin-C2R Hard 69.4%(较 π0.5 提升 +21.5),RoboCasa365 Composite-Unseen 14.9%(次优方案的 3 倍),EBench 45.6%(较次优方案提升 +18.5);RoboTwin-IF 72.0%(较 π0.5 提升 +22.4),证实了真正的语言条件控制;在 RoboTwin-XE 上达到次优方案的 3 倍,展现出零样本跨具身迁移能力。强劲的真实世界表现:在 RoboChallenge Table30 v1 通用赛道以 45% 成功率位列第一,包揽前二并领先第三名 20%;在真实机器人平台上得到验证,在域内和分布外任务上达到此前 SOTA 的 2 倍,并具备少样本自适应和跨具身技能迁移能力
扩展操作数据#
人类到机器人数据合成#
机器人操作数据稀缺且采集成本高昂。我们提出了一套 Human-to-Robot 合成流水线,通过人到机器人的重定向、手部移除与修复,以及深度引导的机器人合成,将以自我为中心的人类操作视频转换为覆盖 15 种机器人形态的机器人演示数据。
数据来源#
由此得到的预训练语料库总计超过 38,100 小时,来自三个互补来源:
机器人数据(约 11,420 小时):涵盖单臂、双臂和移动操作的开放源代码机器人数据集。
以自我为中心的人类数据(约 1,933 小时):从开放世界环境中采集的人类操作视频,提供丰富的物体交互和场景先验。
Human-to-Robot 合成数据(约 24,808 小时):由上述以自我为中心的数据在 15 个机器人平台上生成,作为主要的规模化引擎。
数据整理#
我们设计了一套多阶段整理流水线,以确保 VLA 训练数据的质量和标注的正确性。五个状态-动作过滤阶段去除噪声动作、修正时间错位,并验证运动学一致性。随后三个跨模态检查验证语言指令与视频内容匹配、视觉观测与记录的机器人状态一致,以及视频帧无损坏。
Qwen-RobotManip 模型设计#
Qwen-RobotManip 将 Qwen3.5-4B 视觉语言主干网络与一个流匹配扩散 Transformer(DiT)动作头相结合。三项设计选择使连贯的跨具身训练成为可能:
规范化状态-动作表示。所有机器人状态和动作都被映射到一个统一的 80 维向量,涵盖单臂、双臂、灵巧手和移动底座配置。逐维度的二值掩码确保梯度仅通过有值的槽位流动,从而使不同具身共享同一表示而不产生冲突。
相机坐标系增量位姿。末端执行器动作以相机坐标系中的增量而非机器人基座坐标系来表示,使视觉上相似的动作在不同具身之间在数值上也相近。相机外参通过交叉注意力层中的相机位置编码(CaPE)注入,而内参则被编码进视觉 token 以实现视野感知。DiT 进一步以末端执行器类型嵌入为条件,实现具身感知的动作去噪。
上下文策略自适应。模型以结构化具身提示词(指定机器人平台、执行速度和 FPS)以及历史观测-动作块为条件进行动作预测,从而实现对不同具身和行为模式的即时自适应。训练期间的随机上下文采样策略可防止动作复制捷径,迫使模型进行真正的策略学习。
训练。预训练采用双流协同训练,VLA 流(机器人操作数据)与 VLM 流(视觉语言理解数据)以 9:1 的比例进行。后训练对每个基准收集的全部演示数据采用通用 SFT。我们提出在后训练期间使用 VL 数据和 VLA 数据进行协同训练,这进一步提升了 OOD 指令遵循能力和泛化能力。
评估#
Qwen-RobotManip 在 500+ 个仿真任务和 80+ 个真实世界任务上进行了评估,涵盖多种机器人本体形态。
为什么 OOD 评估很重要#
我们实验中的一个关键发现:标准基准系统性地无法捕捉预训练的质量。在 LIBERO 和 RoboTwin 等分布内基准上,从零开始训练、完全没有任何大规模机器人预训练的模型,其性能可与之前的 SOTA 预训练模型相媲美。强大的 IID 分数并不代表真正的泛化能力;它们仅通过模式匹配就能达到。
这种差距只有在分布外评估下才会显现:新颖场景和任务变体、遵循未见过的指令,以及跨本体形态迁移。这就是为什么 Qwen-RobotManip 采用 OOD 基准作为评估机器人基础模型的北极星。
分布内结果#
在标准基准上,Qwen-RobotManip 达到或超越了之前的 SOTA。
| 模型 | LIBERO | RT-Easy | RT-Hard |
|---|---|---|---|
| $\pi{0}$π 0 | 94.4 | 65.9 | 58.4 |
| $\pi{0.5}$π 0.5 | 97.6 | 82.7 | 76.8 |
| StarVLA | 98.0 | 85.7 | 87.3 |
| Abot-M0 | 98.6 | 86.1 | 85.1 |
| Being-H0.7 | 99.2 | 90.2 | 89.6 |
| Qwen-RobotManip-scratch | 98.2 | 88.7 | 88.4 |
| Qwen-RobotManip | 99.1 | 93.4 | 92.5 |
| Qwen-RobotManip-Context | 99.2 | 93.7 | 94.0 |
分布外泛化#
Qwen-RobotManip 在三个分布外泛化维度上大幅超越此前所有模型:任务与场景变化、指令遵循,以及跨具身迁移。
按基准逐一详细分析 LIBERO-Plus —— 在 7 个扰动维度(相机、机器人、语言、光照、背景、噪声、布局)下的 OOD 鲁棒性评估:
| 模型 | 相机 | 机器人 | 语言 | 光照 | 背景 | 噪声 | 布局 | 总计 |
|---|---|---|---|---|---|---|---|---|
| $\pi{0}$π 0 | 13.8 | 6.0 | 58.8 | 85.0 | 81.4 | 79.0 | 68.9 | 53.6 |
| $\pi{0.5}$π 0.5 | 78.4 | 73.6 | 80.8 | 96.2 | 94.1 | 89.0 | 84.5 | 84.4 |
| StarVLA | 52.5 | 49.8 | 88.5 | 95.7 | 95.7 | 73.0 | 76.9 | 74.1 |
| Abot-M0 | 60.4 | 67.9 | 86.4 | 96.2 | 91.6 | 86.4 | 82.6 | 80.5 |
| Being-H0.7 | 82.0 | 59.0 | 82.8 | 97.8 | 90.0 | 93.5 | 88.5 | 84.8 |
| Qwen-RobotManip | 87.2 | 75.5 | 85.6 | 96.6 | 97.7 | 97.7 | 87.3 | 89.0 |
| Qwen-RobotManip-Context | 89.9 | 83.9 | 86.5 | 98.6 | 99.9 | 97.9 | 87.5 | 91.4 |
Qwen-RobotManip 总体达到 89.0%,Qwen-RobotManip-Context 总体达到 91.4%。各维度细分显示,Camera 和 Robot 扰动从大规模机器人数据预训练中获益最多,而 Language 和 Light 鲁棒性已由 VLM 骨干网络提供。
RoboTwin-Clean2Rand —— 模型在 Clean 数据集上微调,并在逐步增强的环境随机化条件下测试:
| 模型 | Easy | Background | Light | Clutter | Height | Hard |
|---|---|---|---|---|---|---|
| StarVLA | 58.1 | 27.1 | 50.9 | 24.2 | 48.4 | 10.6 |
| GR00T-N1.7 | 43.6 | 40.4 | 41.9 | 27.1 | 39.0 | 20.7 |
| $\pi{0.5}$π 0.5 | 73.1 | 67.0 | 69.2 | 57.9 | 67.6 | 47.9 |
| Qwen-RobotManip | 73.2 | 74.6 | 68.4 | 61.3 | 71.0 | 62.6 |
| Qwen-RobotManip-Context | 84.7 | 82.4 | 84.2 | 75.4 | 79.5 | 69.4 |
Qwen-RobotManip 取得了最高的 Hard 成功率(62.6%),保留了约 86% 的 Easy 性能,而 $\pi{0.5}$π 0.5 为 66%,未经过预训练的模型则低于 30%。Qwen-RobotManip-Context 在 Hard 上进一步提升至 69.4%,展示了上下文策略自适应的有效性。
RoboCasa365 —— 在多样化厨房环境中跨原子操作与长时程操作的评估:
| 模型 | 原子 | 复合-已见 | 复合-未见 | 总计 |
|---|---|---|---|---|
| $\pi{0}$π 0 | 36.3 | 5.2 | 0.7 | 15.0 |
| $\pi{0.5}$π 0.5 | 39.6 | 7.1 | 1.2 | 16.9 |
| GR00T-N1.5 | 50.7 | 14.8 | 2.7 | 23.9 |
| RLDX-1 | 63.0 | 27.5 | 5.4 | 33.2 |
| Qwen-RobotManip | 68.6 | 20.1 | 14.9 | 35.9 |
| Qwen-RobotManip-Context | 63.9 | 22.6 | 11.2 | 33.8 |
在 Composite-Unseen 上,该测试要求在 OOD 场景中完成长时程任务,Qwen-RobotManip 达到了 14.9%,几乎是次优模型(5.4%)的 3 倍。
EBench——跨桌面、抓取放置和长时程任务的移动操作:
| 模型 | 桌面 | SimplePnP | 长时程 | 总体 |
|---|---|---|---|---|
| SR | 得分 | SR | 得分 | SR |
| π₀ | 15.7 | 30 | 35.0 | 39 |
| π₀.₅ | 12.9 | 32 | 45.0 | 50 |
| X-VLA | 8.6 | 24 | 50.0 | 54 |
| InternVLA-A1 | 4.3 | 11 | 43.0 | 47 |
| Qwen-RobotManip | 50.0 | 70 | 56.5 | 60 |
| Qwen-RobotManip-Context | 49.3 | 56 | 55.0 | 66 |
Qwen-RobotManip 实现了 45.6% 的总体 SR 和 60 的综合得分,大幅超越 $\pi{0.5}$π 0.5(27.1% / 41)以及所有其他基线,在每一个 split 上均遥遥领先。
RoboTwin-IF —— 使用留出的未见指令模板进行指令跟随:
| 模型 | Pick-Diverse | Place-Rel. | Ope.-Mic-Dr. | Ope.-Stapler | Ope.-Table | 平均 |
|---|---|---|---|---|---|---|
| StarVLA | 11 | 13 | 0 | 49 | 74 | 29.4 |
| GR00T-N1.7 | 20 | 17 | 0 | 14 | 32 | 16.6 |
| $\pi{0.5}$π 0.5 | 44 | 20 | 15 | 92 | 66 | 49.6 |
| Qwen-RobotManip | 79 | 57 | 42 | 90 | 93 | 72.2 |
| Qwen-RobotManip-Context | 77 | 71 | 33 | 89 | 90 | 72.0 |
Qwen-RobotManip 达到 72.2% 的平均成绩,领先 $\pi{0.5}$π 0.5 达 +22.6 个百分点。最大的提升出现在那些需要解析指令、在多个看似合理的备选动作中选出正确动作的任务上,这证实了真正的语言条件控制能力。
零样本跨本体 —— 仅在 AgileX ALOHA 数据上训练,在我们的 RoboTwin-XE 基准上对未见过的机器人本体进行评估:
| 模型 | ARX | UR5 | Franka | 总计 |
|---|---|---|---|---|
| $\pi{0.5}$π 0.5(joint) | 24.6 | 2.2 | 0.9 | 9.2 |
| $\pi{0.5}$π 0.5 (eef) | 11.5 | 10.0 | 1.1 | 7.5 |
| Qwen-RobotManip(joint) | 37.6 | 4.1 | 1.8 | 14.5 |
| Qwen-RobotManip(eef) | 42.9 | 22.8 | 5.9 | 23.9 |
相机坐标系下的 EEF 表示通过抽象掉形态差异,大幅提升了零样本迁移能力。Qwen-RobotManip(eef)总体达到 23.9%,是 $\pi{0.5}$π 0.5 (eef) 7.5% 的 3.2 倍。
数据扩展:对齐使规模化成为可能#
一项重要发现:只有具备统一跨具身表示的模型,才会表现出清晰的日志线性数据扩展行为。如果没有对齐框架(UnifiedSpace + UnifiedEEF),增加更多数据只会产生不稳定或平坦的扩展曲线。这证实了对齐是扩展的前提,而非相反。
真实世界实验#
对新场景与新指令的泛化#
跨 7 项任务的域内评估,涵盖基础抓取放置、可变形物体操作和精密装配:
| 任务 | $\pi{0.5}$π 0.5 | StarVLA | 我们的方法 |
|---|---|---|---|
| 桌面清理 | 4/5 | 0/5 | 5/5 |
| 三碗堆叠 | 5/5 | 4/5 | 5/5 |
| 碗中甜瓜 | 2/5 | 0/5 | 5/5 |
| 叠毛巾 | 4/5 | 3/5 | 4/5 |
| 积木放入抽屉 | 0/5 | 0/5 | 5/5 |
| 黄色圆盘插入 | 0/5 | 0/5 | 2/5 |
| 三块积木堆叠 | 0/5 | 0/5 | 5/5 |
| 平均 | 42.9% | 20.0% | 88.6% |
在视觉场景、物体和指令存在分布偏移情况下的域外评估:
| 任务 | OOD 因素 | $\pi{0.5}$π 0.5 | StarVLA | 我们的方法 |
|---|---|---|---|---|
| 目标物体放入篮子 | 杂乱背景、未见过的物体 | 8/10 | 0/10 | 10/10 |
| 左右碗堆叠 | 杂乱背景、左右参照 | 1/10 | 0/10 | 10/10 |
| 毛巾上的工具 | 未见的小物体、干扰物 | 0/10 | 0/10 | 6/10 |
| 毛巾上的香蕉 | 动态光照(迪斯科灯光) | 6/10 | 0/10 | 9/10 |
| 平均 | 37.5% | 0.0% | 87.5% |
Qwen-RobotManip 在域内达到 88.6%、OOD 达到 87.5% 的成功率,大幅超越 $\pi{0.5}$π 0.5(42.9% / 37.5%)和 StarVLA(20.0% / 0.0%)。
跨具身形态的数据高效技能迁移#
少样本适配。所有方法仅在 5 个任务的 130 条遥操作演示数据上联合微调。Qwen-RobotManip 在 5 个任务中的 4 个上均优于两个基线:
| 任务 | 子步骤 | StarVLA | $\pi{0.5}$π 0.5 | 本文方法 |
|---|---|---|---|---|
| 放置水果 | 放置 1 / 2 / 3 | 3/1/0 | 9/5/2 | 9/5/3 |
| 平均成功率 | 13.3% | 53.3% | 56.7% | |
| 放置积木 | 打开 / 放置1 / 放置2 / 关闭 | 1/1/0/0 | 4/2/2/2 | 5/4/3/3 |
| 平均成功率 | 5.0% | 25.0% | 37.5% | |
| 折叠毛巾 | 折叠 1 / 折叠 2 | 0/0 | 3/1 | 3/3 |
| 平均成功率 | 0.0% | 20.0% | 30.0% | |
| 插入螺丝 | 交接 / 插入 | 0/0 | 2/0 | 2/0 |
| 平均成功率 | 0.0% | 10.0% | 10.0% | |
| 拧开瓶盖 | 抓取 / 拧开 / 放置 | 4/0/0 | 9/2/1 | 9/4/3 |
| 平均成功率 | 13.3% | 40.0% | 53.3% |
跨具身技能迁移。一个在 6K CobotMagic 和 130 个 ARX 演示上联合微调的单一策略,在 ARX 上的 4 个新任务上进行评估,而 ARX 在这些任务上没有任何训练演示:
| 模型 | 叠盘子 | 叠积木 | 盘子里的水果 | 桶里的垃圾 | 平均 |
|---|---|---|---|---|---|
| 无 UnifiedSpace | 0/10 | 0/10 | 3/10 | 0/10 | 7.5% |
| 无 UnifiedEEF | 0/10 | 0/10 | 5/10 | 0/10 | 12.5% |
| Qwen-RobotManip | 3/10 | 5/10 | 7/10 | 7/10 | 55.0% |
完整的统一框架达到了 55.0%,是最佳消融变体的 4 倍以上,表明统一表示能够实现跨运动学上不同本体的技能级迁移。
复杂多步任务与涌现式恢复#
在 RoboChallenge Table30 v1 Generalist Track 中,该赛道涵盖 4 个机器人平台上的 30 项任务,Qwen-RobotManip 以 45% 的成功率和 59.83 的过程得分排名第 1,领先第二名 20%。在 8 项双手协调任务上,它取得了 40% 的成功率,而 $\pi{0.5}$π 0.5 为 21.2%。
双手协调。在 30 项基准任务中,有 8 项需要在 ALOHA 平台上进行紧密的双手协调,即两条机械臂必须协同完成稳定、搬运和操作物体。Qwen-RobotManip 取得了 40% 的平均成功率,远超 $\pi{0.5}$π 0.5(21.2%)、DM0(16.2%)、GR00T-MULTI(7.5%)和 $\pi{0}$π 0(7.5%)。值得注意的是,Qwen-RobotManip 是唯一在“把薯条倒进盘子里”任务上取得成功的模型(30%,而所有基线均为 0%),该任务要求按顺序完成双手步骤——用左臂稳住薯条盒,用右臂打开它,把它拿起来,再将内容物倒到盘子上。我们将这一强劲的双手操作表现归因于两个因素:(1)我们的预训练语料中包含相当大比例的双手演示数据,使模型能够学习协调的双臂控制基元;(2)Human-to-Robot 合成流水线通过从第一人称人类视频中合成双手机器人演示,进一步扩展了有效的双手预训练数据。
跨形态的稳健抓取放置。我们在全部四个平台上识别出 12 项以抓取放置原语为核心的任务,涵盖从单物体抓取到涉及 4–5 个物体的多步顺序操作。Qwen-RobotManip 在这些任务上取得了 63.3% 的平均成功率,比次优基线 DM0(48.3%)高出 15.0 个百分点。我们将这一能力归因于两个因素:(1)大规模跨形态预训练数据编码了丰富的抓取放置模式,(2)统一动作空间使基础空间技能的知识能够在不同机器人形态之间共享。
反应式错误恢复。当物体在抓取过程中滑落时,模型会自主重试直至成功。这一行为源自大规模预训练,而非显式编程。
迈向可扩展的机器人基础模型#
Qwen-RobotManip 表明,语言和多模态基础模型背后的规模化配方可以扩展到机器人操作,但前提是对齐与规模协同发挥作用。统一的跨形态表示正是让大规模多源训练富有成效而非相互冲突的关键,而 Human-to-Robot 合成流水线则提供了仅靠对齐无法提供的数据多样性。
具身智能仍处于早期阶段。接触密集、长时程的真实世界任务、失败恢复、持续学习以及复杂的人-机器人-环境交互仍然充满挑战。然而,Qwen-RobotManip 指明了一条清晰的前进道路:
对齐释放规模,规模释放泛化。
@article{qwenrobotmanip, title={Qwen-RobotManip 技术报告:对齐释放机器人操作基础模型的规模化潜力}, author={Qwen Team}, year={2026}}
来源:Qwen:Blog Retrieval(API) · qwen.ai