Robbyant 发布 LingBot-VLA 2.0:开源 6B 跨实体机器人视觉-语言-动作模型
Robbyant Releases LingBot-VLA 2.0: An Open-Source 6B Vision-Language-Action (VLA) Model for Cross-Embodiment Robot Manipulation
Robbyant 推出 LingBot-VLA 2.0,一个 6B 参数的开源视觉-语言-动作(VLA)基础模型。它以 Qwen3-VL-4B-Instruct 为骨干,采用 MoE 动作专家架构,通过 55 维规范向量统一表示不同机器人的状态和动作。训练数据涵盖约 60,000 小时高质量数据(50,000 小时机器人轨迹 + 10,000 小时第一人称人类视频),覆盖 20 种机器人配置。在 GM-100 双机械臂基准测试中,模型在多个平台上超越 π0.5 和之前版本。模型权重、代码和技术报告已以 Apache-2.0 许可开源。
蚂蚁Robbyant放出的开源VLA 2.0把通用机器人策略往前推了一步,60,000小时跨具身数据、统一动作空间和MoE设计对做机器人的团队是实打实的参考,不是又一个lab-only的demo。
蚂蚁集团的 Robbyant 发布了 LingBot-VLA 2.0,这是一个面向机器人的视觉-语言-动作(VLA)基础模型。此次发布包含一份技术报告、一个 Apache-2.0 代码库以及一个 6B 检查点。研究团队瞄准了一个众所周知的缺口:VLA 模型往往在实验室里表现良好,但一到部署阶段就问题频出。LingBot-VLA 2.0 在三个实用维度上对前一版本进行了推进。这三个维度分别是泛化能力、扩展的动作空间以及预测性动力学建模。
什么是 LingBot-VLA 2.0?
LingBot-VLA 2.0 是一个基于视觉-语言主干构建的通用机器人策略。它将摄像头图像和语言指令转换为机器人动作。公开模型为 lingbot-vla-v2-6b,这是一个 6B 的“原生深度”检查点。它使用 Qwen3-VL-4B-Instruct 作为 VLM 主干。两个教师模型 LingBot-Depth 和 DINO-Video 通过知识蒸馏来监督训练。
在 NVIDIA GeForce RTX 4090D 上,一次推理调用大约需要 130 ms。该测量使用了 10 个去噪步骤。动作专家采用混合专家(MoE)设计以实现扩展。
数据管线:20 种配置下共计 60,000 小时
泛化始于数据。研究团队整理了约 60,000 小时 的预训练数据。这涵盖 50,000 小时 的机器人轨迹和 10,000 小时 的第一人称视角人类视频。机器人数据横跨 20 种机器人构型,从单臂设备到完整的人形机器人。原始数据池更大:约 90,000 机器人小时和 20,000 第一人称视角小时。一套重新设计的流水线将含噪样本过滤,最终得到高质量数据集。
过滤是显式且可量化的。研究团队针对每种本体计算三阶加加速度以及速度和加速度的 Z 分数。平滑度异常或静态信号超过 95% 的片段会被丢弃。视频会使用每个机器人的 URDF 与重放状态进行比对检查。标注人员会移除模糊、遮挡、丢帧和多视角错位。第一人称视角片段先通过 VLM 过滤,再进行第一人称视角 SLAM 和 MANO 手部姿态重建。
标注由视觉语言模型自动完成。Qwen3.6-27B 将每个视频分割为时间上连续的子任务。每个子任务从 18 个类别的封闭词表中获得一个原子动作。该词表包含 15 种基础动作,外加移动、空闲和其他。在整个语料库中,移动和行进在频率上占主导。
统一动作表示
不同机器人暴露不同的关节,因此 LingBot-VLA 2.0 将它们统一起来。它使用一个 55 维规范向量 来表示状态和动作。该布局在数据集中的每一种本体上都保持固定。
| 组件 | 维度 |
| 手臂关节位置 | 14 |
| 末端执行器位姿 | 14 |
| 夹爪位置 | 2 |
| 手部关节位置 | 12 |
| 腰部位置 | 4 |
| 头部位置 | 2 |
| 移动信号 | 3 |
| 保留 | 4 |
每个机械臂末端执行器的位姿使用 XYZ 坐标加一个旋转四元数,因此每条机械臂为 7 个维度。缺少某个身体部位的机器人只需对相应维度进行填充。这样一来,单个模型就能控制机械臂、手、夹爪、腰部、头部和移动底座。
MoE 动作专家
动作专家将其前馈网络替换为稀疏的 MoE 层。每个 MoE 层保留一个共享专家以及若干个路由专家。每个 token 只激活 top-K 个路由专家,因此激活计算量保持有界。每个专家是一个 SwiGLU MLP,其中间层宽度更小。
路由采用受 DeepSeek-V3 启发的基于 sigmoid 的 无辅助损失 策略。每个专家的偏置项可纠正负载不均衡,而无需添加负载均衡损失。路由置信度仍来自模型原有的、无偏的亲和度分数。在激活参数量匹配的情况下,MoE 模型比稠密基线达到更低的训练损失。它在 GM-100 任务上也达到更低的验证动作误差。
用于预测动力学的双查询蒸馏
真实执行需要预判,而不仅仅是对当前帧作出反应。LingBot-VLA 2.0 在视觉和文本 token 上追加两个可学习的查询。Qt 针对当前观测,Qt+T 针对未来观测。时间跨度 T 等于动作块大小。
两个教师模型监督这些查询。LingBot-Depth通过深度预测提供显式的几何线索。DINO-Video提供具有时间基础的语义先验。DINO-Video 构建于 DINOv3 主干之上,采用分块因果时间注意力和 3D-RoPE。它在涵盖互联网、第一人称视角和机器人数据的 500 万段视频片段上进行训练。在 LARYBench 评测中,DINO-Video 在四项指标中的三项上领先。
基准测试结果
Robbyant 在 GM-100(Great March 100)双臂基准上以通用设置对模型进行评估。单一策略针对每种具身形态在九项任务上联合训练。结果以进度得分 / 成功率的形式报告。
| 平台 | GR00T N1.7 | π0.5 | LingBot-VLA-1.0 | LingBot-VLA-2.0 |
| AgileX Cobot Magic | 36.3 / 17.8 | 59.1 / 32.2 | 58.2 / 30.0 | 66.2 / 34.4 |
| Galaxea R1Pro | 16.4 / 5.6 | 27.4 / 8.9 | 32.7 / 15.6 | 34.6 / 15.6 |
在长时程移动操作任务中,该模型在两种设置下接受测试。域内(ID)使用训练分布,而 OOD 则对姿态和物体进行扰动。
| 具身本体 | 任务 | 设置 | LingBot-VLA-2.0 | π0.5 |
| Astribot S1 | 冰箱分拣 | 域内 | 77.1 / 60.0 | 65.3 / 46.7 |
| Astribot S1 | 冰箱整理 | OOD | 37.0 / 13.3 | 30.3 / 6.7 |
| Cobot Magic-ARX X5 | 灶台清洁 | 域内 | 84.3 / 66.7 | 79.9 / 60.0 |
| Cobot Magic-ARX X5 | 灶台清洁 | OOD | 67.5 / 40.0 | 62.5 / 33.3 |
在需要精准物体定位的任务上,提升最为显著。在 Agilex Retrieve keychain 任务上,成功率从 60.0 提升到 100.0,相比 1.0 版本。部分任务在进展与成功之间仍存在差距。这一差距指向最终精确放置或释放步骤上的失败。
快速上手
该仓库提供了安装、下载和部署脚本。下面的示例会下载已发布的权重。
# Environment: Python 3.12, PyTorch 2.8.0, flash-attn 2.8.3
python3 scripts/download_hf_model.py --repo_id robbyant/lingbot-vla-v2-6b --local_dir lingbot-vla真实机器人部署通过编译后的推理运行策略服务器。
export QWEN3VL_PATH=path_to_Qwen3-VL-4B-Instruct
python -m deploy.lingbot_vla_v2_policy \
--model_path path_to_posttraining_ckpt \
--use_compile \
--use_length 25 \
--port port
后训练使用 LeRobot v2.1 或 v3.0 数据集。所提供的示例在 RoboTwin 2.0 上跨 50 个任务进行微调。路由可以使用带 z-loss 的序列级辅助损失,也可以采用无损失设置。该配置还暴露了 Muon 优化器,默认使用 AdamW。
用例与示例
扩展后的动作空间映射到具体的部署场景。
- 厨房移动操作: Astribot S1 将水果和饮料分类放入冰箱。这需要同时完成底座移动、开门和物体放置。
- 表面清洁: Cobot Magic-ARX X5 用海绵擦去炉灶上的泡沫。这串联了抓取、擦拭和工具重新定位。
- 双臂打包与分拣: GM-100 任务包括鸡蛋打包、工具打包和积木分拣。
- 灵巧手控制: Unitree G1、Fourier GR-2 和 AgiBot A2 使用 12 自由度手,而非夹爪。
交互式动态讲解器
核心要点
- LingBot-VLA 2.0 在约 60,000 小时的数据上预训练——包括跨 20 种构型的 50,000 小时机器人轨迹,以及 10,000 小时的第一人称人类视频。
- 一个 55 维的规范化动作空间统一了手臂、末端执行器、夹爪、灵巧手、腰部、头部和移动底座,因此一个模型即可覆盖全身控制。
- 动作专家采用 token 级无辅助损失 MoE,在相同激活参数量下,其训练损失和验证动作误差均低于稠密模型。
- 双查询蒸馏加入了当前/未来查询,由 LingBot-Depth(几何)和 DINO-Video(时序动态)监督,以实现面向未来的操作。
- 在 GM-100 通用设置下,它在 AgileX Cobot Magic 上取得 66.2/34.4 的成绩,在 Galaxea R1Pro 上取得 34.6/15.6 的成绩,领先于 π0.5 和 LingBot-VLA-1.0,并且在域内和 OOD 的两项长时程移动任务上均优于 π0.5。
来源:MarkTechPost(RSS) · marktechpost.com