蚂蚁集团 Robbyant 发布 LingBot-VA 2.0,首个原生具身基础模型
Ant Group’s Robbyant Unveils LingBot-VA 2.0: A Causal Video-Action Model Built Natively for Physical AI
蚂蚁集团旗下具身智能团队 Robbyant 发布 LingBot-VA 2.0,首个原生具身基础模型。该模型采用因果 DiT 架构,视频专家约 13.0B 参数(约 1.9B 激活),训练规模约 15.3B 参数,推理时每 token 约 2.5B 激活。模型引入多块预测(MCP)实现 2.3 倍训练加速,并通过前瞻推理将推理延迟降至 142 ms/chunk。在 RoboTwin 2.0 的 50 个任务上,干净与随机演示数据平均成功率分别达 93.8% 和 93.4%。
具身智能领域第一个从零预训练的因果视频-动作模型,将世界状态和动作统一在一个隐空间,异步推理优化到 225Hz,做机器人的值得仔细研究。
Robbyant,即蚂蚁集团内部的具身 AI 部门,发布了 LingBot-VA 2.0。这是首个具身原生基础模型。它描述了一个面向通用机器人操作的视频-动作基础模型。研究团队为具身智能预训练了整个技术栈,而非微调一个视频生成器。
什么是 LingBot-VA 2.0?
大多数视频-动作模型复用了两个为数字内容创作而构建的组件。一个是面向重建的 VAE。另一个是双向视频扩散主干,并附带一个动作模块。
这带来了三个局限。像素重建潜变量保留了外观,但承载的物理结构有限。对视频 token 进行迭代去噪对于闭环控制来说太慢。通用的视频目标从未教会模型动作如何重塑世界。
第四个不匹配是结构性的。主干使用双向注意力,而控制则严格随时间向前展开。LingBot VA Version 1.0 将该技术栈微调为一个因果模型。Version 2.0 则原生预训练了一个因果 DiT。

版本 1:语义视觉-动作 tokenizer
基于这一动机,第一阶段替换了仅用于压缩的 VAE。遵循 RepWAM,tokenizer 在重建之外增加了两个目标。
语义对齐将视觉潜变量拉向一个冻结的 Perception Encoder 教师模型。潜动作目标提取连续潜变量之间的紧凑过渡变量。一个逆动力学模型预测每个潜动作。一个前向动力学模型将其解码为传输映射加残差。
世界状态和动作现在共享同一个潜空间。因此,无标注的网络视频携带了与动作相关的监督信号。
版本 2:带有稀疏 MoE 视频流的因果 DiT
在该空间之上,版本 2 预训练了一个因果 DiT。它保留了版本 1.0 的 Mixture-of-Transformers 布局。一个视频专家和一个动作专家共享一个因果自注意力。各自拥有独立的前馈通路。
两条流的扩展是不对称的。视频专家将其稠密 FFN 替换为稀疏 MoE 路由层。该层包含 128 个路由 SwiGLU 专家、top-8 路由、一个共享专家。负载均衡采用无辅助损失的 Loss-Free Balancing 策略。动作专家保留隐藏维度为 768 的稠密 FFN。
视频主干约为 13.0B 参数,约 1.9B 激活。加上动作专家和 MCP 头,训练覆盖约 15.3B 参数。推理时每个 token 约激活 2.5B。训练使用 rectified-flow 目标,搭配 Muon 加 AdamW 混合优化器。
训练信号从何而来
除了架构之外,还有两个目标决定了模型学到什么。
多块预测(MCP)修正了短视的监督方式。教师强制只监督下一个块,因此模型可以通过复制外观来降低损失。MCP 附加了三个轻量级模块,预测接下来的三个块。在消融实验中,它在 20k 步内达到了基线 45k 步的准确率,训练速度提升 2.3 倍。
与此同时,五个目标被联合训练而非分阶段进行:T2I、T2V、TI2VA、ICL 以及人机协同训练。采样遵循从粗到细的调度,从外观 grounding 到视频-动作控制。让每个目标都保持活跃,可以避免遗忘早期的先验。
分层规划
块级控制无法对长时程目标进行排序。因此,在策略之上放置了一个 VLM 规划器,使用冻结的视觉塔进行 LoRA 微调。它输出结构化 JSON:done、instruction、generation_instruction、local_scene_description。它以约 2 Hz 的频率运行在异步共享缓冲区之后。策略在每个块边界读取它,因此规划器的延迟永远不会阻塞执行。
前瞻推理
即使采用稀疏骨干网络,部署时仍会遇到串行瓶颈。如果机器人等待,模型延迟就会变成控制延迟。
因此,Foresight Reasoning 将预测与执行作为异步流来运行。当机器人执行动作块 a_t 时,视频专家会想象其产生的结果。动作专家据此解码出 a_{t+1}。
超前运行会带来漂移风险。因此,每个返回的观测都会被编码为真实的隐变量 z_{t+1},覆盖掉此前想象出的那个。一个前向动力学接地损失函数负责训练视频专家承担这一角色。
# Pseudocode for the asynchronous rollout (Sec. 2.3.7, Eq. 29).
# Not runnable: policy, executor and encode() are placeholders.
C = init_kv_cache(encode(obs_0)) # feedback-grounded cache C_t
a = policy.action_expert(C) # cold start: first action chunk a_0
while not done:
executor.start(a) # execution stream, non-blocking
C_tmp = C + [a] # prediction stream: C_t u {a_t}
z_hat = policy.video_expert(C_tmp) # forward dynamics -> imagined z_{t+1}
a_next = policy.action_expert(C_tmp + [z_hat])
obs = executor.wait() # real observation of a_t returns
C = overwrite(C_tmp, z_hat, encode(obs)) # re-ground: z_hat <- true z_{t+1}
a = a_next
性能
因此,评估覆盖了仿真与真实硬件。在 RoboTwin 2.0 上,每个模型都在 2,500 条干净演示加上 25,000 条随机化演示上训练,涵盖 50 项任务。

| 方法 | 干净 | 随机化 | 平均 |
| X-VLA | 72.9 | 72.8 | 72.9 |
| π0.5 | 82.7 | 76.8 | 79.8 |
| Motus | 88.7 | 87.0 | 87.9 |
| LingBot-VA | 92.9 | 91.6 | 92.2 |
| LingBot-VA 2.0 | 93.8 | 93.4 | 93.6 |
| 加速技术 | 推理时间(毫秒/块) | 异步 Hz |
| BF16 PyTorch 异步 rollout 基线 | 927 | 35 |
| + 一致性蒸馏 | 466 | 69 |
| + 低精度编译执行 | 369 | 87 |
| + 长时程注意力优化 | 272 | 118 |
| + 运行时开销削减 | 142 | 225 |
蒸馏将视频采样器从 5 步缩减至 2 步,将动作采样器从 10 步缩减至 2 步。FP8 TensorRT 引擎、采用 FlashInfer 注意力的分页/不规则 KV cache,以及主机侧开销的消除,则贡献了其余部分。
# Reproduces Table 3 of the report exactly. Runnable as-is.
K = 32 # low-level control steps inside one generated chunk
stack = [("BF16 PyTorch async rollout baseline", 927),
("+ Consistency distillation", 466),
("+ Low-precision compiled execution", 369),
("+ Long-horizon attention optimization", 272),
("+ Runtime overhead reduction", 142)]
for name, ms in stack:
print(f"{name:40s} {ms:4d} ms {round(1000 / ms * K):4d} Hz")
print("end-to-end speedup:", round(927 / 142, 1), "x")
1.0 版 vs 2.0 版
| 维度 | LingBot-VA | LingBot-VA 2.0 |
| Tokenizer | Wan2.2 VAE(重建) | 语义视觉-动作 tokenizer,96 个潜通道 |
| 骨干网络来源 | 从双向生成器微调而来 | 从零预训练的因果 DiT |
| 视频 FFN | 稠密 | 稀疏 MoE,128 个专家,top-8 |
| 额外监督 | 未使用 | MCP、上下文学习、人机协同训练 |
| 推理 | 异步执行、KV cache | 基于观测重锚定的前瞻推理 |
| 峰值异步控制 | 2.0 版报告未报告 | 225 Hz |
tokenizer 消融实验单独对应第一行。将 WAN2.2 VAE 替换为语义 tokenizer,可将 1.3B 模型从 78.0 提升至 86.6。
用例与示例
除基准测试之外,还有四种部署形态尤为突出。
- 少样本上手:报告称该模型可从 10 到 15 个演示中自适应。真实世界评估中每个任务使用 20 个遥操作演示。一个多任务 checkpoint 覆盖全部四个被评估任务。
- 演示条件控制:上下文学习让人类演示视频可以替代文本指令。在四个已见任务上微调后,该策略执行了未见过的组合。一个例子是:“把葫芦放进绿色盘子里。”
- 低成本数据扩展:人机协同训练将手部姿态重定向到机器人动作空间。每只手都成为一个虚拟平行夹爪。第一视角语料库涵盖 65.4k 个 episode。
- 反应式控制:演示包括空气曲棍球和传送带,其中策略会预判移动中的物体。
核心要点
- 从零开始预训练一个因果视频-动作 DiT,而非改造视频生成器。
- 语义 tokenizer 将世界状态和潜在动作置于同一个对齐空间中。
- 稀疏 MoE 视频流:每个 token 激活约 15.3B 参数中的约 2.5B。
- 前瞻推理将预测与执行重叠进行,并在每一次真实观测上重新锚定。
- 分块延迟从 927 ms 降至 142 ms;异步控制从 35 Hz 提升至 225 Hz。
交互式动态讲解器
来源:MarkTechPost(RSS) · marktechpost.com