跳到正文
北京时间
原文
HuggingFace Daily Papers(社区热门论文)·· 2026-05-18精选AI 评分73

StableVLA:无需额外数据的鲁棒视觉-语言-动作模型

StableVLA: Towards Robust Vision-Language-Action Models without Extra Data

AI 导读

视觉-语言-动作模型在面对训练数据未涵盖的视觉干扰时性能显著下降。为此,本文提出一种基于信息论的轻量级适配器模块(IB-Adapter),能从视觉输入中选择性过滤噪声,且无需额外数据或增强策略。该适配器以少于1000万的额外参数,平均提升性能30%。实验表明,即使骨干网络参数仅为0.5B(较现有7B模型小14倍),StableVLA在合成与真实视觉损坏场景下的长时程任务中,仍能达到与大模型相当的鲁棒性,并超越OpenPi基线。

推荐理由

VLA 模型在真实世界一遇到光照遮挡就崩,这篇用信息瓶颈原理做的轻量适配器,不加数据就拉回 30% 性能,还用 0.5B 小模型打平 7B,做机器人落地的团队值得看看。

正文 · AI 翻译
摘要

在训练数据集中囊括所有可能的干扰是不现实的。这引出了一个关于视觉-语言-动作(VLA)模型在遇到未见过的真实世界视觉干扰时,特别是在不完美的视觉条件下,其鲁棒性的关键问题。在这项工作中,我们基于近期最先进的VLA模型进行了系统性研究,并揭示了当引入训练数据中不存在的视觉干扰时,模型性能会出现显著下降。为了缓解这一问题,我们提出了一个基于信息论的轻量级适配器模块,称为信息瓶颈适配器(IB-Adapter),它能够有选择性地过滤来自视觉输入的潜在噪声。无需任何额外数据或数据增强策略,IB-Adapter 平均比基线模型提升了30%,同时仅增加不到1000万个参数,展现了显著的效率和有效性。此外,即使使用小14倍的骨干网络(0.5B参数)且未在Open X-Embodiment数据集上进行预训练,我们的模型StableVLA也能达到与7B规模的最先进VLA模型相当的鲁棒性。在可忽略的参数开销(1000万)下,我们的方法在长时程任务上保持了准确性,并在合成和物理视觉损坏条件下均超越了OpenPi。

\checkdata

[项目页面]https://dagroup-pku.github.io/StableVLA/ \checkdata[ GitHub]https://github.com/DAGroup-PKU/HumanNet/tree/main/src/model/StableVLA \checkdata[ HuggingFace]https://huggingface.co/DAGroup-PKU/StableVLA

1 引言

视觉-语言模型(VLM)[comanici2025gemini, bai2025qwen2, zhu2025internvl3, xie2024show, li2024llava] 与机器人控制的融合,从根本上重塑了具身智能的格局。近期开创性工作 [kim2024openvla, zitkovich2023rt-2, team2024octo, bjorck2025gr00t, black2024pi_0, DBLP:journals/corr/abs-2410-06158] 表明,视觉感知、大语言模型(LLM)推理与动作执行之间的有效对齐,使机器人能够在多样且非结构化的场景中运行。在此进展基础上,VLA-Adapter [wang2025vla-adapter] 等方法提出了高效机制,通过轻量级策略模块将视觉-语言表征桥接到动作空间,显著降低了适配开销。

Refer to caption
图 1:StableVLA 鲁棒性概览。(a) LIBERO 基准上的鲁棒性对比。三角形标记和柱状图分别表示干净数据和损坏数据(按严重程度取平均)上的性能。StableVLA 实现了最先进的零样本鲁棒性。(b) 在视觉损坏条件下,真实世界机器人执行 Pack Doll 任务的部署情况。StableVLA(0.5B)实现了 50% 的成功率,尽管参数量更少,仍优于 VLA-Adapter(0.5B,20%)和 OpenPI 0.5(3B,40%)。

尽管取得了这些进展,现有的评估和基准测试协议主要依赖于精心设计的、具有受控且理想化视觉条件的测试环境。相比之下,现实世界的机器人部署不可避免地会涉及视觉退化,例如传感器噪声、运动模糊或天气引起的干扰,而这些在精心策划的训练数据集中基本不存在 [deng2026rethinking, deng2026humannetscalinghumancentricvideo]。这种差异导致了模型在基准测试环境中的表现与现实世界环境中的表现之间存在显著差距 [liu2023libero, mees2022calvin, mu2024robotwin]。受此差距启发,我们提出以下问题:最先进的 VLA 模型在面临现实世界的视觉干扰时表现如何?为了探究这一点,我们首先通过注入合成的自然视觉损坏,在仿真环境中评估了表现最佳的 VLA-Adapter [wang2025vla-adapter]。令人惊讶的是,一个原本成功率达到 96% 的模型,在受到干扰的输入下性能下降了近 50%,如图 2 所示,并且在某些损坏模式(如严重的视觉模糊)下,成功率可能降至 0%。我们进一步证明,这种脆弱性并非 VLA-Adapter 独有,其他领先的 VLA 模型,包括 OpenVLA [kim2024openvla]、OpenVLA-OFT [kim2025fine-tuning] 和 OpenPi–0.5 [DBLP:journals/corr/abs-2504-16054] 也同样存在。在使用实体机器人系统进行的真实世界实验中,也观察到了一致的性能下降,如图 1 和表 LABEL:tab:real_res 所示。

Refer to caption
图 2:在 5 级损坏下的灾难性失败案例。StableVLA 保持鲁棒,而基线模型性能显著下降。

当前增强鲁棒性的主流策略主要依赖于在干净数据集上使用预定义扰动或数据增强的额外数据 [hendrycks2021many, DBLP:conf/nips/WangXKYAW21]。然而,这种以数据为中心的方法面临两个根本性局限。首先,模拟真实世界扰动的无限组合空间在计算上不可行。其次,使用增强数据进行训练往往会导致模型记忆特定噪声模式,而非学习鲁棒的不变特征,这限制了对未见扰动的泛化能力。这引出了一个关键问题:我们能否通过架构设计实现内在鲁棒性,而无需依赖暴力式的数据规模扩展?

我们进行了一系列实证实验,发现证据表明特征脆弱性的一个重要来源在于连接视觉编码器与大语言模型主干网络的投影器。如图3所示,在噪声输入下出现的显著特征退化似乎可归因于这个投影模块。

Refer to caption
图3:视觉扰动下VLA处理各阶段的特征一致性。

受信息瓶颈原理内在特征选择特性的启发 [tishby2000information],我们提出了一种用于连接视觉分支与大语言模型主干网络的新型模块结构,称为IB-Adapter。

通过简单替换VLA-Adapter中的原始适配器模块,并在相同设置下重新训练,我们在多种合成视觉扰动上实现了平均35.2%的性能提升。在真实机器人实验中,我们的方法在抓取放置任务上取得了31.7个百分点的改进。凭借其对视觉干扰的强鲁棒性,我们将由此得到的模型称为StableVLA。值得注意的是,StableVLA在保持VLA-Adapter轻量级训练方案的同时,大幅提升了鲁棒性:仅通过适配器级别的架构替换,且无需额外训练数据,就超越了包括参数量多14倍、使用显著更多数据训练的OpenVLA在内的重参数化基线模型。

  • •

    我们进行了实证研究,并观察到当前最先进的 VLA 模型,尽管在干净的基准测试设置中取得了强劲的性能,但在合成场景和真实机器人场景中都极易受到视觉干扰的影响。此外,我们的分析提供了证据,表明这种脆弱性与连接视觉编码器和 LLM 主干的投影模块密切相关。

  • •

    我们提出了一种无数据解决方案,引入了一种基于信息瓶颈理论的新型适配器架构,称为 IB-Adapter。在零样本设置下,仅将原始适配器替换为 IB-Adapter,在模拟器中相比基线实现了 35.2% 的性能提升,在真实机器人实验中提升了 20.4 个百分点,同时保持所有其他实验设置不变。

  • •

    我们在多个基准测试上进行了广泛的实验,包括 LIBERO [liu2023libero]、CALVIN [mees2022calvin] 以及真实机器人评估,涉及多个强大的 VLA 模型,例如 VLA-Adapter [wang2025vla-adapter]、OpenVLA [kim2024openvla]、OpenVLA-OFT [kim2025fine-tuning] 和 [DBLP:journals/corr/abs-2504-16054]。我们的结果表明,所提出的模型在保持显著更小模型尺寸的同时,始终优于所有选定的强基线模型。

2 相关工作与预备知识

2.1 视觉语言模型中的鲁棒性

利用预训练的视觉-语言模型(VLM)[liu2023visual, comanici2025gemini, liu2024nvila, bai2025qwen2, zhu2025internvl3, xie2024show, li2024llava] 进行机器人控制,已成为具身智能领域的主流范式 [brohan2023rt-1, zitkovich2023rt-2, kim2024openvla, team2024octo, DBLP:conf/rcar/LiWCWSM25, DBLP:journals/ijrr/ChiXFCDBTS25, DBLP:conf/rss/ZhaoKLF23, DBLP:conf/corl/ZawalskiCPMFL24, DBLP:conf/corl/DoshiWMDL24]。从头训练此类模型通常依赖于海量数据集,包括 Open X-Embodiment [oneill2024open]、DROID [DBLP:conf/rss/KhazatskyP0BDKN24] 和 AgiBot [contributors2024agibotworldrepo],并且需要大量的计算资源。为降低这一成本,VLA-Adapter [wang2025vla-adapter] 提出了一种资源高效的架构,该架构绕过了大规模预训练,直接将 VLM 的通用感知能力迁移到机器人领域。然而,尽管训练效率有所提升,架构鲁棒性仍是一个关键挑战。在标准 VLA 模型中,视觉编码器 [zhai2023sigmoid, oquab2023dinov2] 通常被冻结以保留语义先验 [kim2024openvla, kim2025fine-tuning, wang2025vla-adapter],这导致输入层面的噪声或损坏会通过视觉主干网络传播。现有方法依赖简单的基于 MLP 的投影器来将视觉特征与策略动作空间对齐,但此类投影器缺乏抑制任务无关干扰的内在机制。视觉与机器人领域的鲁棒性传统上通过以数据为中心的策略来解决,包括大规模数据增强 [hendrycks2019robustness, hendrycks2021many, DBLP:conf/nips/WangXKYAW21] 以及仿真中的域随机化 [tobin2017domain]。然而,这些方法计算成本高昂,且通常难以泛化到未见过的扰动。为克服这些局限,我们提出了 StableVLA,该方法通过架构设计实现内在鲁棒性,基于信息瓶颈原理重构模态对齐接口,使 VLA 模型能够有效过滤视觉扰动,而无需依赖穷举式的噪声模式模拟。

2.2 从信息瓶颈视角看注意力机制

视觉Transformer(ViT)比CNN对视觉损坏具有更强的鲁棒性[bai2021transformers, paul2022vision],这一特性归因于自注意力机制,它通过将token聚合为语义簇来促进视觉分组[zhou2022understanding]。这种行为在理论上基于信息瓶颈(IB)原理[tishby2000information, DBLP:conf/iclr/AlemiFD017],在该原理下,自注意力被证明在高斯假设下等价于迭代IB优化[zhou2022understanding]。除空间注意力外,XCiT[ali2021xcit]通过交叉协方差注意力探索了通道级分组,并在FAN[zhou2022understanding]中被进一步解释为子空间聚类,其中IB驱动的通道选择可抑制噪声。基于这些见解,StableVLA将多头协方差机制引入VLA模态对齐,以过滤噪声通道并实现稳健的语义传播。

3 方法

在本节中,我们介绍StableVLA——一个旨在增强VLA模型内在鲁棒性的框架。在第3.1节中,我们首先从信息瓶颈(IB)原理的角度对模态对齐问题进行形式化定义。在第3.2节中,我们引入信息瓶颈适配器(IB-Adapter)的概念,该适配器利用通道级注意力机制来抑制视觉干扰,同时保留与任务相关的语义信息。在第3.3节中,我们进一步提出核心贡献——融合型IB-Adapter,这是一种将IB-Adapter与MLP相结合的混合架构,旨在同时保留对精确操作至关重要的鲁棒语义信息和细粒度空间信息。

Refer to caption
图 4:IB-Adapter 与 StableVLA 的架构。我们将 StableVLA 中的标准线性瓶颈层替换为融合型 IB-Adapter。IB-Adapter 通过三条并行路径处理视觉 token,以实施子空间过滤:(1) 协方差注意力:我们利用原始特征作为键(虚线所示)来保留原有的几何结构。我们计算格拉姆矩阵以捕捉全局通道相关性。(2) Sigmoid 门控:一个可学习的 Sigmoid 函数生成注意力图,作为独立的门控机制来抑制噪声。(3) 特征变换:特征在重建之前先经过非线性变换。

3.1 从信息瓶颈视角看模态对齐

一个标准的 VLA 模型通常由三个主要部分组成:一个视觉编码器、一个用于模态对齐的可学习投影器,以及一个基于大语言模型的策略模型。给定视觉观测和文本指令,编码器提取出视觉 token。投影器将这些 token 映射到大语言模型的嵌入空间中:。最后,大语言模型以自回归方式预测动作,其中 表示 的文本嵌入。

在开放世界环境中,视觉输入是任务相关语义与任务无关扰动(例如传感器噪声)的复合体。现有的 VLA 投影器主要实现为 MLP 层。从信息瓶颈的角度来看,这些简单的投影器充当了全通滤波器,倾向于不加区分地最大化互信息。为了增强内在的鲁棒性,我们将模态对齐问题形式化为一个信息瓶颈问题:

(1)

其中 是一个压缩后的表征,它在过滤干扰信息的同时保留目标干净编码(即预测动作 所需的真实任务相关语义)。系数 控制着压缩与信息保留之间的权衡。

关键在于,虽然现代基于 ViT 的编码器能够有效利用空间维度上的信息瓶颈驱动分组机制 [zhou2022understanding],但我们认为,对于 VLA 投影器而言,在通道维度(特征)上执行此类分组对于实现稳健对齐更为关键。在视觉编码器的输出中,语义信息和噪声往往在通道间呈异质分布 [zhou2022understanding]。这促使我们提出了 IB-Adapter,它将每个通道视为一个用于 IB 优化的信息单元。通过对通道间依赖关系进行建模,IB-Adapter 能够识别出稳健的语义子空间,并抑制不相关的噪声。形式上,

命题 3.1。

将视觉编码器的输出视为一组通道级观测值。在高斯分布和潜在结构假设下,最小化公式 1 中 IB 目标的最优表示的迭代更新步骤,对应于一个通道级注意力操作:

(2)

其中 是 的线性投影。算子 是一个由潜在分布假设决定的归一化器:在分类潜在结构下, 采用 Softmax 形式;在独立伯努利潜在结构下,则采用 Sigmoid 形式。

详细推导过程见附录 A。通过将 IB 驱动的分组扩展到通道维度,该方法能够实现动态过滤,抑制噪声通道,同时增强稳定特征,从而在特征传播到下游策略模型之前建立表征的鲁棒性。

3.2 信息瓶颈适配器(IB-Adapter)

为了在模态对齐阶段强制执行 IB 原则,我们提出了信息瓶颈适配器(IB-Adapter)。与独立处理每个通道的 MLP 不同,IB-Adapter 对通道间协方差进行建模,以识别并增强稳健的语义信号。

设 为输入特征(例如,中间投影器特征)。该机制包含三个关键组成部分:子空间协方差建模、基于 Sigmoid 的门控以及非线性特征变换。

子空间协方差建模。

我们采用多头设计来捕获不同语义子空间之间的相关性。输入被划分为多个头,每个头具有一个通道维度。对于每个头,我们通过一个可学习的投影来推导查询,而键则通过输入特征的恒等映射来定义。这种恒等键设计确保了后续的协方差计算基于视觉 token 的内在几何流形,从而保留了可能因冗余投影而衰减的高频空间线索。为了建模通道间的依赖关系,我们通过沿序列维度聚合相关性来计算一个 Gram 矩阵:

(3)

其中每个元素代表通道与通道之间在所有空间 token 上的协方差。

基于 Sigmoid 的子空间门控。

为了将语义簇与独立噪声分离,我们对 Gram 矩阵应用一个可学习的 sigmoid 门控函数:

(4)

其中是一个可学习的温度参数。使用 sigmoid 门控函数的理论动机源于通道的独立伯努利潜在结构假设。代表不相关传感器噪声的通道应与承载语义的通道表现出低协方差,从而导致门控值接近零。与 Softmax 操作不同——后者通过在通道间强制施加分类分布来引入通道间的竞争——sigmoid 门控允许独立的通道选择,通过独立地抑制此类噪声通道,而不影响稳健语义通道的能量。

非线性特征变换。为了增强特征表达能力,输入通过一个带有 GELU 激活函数的两层 MLP 进行变换,以生成值 token:

(5)

其中是可学习的权重。然后,通过使用频谱门控对这些特征进行调制来重建头输出:

(6)

因此。IB-Adapter 将非线性合成与逐通道噪声抑制相结合。这种设计通过在表示传播到大语言模型主干之前过滤掉视觉干扰,满足了 IB 压缩目标(公式 1)。

3.3 用于平衡稳健语义与高频细节的混合架构

虽然 IB-Adapter 能有效抑制视觉干扰并提升语义鲁棒性,但它可能会削弱精确操控所必需的高频细节。这一挑战在长程任务中尤为突出,因为轨迹精度必须在长序列中得以保持。为解决这一权衡问题,我们提出了 Fused IB-Adapter,这是一种双通路架构,旨在将鲁棒的语义理解与精确的空间执行解耦:

(7)

其中 控制鲁棒信号的注入。该设计维持了两条并行通路:一条是高保真通路,使用标准 MLP 来保留精细运动控制所必需的原始高频细节;另一条是去噪通路,使用 IB-Adapter 模块来提取鲁棒的、经协方差过滤的语义特征。

媒体内容 · 前往原文查看
表 1:在 LIBERO 和 CALVIN 基准上的完整对比。方法按训练范式分组。我们报告成功率(%)。粗体:最佳,下划线:次佳。
训练方法 方法 空间 物体 目标 长程 CALVIN
C S3 S4 S5 C S3 S4 S5 C S3 S4 S5 C S3 S4 S5 C S3 S4 S5
OpenX 预训练 OpenVLA (7B) 80.0 40.9 24.6 14.7 69.6 18.2 10.4 2.7 74.0 38.7 27.0 16.3 55.5 20.5 12.4 7.0 – – – –
OpenVLA-OFT (7B) 92.6 89.3 84.0 72.1 98.4 82.5 69.2 52.8 96.8 94.5 84.6 70.3 94.4 77.6 61.9 40.3 – – – –
OpenX+Web 协同训练 OpenPi–0.5 (3B) 98.4 88.3 79.0 62.4 99.4 97.1 88.4 76.4 97.2 87.2 82.5 64.2 92.0 76.1 65.6 47.7 – – – –
VLM 直接微调 VLA-Adapter (0.5B) 96.0 93.7 83.3 58.5 96.8 71.0 44.1 29.3 97.4 79.5 64.7 47.3 94.4 63.5 41.0 26.2 4.14 2.56 1.89 1.44
StableVLA (0.5B) 96.2 94.4 92.1 82.0 98.8 92.4 83.6 70.2 98.0 93.4 85.0 71.9 93.6 76.3 62.4 45.3 4.17 2.77 2.11 1.51

为了根据具体任务动态调整这种平衡,我们在微调过程中校准随机路径丢弃率。对于需要极高空间保真度以完成抓取放置操作(例如 LIBERO-Long)的任务,保留 MLP 路径至关重要。在这些场景中,IB-Adapter 充当鲁棒性残差,在稳定表征的同时,不牺牲精确执行所需的高频线索。对于需要一致物体识别或长程语义规划(例如 CALVIN、LIBERO-Object)的任务,适度的丢弃率会迫使策略内化来自 IB 路径的鲁棒特征,从而防止在视觉损坏下出现语义漂移。这种任务特定的配置使得 StableVLA 能够在不同机器人领域灵活地驾驭鲁棒性场景。

4 实验

4.1 基准测试结果

4.1.1 设置

基准测试。

我们选取广泛使用的 LIBERO 来评估 StableVLA 在各类任务上的性能,并选取 CALVIN 基准测试来评估 StableVLA 的零样本泛化能力。对于 LIBERO,我们使用了全部四个任务类别:LIBERO-Spatial、LIBERO-Object、LIBERO-Goal 和 LIBERO-Long。每个任务套件包含 10 个子任务,每个子任务重复 50 个回合进行评估。我们报告每个任务套件在所有 500 个回合上的平均成功率(范围从 0 到 100%)。对于 CALVIN,StableVLA 在训练期间未见过的环境中进行评估,以测试其泛化性能。具体来说,StableVLA 需要按顺序执行一个预定义的 1000 个任务序列。每个单独任务由五个子任务组成,模型只有在当前子任务完成后才能继续执行下一个子任务。我们报告平均完成的任务数(范围从 0 到 5)。

损坏协议。

为严格评估内在鲁棒性,我们采用了 ImageNet-C [hendrycks2019robustness] 中的损坏协议。我们利用 imagecorruptions 库 [michaelis2019dragon] 提供的全面损坏类型,涵盖四个类别:噪声、模糊、天气和数字损坏。111我们在 LIBERO-Spatial 上评估了全部 19 种损坏。对于 LIBERO-Object/Goal/Long 和 CALVIN 基准,我们排除了玻璃模糊,因为其在交互过程中的计算成本过高,导致这些任务仅包含 18 种损坏类型。这些损坏定义了 5 个严重等级,我们将评估重点放在具有挑战性的高严重等级(第 3-5 级)上,以压力测试架构的稳定性。对于所有评估,我们在所部署的损坏类型上,针对不同的强度设置(干净状态,以及第 3、4、5 级严重等级)进行了实验。

训练协议。

StableVLA 将 VLA-Adapter [wang2025vla-adapter] 框架中的 MLP 投影器替换为我们的融合 IB-Adapter 模块,并在 LIBERO 和 CALVIN 上从头开始训练。详细的超参数、基础设施规格和基线配置见附录 B。遵循标准的 VLA 训练方案,我们在训练过程中应用了轻微的几何(裁剪)和光度(颜色抖动)增强以防止过拟合。关键的是,我们并未让模型暴露于任何前述的损坏类型,也未使用任何专门的鲁棒性技术(例如数据增强)。因此,对损坏的评估严格来说是对架构泛化能力的零样本测试。

基线模型。

我们与最先进的 VLA-Adapter [wang2025vla-adapter] 以及诸如 OpenVLA [kim2024openvla]、OpenVLA-OFT [kim2025fine-tuning] 和 OpenPi–0.5 [DBLP:journals/corr/abs-2504-16054] 等 VLA 模型进行了基准对比。

4.1.2 实验结果。

全面鲁棒性概况。

在表 1 中,我们报告了 LIBERO 上每个任务的成功率以及 CALVIN 上平均完成的任务数,这两个指标均对所有损坏类型进行了平均。StableVLA 在所有基准测试和损坏严重程度上均展现出卓越的零样本鲁棒性。在 LIBERO 上,StableVLA 在所有基线方法中始终获得最佳或次佳分数,与在 OpenX-Embodiment 等大规模数据集上预训练的 OpenVLA-OFT 和 OpenPi 不相上下。与架构相似的 VLA-Adapter 相比,StableVLA 取得了显著改进,尤其是在严重损坏情况下,在严重程度 5 的 4 个任务套件中,性能提升幅度达 40.2% 至 139.6%。在 CALVIN 上,StableVLA 在所有损坏级别下完成的任务数始终多于 VLA-Adapter。这些结果证明了 StableVLA 在各种操作任务中具有卓越的零样本鲁棒性。更详细的结果见附录 C。

Refer to caption
(a) LIBERO 上不同损坏类型间的鲁棒性比较。详见附录 D。
Refer to caption
(b) 在散斑噪声(严重程度 3 和 5)下,融合 IB-Adapter 特征的语义分组。StableVLA 保留了以物体为中心的聚类,而基线方法则出现退化。
图 5:鲁棒性分析。(a) 雷达图展示了四个 LIBERO 任务套件中每种损坏类型的鲁棒性。StableVLA 始终优于基线方法。(b) 输出特征的 K 均值聚类:标准 MLP 产生弥散的特征,而融合 IB-Adapter 在噪声下保持了连贯的语义分组。

如图 5(a) 所示,StableVLA 展现出全面的鲁棒性优势,在所有四个任务套件的绝大多数损坏类别中均超越了 VLA-Adapter 基线。值得注意的是,尽管存在参数差异,StableVLA 仍达到了与大规模 SOTA 模型(OpenPi 和 OpenVLA-OFT)相当或更优的鲁棒性水平。这支持了以下假设:IB-Adapter 模块能有效提取跨多种操作场景的鲁棒语义特征,有助于缩小与规模大得多的基础模型之间的性能差距。

融合 IB-Adapter 特征的可视化。

为了揭示定量增益背后的机制,我们对 Fused IB-Adapter 的特征进行了语义聚类可视化。具体来说,我们对 StableVLA 中 VLA-Adapter 和 Fused IB-Adapter 的 MLP 输出特征进行了 K-Means 聚类。为了便于说明,我们考察了 LIBERO-Object 套件中一个在脉冲噪声(一种以高频、空间独立干扰为特征的损坏类型)下的操作场景。图 5(b) 显示,即使在无噪声条件下(左列),标准 MLP 也会产生弥散的特征,将任务相关区域与背景混为一谈。这种效应在高噪声条件下(右列)被进一步放大,这表明标准投影仪会将高频干扰传播到下游策略。相比之下,Fused IB-Adapter 的输出产生了连贯的、以物体为中心的语义分组。我们将此归因于 Fused IB-Adapter 中基于协方差的 Sigmoid 门控机制。随机损坏与物体结构的相关性较低,产生的 Gram 矩阵值较低,这些值被 Sigmoid 门控抑制,从而实现了对夹爪和操作目标的清晰聚焦。

Refer to caption
图 6:真实世界实验设置可视化。上排:物理损坏(油污和遮挡)。下排:四个评估任务的初始状态。
媒体内容 · 前往原文查看
表 2:真实世界鲁棒性评估。“Clean”列报告绝对成功率(%)。其他所有列报告相对于干净设置下的性能变化(百分点)。Noise 和 Blur 代表不同严重程度下的平均性能下降。Oil 和 Shelter 代表物理干扰。加粗表示最佳鲁棒性(性能下降最小)。
任务 方法 干净 噪声 () 模糊 () 油污 () 遮挡 () 平均 ()
拾取与放置 100.0 -63.3 -16.7 -10.0 -30.0 -30.1
VLA-Adapter 80.0 -66.7 -40.0 -30.0 -60.0 -49.2
StableVLA 80.0 -30.0 -10.0 -10.0 -20.0 -17.5
投掷篮球 80.0 -60.0 -33.3 -20.0 -30.0 -35.8
VLA-Adapter 60.0 -53.0 -40.0 -20.0 -40.0 -38.3
StableVLA 60.0 -36.7 -16.7 -10.0 -10.0 -18.4
倒水 70.0 -60.0 -20.0 -20.0 -20.0 -30.0
VLA-Adapter 40.0 -40.0 -30.0 -10.0 -20.0 -25.0
StableVLA 40.0 -23.3 -16.7 -0.0 -10.0 -12.5
打包玩偶 80.0 -63.3 -33.3 -30.0 -40.0 -41.7
VLA-Adapter 50.0 -40.0 -26.7 -30.0 -30.0 -31.7
StableVLA 60.0 -16.7 -10.0 -20.0 -10.0 -14.2

4.2 真实世界机器人部署

4.2.1 实验设置

机器人平台。

我们使用 Astribot S1 进行真实世界实验,这是一个高精度双臂机器人平台 [gao2025towards]。机器人的底盘和躯干被固定;控制仅限于 14 自由度双臂和夹爪驱动。感知输入包括来自头部摄像头(用于跟踪工作空间中心)和两个腕部摄像头的 RGB 视频流。

任务与数据。

我们设计了四个不同的任务来评估机器人能力的各个方面,范围从基础操作到长周期规划。任务过程的可视化展示见图 7。

  1. 1.

    拾取与放置:评估基础操作能力。我们使用一组 5 个不同的物体进行全面评估,每个物体测试 2 次。我们收集了 1000 个遥操作演示用于微调。

  2. 2.

    投掷篮球:评估对小物体的操作技能。我们为此任务收集了 500 个遥操作演示。

  3. 3.

    倒水:评估操作精度。我们为此任务收集了 500 个遥操作演示。

  4. 4.

    包装玩偶:一个需要多阶段规划的长周期任务:拿起玩偶,将其精确放入盒子中,然后合上盖子。这测试了模型处理精确几何约束的能力。我们收集了 200 个遥操作演示用于微调。

所有专家演示均通过 VR 遥操作获取,头部摄像头主动跟踪工作空间中心。每个模型在每个任务中,针对每种损坏设置评估 10 次。

基准测试协议。

在我们的真实世界实验中,我们引入了四种类型的视觉损坏。首先,我们使用 imagecorruptions 库模拟了两种数字损坏——高斯噪声和散焦模糊,在模型推理前将这些效果应用于输入图像。我们评估了严重程度 2-4 的高斯噪声和严重程度 3-5 的散焦模糊,因为初步实验表明,高严重程度的高斯噪声会导致所有基线模型的性能灾难性下降。其次,我们分别通过用油和塑料盖直接遮挡相机镜头来引入物理失真。由此产生的损坏图像如图 6 所示。为了公平比较,我们以 [DBLP:journals/corr/abs-2504-16054](一个在大规模具身数据上预训练的强通用 VLA 模型)和 VLA-Adapter [wang2025vla-adapter](该模型仅在我们收集的数据集上训练)作为基准。

4.2.2 实验结果

如表 LABEL:tab:real_res 所示,虽然通用基线模型在干净数据上取得了很高的成功率,但在视觉损坏下其性能显著下降。VLA-Adapter 表现出类似的脆弱性。相比之下,StableVLA 展现出卓越的鲁棒性,在所有任务中始终保持着最小的性能下降。值得注意的是,我们的方法在物理干扰(油污和遮挡)下表现出非凡的韧性,有效保持了基线模型难以胜任的操作能力。

媒体内容 · 前往原文查看
表 3:适配器架构消融实验。
基准测试。 方法 干净 平均
LIB. IB-Adapter 96.3 76.0
Fused IB 96.6 79.1
Fused IB-SM 89.6 62.8
CAL. IB-Adapter 1.64 1.44
Fused IB 4.17 2.13
Fused IB-SM 0.46 0.46

双流必要性。如表 3 所示,移除高保真 MLP 路径会导致性能下降。在 LIBERO 上,IB-Adapter 在损坏数据上的平均成功率比 Fused IB-Adapter 低 3.1 个百分点。在 CALVIN 上,从 Fused IB-Adapter 切换到 IB-Adapter 时,平均完成任务数从 2.13 下降到 1.44。双流设计被证明至关重要:MLP 路径保留了细粒度的空间细节,而 IB 路径则提供了语义鲁棒性。

Sigmoid 与 Softmax。如表˜3所示,将 Sigmoid 替换为 Softmax 会导致所有基准测试的性能显著下降。在 LIBERO 上,Fused IB-Adapter 的 Softmax 变体在损坏数据上的性能下降了 16.3 个百分点。在 CALVIN 上,平均完成任务数从 2.13 骤降至 0.46。这从实证角度证实了我们在第˜3.2 节提出的独立伯努利隐变量结构假设。与强制竞争的 Softmax 不同,Sigmoid 激活函数能够实现独立的通道抑制,作为一种更有效的频谱滤波器来处理不相关噪声。此处,SM 表示 Softmax。

5 结论

在这项工作中,我们解决了 VLA 模态对齐在视觉损坏方面的一个显著脆弱性。受信息瓶颈原理的指导,我们提出了 IB-Adapter,这是一种通用的双流架构,将高保真空间处理与基于协方差的频谱滤波协同起来。大量评估证实,这种设计在多种基准测试中赋予了卓越的零样本鲁棒性。值得注意的是,我们的结果表明,架构创新有助于缩小规模差距:尽管使用了小 14 倍的骨干网络且没有外部 OpenX 预训练,我们的方法仍达到了与数据密集型 7B 规模 SOTA 模型相竞争的鲁棒性。作为一种参数高效且可能具有模型无关性的组件,IB-Adapter 为标准投影仪提供了一种引人注目的替代方案,鼓励在下一代具身 AI 的开发中转向鲁棒的架构归纳偏置。

致谢

我们衷心感谢 Simple Silicon Innovation 在整个项目期间提供的宝贵支持。我们也感谢国家自然科学基金(NSFC)在项目号 62522607 下对侯淇彬的部分资助。

参考文献

StableVLA:迈向无需额外数据的鲁棒视觉-语言-动作模型

附录 A 理论推导

在本节中,我们提供命题 3.1 的严格推导。设 为视觉编码器输出,其中每一列代表跨空间 token 的通道级特征向量。我们的目标是找到一个最优的压缩表示,以最小化 IB 拉格朗日量:

(8)

目标干净代码的位置。遵循无监督聚类的信息瓶颈框架,我们将每个通道视为一个数据点(索引为 ),将其聚类到语义组(索引为 )中。我们假设数据分布遵循 ,其中 是一个平滑参数。通道 到聚类 的软分配的第 次迭代步骤由 [tishby2000information] 给出:

(9)

其中 是配分函数。我们用高斯分布近似聚类条件分布 ,并假设 足够小。 和 之间的 KL 散度具有闭式形式:

(10)

将方程 10 代入方程 9,我们得到:

其中常数项被吸收到 中。观察二次形式 ,对于固定的 ,该项在所有聚类中为常数,可以吸收到 中。不失一般性,我们假设聚类间共享协方差且聚类中心经过归一化,使得 ,则有:

配分函数的具体形式决定了归一化方式以及由此产生的注意力机制。现在,我们基于对潜在结构的不同假设来考虑两种情况。

情况 1:类别型潜在结构。

在假设每个通道必须恰好分配到一个聚类的条件下,这些分配形成类别分布。强制执行此约束的配分函数为 ,从而得到:

我们将输出表示定义为这些更新后的聚类中心,即

(11)
(12)

其中我们定义 ,以及 。在矩阵形式下,这产生:

(13)

其中 ,,,, 是一个可学习的偏置项。这里, 是可学习参数。

情况 2:独立伯努利潜在结构。

现在我们放宽类别约束。我们不要求每个通道恰好分配到一个语义组,而是假设通道 与每个聚类 的关联是一个独立的二元决策。设 为一个二元潜在变量,其中 表示通道 与聚类 相关联,遵循独立的伯努利分布。对于特定的配对 ,二元状态空间上的局部配分函数为:

(14)

其中 是一个可学习的偏置项,代表激活阈值(即“关闭”状态的能量)。在此公式下,通道 承载聚类 的语义信息的概率为:

(15)

与情形 1 的推导类似,我们将输出表示定义为这些更新后的聚类中心,即:

(16)
(17)

其中我们定义 ,且 。这里 为 sigmoid 激活函数。写成矩阵形式,可得:

(18)

其中 ,,,, 是一个可学习的偏置项。这里 均为可学习参数。由此确立了本文提出的 IB-Adapter 的函数形式。

备注。

核心区别在于隐层竞争机制:类别结构强制要求各通道竞争分配,从而满足 ;而独立的伯努利结构则允许每个通道-聚类对独立进行评估。对于 VLA 投影器而言,IB-Adapter 天然具有更强的鲁棒性:不相关的噪声通道与所有语义聚类的协方差都很低,导致门控值趋近于零(),从而在有效过滤干扰信息的同时,不会压制合法的语义信号。

附录 B 实现细节

B.1 VLM 预训练(对齐阶段)

由于 StableVLA 引入了融合型 IB-Adapter 投影器——一种将标准 MLP 与基于协方差的 IB-Adapter 模块相结合的混合架构——其投影器权重与标准开源检查点不同。因此,在机器人微调之前,我们首先执行视觉-语言对齐阶段,将融合型 IB-Adapter 生成的视觉 token 与大语言模型的嵌入空间进行对齐。

我们严格遵循 Prismatic VLMs [karamcheti2024prismatic] 协议,使用 LLaVA-LVIS4V-LRV 数据集来确保通用视觉推理能力。表 4(上半部分)详细列出了预训练配置。

B.2 机器人微调与基线方法

对齐完成后,我们对模型进行机器人操控任务的微调。如第 3.3 节所述,融合型 IB-Adapter 采用双路径机制,由融合系数 控制,并通过随机路径丢弃法()进行优化。

为确保最佳性能,我们针对不同的基准测试套件调整了超参数。所有基准测试中预训练和微调的完整超参数汇总于表 4。

基线配置。为确保公平且可复现的比较,我们将所有基线方法统一到我们的评估协议下:

  • •

    OpenVLA [kim2024openvla]:我们使用官方 7B 预训练检查点,并采用标准推理设置。

  • •

    OpenVLA-OFT [kim2025fine-tuning]:我们使用官方发布的检查点。

  • •

    VLA-Adapter [wang2025vla-adapter]:对于 LIBERO,我们使用官方检查点。对于 CALVIN,我们使用官方代码库在相同配置下重新训练了模型。为确保基线强劲,我们评估了收敛轨迹上的多个检查点,并报告了峰值性能。具体来说,我们评估了不同训练阶段的检查点,得分分别为 3.601、4.14、3.628、3.92 和 4.097。我们报告最佳结果(4.14)以代表基线的上限能力。

  • •

    OpenPi () [DBLP:journals/corr/abs-2504-16054]:我们使用官方发布的模型权重,并遵循作者提供的标准评估协议。

媒体内容 · 前往原文查看
表 4:StableVLA 在预训练和微调阶段的详细超参数。
阶段 I:视觉-语言预训练
基础组件 大语言模型:Qwen2.5-0.5B 视觉模型:DINO-SigLIP(224px)
优化 全局批次大小:64 学习率:2e-5 精度:BF16
融合 IB-Adapter 参数 融合系数():0.3 路径丢弃率():0.0
阶段 II:机器人微调
LIBERO 基准测试 CALVIN
超参数 空间 目标 长序列 物体 基准测试
全局批次大小 64 128 128 64 64
学习率 2e-4 2e-4 2e-4 2e-4 2e-4
LoRA 秩 64 64 64 64 64
融合 IB-Adapter 特定参数(我们的)
融合系数() 0.3 0.3 0.3 0.3 0.3
路径丢弃率() 0.3 0.4 0.0 0.3 0.3

附录 C 详细实验结果

在本附录中,我们提供了实验中评估的所有方法的全面定量结果。

C.1 LIBERO 上的完整对比

表 5 展示了所有方法在 LIBERO 基准测试上的完整对比,并按训练范式进行了分组。这些方法分为三类:(1) OpenX 预训练,包括在 Open X-Embodiment 数据集上预训练的模型;(2) OpenX + 网络协同训练,在预训练期间额外引入了网络数据;(3) VLM 直接微调,直接从视觉语言模型进行微调,不进行机器人特定的预训练。

媒体内容 · 前往原文查看
表 5:LIBERO 基准测试上的完整对比。方法按训练范式分组。我们报告成功率(%)。粗体:最佳,下划线:次佳。
空间 物体 目标 长序列
训练 方法 C S3 S4 S5 C S3 S4 S5 C S3 S4 S5 C S3 S4 S5
OpenX 预训练 OpenVLA 80.0 40.9 24.6 14.7 69.6 18.2 10.4 2.7 74.0 38.7 27.0 16.3 55.5 20.5 12.4 7.0
OpenVLA-OFT 92.6 89.3 84.0 72.1 98.4 82.5 69.2 52.8 96.8 94.5 84.6 70.3 94.4 77.6 61.9 40.3
OpenX + 网络协同训练 OpenPI0.5 98.4 88.3 79.0 62.4 99.4 97.1 88.4 76.4 97.2 87.2 82.5 64.2 92.0 76.1 65.6 47.7
VLM 直接微调 VLA-Adapter-Pro 96.0 93.7 83.3 58.5 96.8 71.0 44.1 29.3 97.4 79.5 64.7 47.3 94.4 63.5 41.0 26.2
StableVLA 96.2 94.3 92.1 82.0 98.8 92.4 83.6 70.2 98.0 93.4 85.0 71.9 93.6 76.3 62.4 45.3

C.2 各方法详细结果

以下表格提供了每种方法按损坏类型划分的详细结果。每个表格报告了在严重级别 3、4 和 5 下,所有 19 种损坏类型(对于没有玻璃模糊的任务为 18 种)的性能,以及干净(未损坏)性能。

StableVLA(我们的方法)。

表 6 展示了我们的方法在 LIBERO 和 CALVIN 基准测试上的详细结果。

媒体内容 · 前往原文查看
表 6:StableVLA 在 LIBERO 和 CALVIN 基准测试上的详细结果。我们报告 LIBERO 的成功率(%)和 CALVIN 的平均完成任务数。
LIBERO CALVIN
空间 物体 目标 长序列 -
损坏 S3 S4 S5 S3 S4 S5 S3 S4 S5 S3 S4 S5 S3 S4 S5
干净 96.2 - - 98.8 - - 98.0 - - 93.6 - - 4.17 - -
高斯噪声 96.0 92.8 74.0 95.4 85.0 64.8 95.2 85.2 53.2 82.8 53.6 25.0 2.02 1.26 0.60
散粒噪声 95.4 88.0 71.0 93.2 80.6 64.0 96.2 81.4 61.8 84.8 63.0 23.4 1.85 0.82 0.46
脉冲噪声 94.6 93.2 80.8 96.0 83.2 62.8 96.2 81.8 57.2 81.2 55.2 30.2 2.60 1.32 0.72
散斑噪声 94.6 96.6 90.4 95.6 93.2 87.2 97.8 96.0 86.4 87.2 84.0 71.8 2.16 1.49 0.90
高斯模糊 91.6 83.0 49.4 84.4 45.4 2.4 91.8 74.0 42.6 55.4 31.2 2.8 2.18 0.94 0.34
玻璃模糊 91.2 83.6 55.8 - - - - - - - - - - - -
散焦模糊 89.4 81.6 65.0 72.8 46.8 24.8 85.8 63.0 47.2 49.6 27.2 10.6 1.56 0.64 0.34
运动模糊 89.6 90.4 82.6 98.2 72.0 27.4 93.4 59.8 37.6 66.0 21.6 1.0 1.23 0.46 0.24
缩放模糊 95.8 93.6 86.2 60.8 49.8 46.8 91.0 82.8 69.0 36.8 16.8 11.2 3.48 2.86 2.10
雾 95.0 94.0 94.4 99.8 99.6 94.8 94.4 95.2 81.4 78.4 75.0 57.0 2.84 1.97 0.88
霜 96.0 93.8 89.8 84.0 79.4 67.4 92.0 88.6 81.0 72.6 69.2 54.8 3.11 2.99 2.64
雪 95.4 94.8 94.2 97.4 92.2 95.4 92.0 85.4 95.4 61.0 39.2 33.0 3.45 2.50 1.62
溅射 96.6 95.0 95.2 98.2 98.6 93.4 93.8 94.4 91.2 90.8 94.4 87.2 4.13 4.04 3.74
对比度 94.2 95.2 68.0 99.0 98.4 78.6 97.6 95.6 56.8 93.6 90.2 52.6 3.74 2.30 0.59
亮度 96.4 96.2 97.0 98.4 99.0 98.4 98.0 99.0 98.0 92.4 90.2 90.6 4.04 3.48 2.71
饱和度 96.6 96.4 98.0 98.8 98.2 97.2 96.6 98.2 97.8 93.4 92.0 89.8 4.20 4.19 4.17
JPEG 压缩 96.2 96.6 94.4 98.6 98.8 97.4 96.8 97.4 96.8 89.4 88.8 73.8 2.79 2.42 1.50
像素化 94.6 95.2 94.4 96.4 96.4 95.6 97.6 96.8 95.6 92.8 93.0 84.6 2.60 2.86 2.69
弹性变换 91.6 90.4 78.2 95.6 89.0 65.8 74.4 55.2 45.2 65.2 38.8 16.2 1.94 1.49 0.99
VLA-Adapter-Pro.

表 7 展示了 VLA-Adapter-Pro 的结果,这是与我们 VLM 直接微调范式共享的最强基线。

媒体内容 · 前往原文查看
表 7:VLA-Adapter-Pro 在 LIBERO 和 CALVIN 基准上的详细结果。我们报告 LIBERO 的成功率(%)和 CALVIN 的平均完成任务数。
LIBERO CALVIN
空间 物体 目标 长序列 -
损坏 S3 S4 S5 S3 S4 S5 S3 S4 S5 S3 S4 S5 S3 S4 S5
干净 96.0 - - 96.8 - - 97.4 - - 94.4 - - 4.14 - -
高斯噪声 98.2 93.8 32.4 97.2 53.8 0.0 79.4 53.4 26.0 69.4 37.0 1.0 2.35 1.03 0.29
散粒噪声 97.8 84.6 12.8 93.8 23.4 0.0 74.6 49.2 36.6 76.4 22.8 4.0 2.06 0.80 0.21
脉冲噪声 99.0 93.2 38.0 98.8 67.8 0.0 77.4 56.8 26.4 72.0 38.6 2.6 2.92 1.14 0.37
斑点噪声 97.8 97.4 85.0 97.2 85.4 40.0 75.2 67.8 54.6 83.2 71.2 28.2 2.59 1.76 0.90
高斯模糊 89.2 56.2 3.8 28.0 0.0 0.0 87.6 72.6 26.8 37.0 3.2 0.0 0.76 0.12 0.00
玻璃模糊 72.6 41.4 8.0 - - - - - - - - - - - -
散焦模糊 77.8 35.6 6.6 5.0 0.0 0.0 81.6 60.0 36.4 19.6 1.4 0.0 0.41 0.06 0.00
运动模糊 88.0 59.2 29.0 11.6 0.0 0.0 89.2 47.2 21.4 36.2 8.0 0.0 0.69 0.08 0.01
缩放模糊 87.8 78.0 71.8 19.2 6.0 0.0 73.2 59.0 41.0 9.0 1.2 2.0 2.95 2.43 1.76
雾 98.6 98.0 93.6 63.4 11.8 0.2 77.4 71.0 46.2 52.4 37.0 12.6 2.77 2.38 1.34
霜 93.8 90.2 81.4 32.2 22.8 8.2 59.8 55.0 43.2 49.4 36.4 19.0 3.61 3.46 3.37
雪 97.2 91.6 95.6 63.0 7.6 59.2 58.2 40.6 57.0 41.8 6.0 13.6 3.64 3.03 2.73
溅射 98.4 96.6 88.0 97.2 53.4 6.0 89.2 77.6 61.0 82.4 68.2 36.2 4.05 3.93 3.23
对比度 99.4 97.8 25.8 88.6 0.0 0.0 91.4 79.0 26.0 68.6 4.4 0.0 2.54 0.78 0.01
Brightness 98.2 99.4 97.8 98.8 98.4 98.6 89.8 89.6 88.2 91.2 91.4 86.0 4.16 4.12 3.74
Saturate 99.2 99.2 99.2 98.4 98.4 94.0 98.0 92.8 88.0 93.8 80.8 84.0 4.13 4.13 4.14
JPEG 压缩 99.0 98.2 98.6 98.4 98.8 98.8 87.4 84.4 81.6 90.4 88.8 81.4 1.80 1.14 0.53
像素化 98.2 97.2 94.8 96.2 91.0 80.0 97.0 95.0 88.6 89.6 85.0 69.4 2.65 2.01 1.94
弹性变换 90.2 74.8 50.2 90.8 75.0 42.6 44.2 14.2 2.8 80.4 56.8 31.8 1.89 1.61 1.26
OpenVLA。

表 8 展示了基础 OpenVLA 模型的结果。

媒体内容 · 前往原文查看
表 8:OpenVLA 在 LIBERO 基准测试上的详细结果。我们报告成功率(%)。
空间 物体 目标 长序列
干扰 S3 S4 S5 S3 S4 S5 S3 S4 S5 S3 S4 S5
干净 80.0 - - 69.6 - - 74.0 - - 55.5 - -
高斯噪声 50.2 0.6 0.0 0.6 0.0 0.0 31.4 4.8 0.0 8.4 0.2 0.0
散粒噪声 39.0 0.0 0.0 0.4 0.0 0.0 23.6 2.8 0.0 5.6 0.0 0.0
脉冲噪声 55.2 1.4 0.0 3.0 0.0 0.0 41.0 4.8 0.0 9.2 1.6 0.0
散斑噪声 61.0 26.0 2.8 5.2 0.2 0.0 40.8 17.2 8.4 17.6 3.8 0.0
高斯模糊 0.0 0.0 0.0 0.0 0.0 0.0 2.4 0.2 0.0 0.0 0.0 0.0
玻璃模糊 0.0 0.0 0.0 - - - - - - - - -
散焦模糊 0.0 0.0 0.0 0.0 0.0 0.0 0.4 0.2 0.8 0.0 0.0 0.0
运动模糊 0.0 0.0 0.0 0.0 0.0 0.0 0.6 0.0 0.0 0.0 0.0 0.0
缩放模糊 7.6 3.2 0.2 0.6 0.0 0.0 14.0 3.4 1.6 3.0 0.2 0.0
雾 74.6 69.4 38.0 46.4 24.2 0.4 76.2 69.0 40.2 51.0 46.4 20.2
霜 20.2 16.8 4.4 0.6 0.2 0.4 28.4 22.8 14.0 15.6 12.0 4.2
雪 39.0 10.4 22.2 0.4 0.0 0.0 28.6 19.8 15.0 14.6 2.2 3.2
溅射 65.4 32.4 3.8 14.2 0.2 0.0 50.2 37.0 16.2 36.0 12.6 2.2
对比度 71.2 52.6 6.8 57.4 28.0 0.0 75.0 69.2 16.8 50.2 38.8 10.0
亮度 78.4 73.8 62.8 64.6 53.2 29.0 76.0 73.4 60.8 52.6 45.6 41.2
饱和度 80.8 81.4 74.2 65.8 47.8 12.6 75.2 75.2 69.8 55.6 48.6 40.2
JPEG 压缩 72.4 69.8 56.6 42.6 29.4 5.8 73.8 63.2 45.0 31.8 10.0 4.2
像素化 60.0 29.0 7.2 24.8 3.6 0.0 53.6 21.2 5.2 15.4 1.0 0.0
弹性变换 2.6 0.2 0.0 1.0 0.2 0.0 5.4 1.8 0.4 3.2 1.0 0.0
OpenVLA-OFT。

表 9 展示了采用正交微调的 OpenVLA 的结果。

媒体内容 · 前往原文查看
表 9:OpenVLA-OFT 在 LIBERO 基准测试上的详细结果。我们报告成功率(%)。
空间 物体 目标 长序列
干扰 S3 S4 S5 S3 S4 S5 S3 S4 S5 S3 S4 S5
干净 92.6 - - 98.4 - - 96.8 - - 94.4 - -
高斯噪声 90.4 89.2 67.8 88.6 56.4 21.2 94.4 87.2 56.0 74.6 47.6 13.8
散粒噪声 90.8 85.4 70.2 88.0 85.4 70.2 97.0 76.0 57.4 82.4 45.6 12.0
脉冲噪声 90.2 85.6 64.8 90.2 56.0 25.8 95.6 84.0 56.4 80.2 48.0 18.8
散斑噪声 92.4 90.0 84.4 91.4 83.6 56.8 96.6 94.2 80.8 88.4 81.0 47.0
Gaussian Blur 86.8 80.6 46.6 53.0 35.0 4.6 96.4 84.8 48.0 78.0 38.4 6.2
Glass Blur 84.4 73.6 42.6 - - - - - - - - -
Defocus Blur 85.6 69.4 46.8 47.6 27.6 11.2 93.0 76.8 53.4 57.8 30.2 11.0
Motion Blur 77.6 55.6 39.4 57.4 20.6 3.8 89.6 51.6 27.8 42.6 16.0 4.6
Zoom Blur 82.2 71.8 62.6 70.8 44.0 30.8 87.4 77.6 69.6 54.8 38.2 13.4
Fog 90.4 87.8 73.0 94.0 85.6 59.2 96.0 92.0 63.0 81.6 71.0 37.8
霜冻 91.6 89.0 83.0 84.0 80.8 83.0 90.6 83.8 70.2 69.2 61.4 54.2
雪 92.4 89.2 93.0 88.2 80.2 61.4 89.6 64.6 83.0 61.6 35.2 29.0
溅斑 93.2 90.0 84.0 96.6 92.6 86.4 95.4 90.8 84.6 88.6 90.8 71.8
对比度 91.8 89.4 69.6 96.0 90.6 56.8 98.4 93.2 66.2 91.0 84.6 32.4
亮度 93.8 94.2 92.4 96.0 94.8 93.0 99.0 98.2 97.6 91.2 91.8 90.0
饱和度 92.8 92.4 92.8 92.8 95.4 94.0 95.4 95.0 97.6 91.6 91.8 85.2
JPEG 压缩 92.2 92.2 92.6 97.0 96.8 91.8 98.6 96.0 97.2 92.0 87.4 83.8
像素化 91.6 90.8 90.4 86.2 69.6 64.2 97.0 97.4 96.6 91.8 90.0 84.6
弹性变换 86.6 80.2 74.4 66.6 51.2 36.0 90.6 79.8 60.2 80.0 65.2 29.6
OpenPI.

表 10 展示了 OpenPI 的结果,该方法利用了互联网规模的协同训练。

媒体内容 · 前往原文查看
表 10:OpenPI 在 LIBERO 基准测试上的详细结果。我们报告的是成功率(%)。
空间 物体 目标 长序列
损坏 S3 S4 S5 S3 S4 S5 S3 S4 S5 S3 S4 S5
干净 98.4 - - 99.4 - - 97.2 - - 92.0 - -
高斯噪声 98.4 92.0 29.8 98.4 98.0 58.4 96.2 78.0 21.6 88.4 73.2 13.0
散粒噪声 98.0 75.0 24.2 98.8 95.8 53.0 94.0 79.6 31.8 89.4 72.6 29.8
脉冲噪声 98.4 94.8 36.0 99.4 98.6 62.0 95.2 79.4 28.2 90.0 73.4 17.6
斑点噪声 97.6 98.0 77.8 98.4 98.6 96.6 96.6 92.6 86.6 87.0 83.6 79.0
高斯模糊 41.4 10.8 0.0 88.8 10.0 0.0 76.4 44.6 1.6 11.0 0.4 0.0
玻璃模糊 59.8 39.2 9.0 - - - - - - - - -
散焦模糊 43.2 17.6 6.8 83.0 32.4 0.8 69.2 47.2 11.6 10.6 0.6 0.0
运动模糊 81.6 38.4 10.8 96.2 77.8 34.8 87.0 55.0 24.4 62.4 21.6 1.2
变焦模糊 80.4 75.8 74.4 99.4 98.4 97.4 89.6 83.2 77.0 60.0 0.8 1.0
雾 96.8 92.0 81.0 98.4 99.0 97.2 97.0 96.0 82.4 87.6 76.4 50.2
霜冻 95.8 91.0 77.4 98.8 98.8 95.4 85.8 81.6 72.4 47.6 74.2 56.2
雪 97.2 91.8 91.4 99.4 98.2 98.2 92.8 77.8 79.8 89.6 76.0 40.8
溅斑 99.0 98.0 96.0 98.6 99.6 99.4 96.8 96.8 93.0 94.0 93.6 90.0
对比度 98.4 97.0 94.0 98.6 99.0 96.0 98.0 97.2 93.6 89.6 88.6 67.4
亮度 98.2 98.2 98.0 98.8 99.2 99.4 8.2 97.2 97.0 92.2 91.8 93.2
饱和度 99.2 99.0 98.4 97.6 98.2 98.8 98.4 97.0 97.2 92.8 92.2 94.0
JPEG 压缩 96.0 97.2 96.8 98.4 99.2 99.0 96.2 95.0 95.8 88.6 88.2 88.2
像素化 99.4 96.8 88.2 98.0 90.4 88.0 97.4 96.4 80.6 93.6 83.4 55.8
弹性变换 99.2 97.8 96.0 99.6 99.8 100.0 94.8 90.4 81.4 95.0 90.0 81.6

C.3 消融实验详情

以下表格提供了我们关于适配器架构设计的消融实验的详细结果。

IB-Adapter。

表 11 展示了 IB-Adapter 的结果,该方法仅使用图像桥接组件,不进行特征融合。

媒体内容 · 前往原文查看
表11:IB-Adapter在LIBERO和CALVIN基准测试上的详细结果。我们报告LIBERO的成功率(%)和CALVIN的平均完成任务数。
LIBERO CALVIN
空间 物体 目标 长序列 -
损坏 S3 S4 S5 S3 S4 S5 S3 S4 S5 S3 S4 S5 S3 S4 S5
干净 97.8 - - 0.97 - - 97.4 - - 93.8 - - 1.64 - -
高斯噪声 95.2 94.2 79.4 96.6 80.0 15.0 85.8 78.0 57.2 88.0 54.4 9.8 1.61 1.58 1.47
散粒噪声 96.0 91.4 76.6 95.4 67.8 15.0 86.4 70.6 62.6 84.8 56.2 1.7 1.63 1.61 1.43
脉冲噪声 97.4 95.0 84.0 97.4 86.2 23.4 89.0 77.0 55.4 87.0 54.8 12.4 1.66 1.60 1.50
散斑噪声 96.8 96.2 91.4 96.6 97.0 92.2 84.2 84.2 77.2 89.4 80.0 58.4 1.55 1.54 1.37
高斯模糊 88.6 80.8 32.4 88.0 36.6 2.0 93.6 86.0 68.4 56.0 41.2 5.2 1.52 1.44 1.26
玻璃模糊 89.4 75.4 43.2 - - - - - - - - - - - -
散焦模糊 88.0 78.6 45.4 85.2 35.6 17.4 89.2 79.6 68.4 50.6 37.4 13.6 1.53 1.46 1.32
运动模糊 93.0 87.6 74.6 91.4 40.6 2.0 91.2 75.2 56.0 71.0 21.0 1.8 1.44 1.23 1.16
变焦模糊 96.0 90.4 88.0 50.4 13.2 12.0 92.6 83.4 66.6 44.0 18.5 10.4 1.54 1.59 1.48
雾 98.4 98.0 93.4 96.4 96.4 56.8 86.6 86.0 65.4 87.6 81.4 52.2 1.11 1.09 0.92
霜 95.2 93.8 89.4 94.0 85.8 69.8 75.0 70.4 63.0 68.8 60.8 43.2 1.70 1.66 1.61
雪 98.8 97.4 96.6 97.4 89.4 98.4 84.4 69.8 83.4 69.8 48.0 50.2 1.55 1.30 1.00
溅射 97.8 97.8 98.4 98.0 97.6 96.8 93.6 88.0 79.6 91.8 92.2 76.8 1.72 1.58 1.54
对比度 95.4 96.0 82.2 97.6 84.2 0.2 97.2 85.0 56.4 90.6 77.0 5.2 1.39 0.61 0.31
亮度 96.6 97.2 96.4 97.6 97.2 96.6 97.4 97.4 97.4 90.6 90.8 91.6 1.44 1.10 0.91
饱和度 97.4 95.6 96.6 98.0 98.0 98.0 97.4 97.0 95.4 92.0 92.4 90.4 1.69 1.67 1.66
JPEG压缩 96.4 94.4 89.6 98.2 98.6 97.6 95.6 88.0 90.6 93.0 90.6 84.6 1.60 1.55 1.54
像素化 94.6 94.4 93.6 98.0 96.0 95.6 97.8 95.0 94.0 91.0 84.4 78.4 1.57 1.48 1.58
弹性变换 88.4 79.2 63.6 95.2 92.6 69.6 79.0 66.4 51.4 57.8 39.2 16.0 1.77 1.70 1.71
融合IB-Adapter-softmax。

表12展示了在融合机制中使用softmax归一化替代sigmoid的变体结果。

媒体内容 · 前往原文查看
表12:融合IB-Adapter-softmax在LIBERO和CALVIN基准测试上的详细结果。我们报告LIBERO的成功率(%)和CALVIN的平均完成任务数。
LIBERO CALVIN
空间 物体 目标 长序列 -
损坏 S3 S4 S5 S3 S4 S5 S3 S4 S5 S3 S4 S5 S3 S4 S5
干净 72.2 - - 96.0 - - 97.2 - - 93.2 - - 0.46 - -
高斯噪声 71.4 50.6 9.4 96.6 93.0 83.0 90.6 67.8 41.8 59.2 28.8 3.4 0.47 0.46 0.46
散粒噪声 65.0 34.0 6.0 95.8 90.2 85.6 90.4 66.2 45.6 60.4 20.6 2.6 0.45 0.47 0.45
脉冲噪声 68.6 50.0 11.8 97.8 93.4 87.0 90 66.0 44.8 62.0 29.2 4.2 0.47 0.46 0.46
Speckle Noise 70.2 55.8 36.8 97.2 96.2 90.4 93.2 89.6 75.0 71.8 56.2 29.4 0.47 0.47 0.46
高斯模糊 38.6 11.6 0.0 93.0 82.2 20.2 93.2 76.8 46.2 60.2 35.4 0.4 0.46 0.45 0.46
散焦模糊 30.6 11.2 0.6 93.0 76.8 51.8 90.2 67.8 53.8 52.8 32.0 5.2 0.46 0.44 0.46
运动模糊 49.0 21.8 6.8 93.6 69.0 20.2 92.8 59.2 39.0 56.4 10.4 0.2 0.46 0.46 0.45
变焦模糊 29.4 19.8 7.8 48.0 5.8 18.0 80.8 73.0 56.0 28.8 10.0 1.4 - - -
雾 67.0 55.6 25.6 97.8 98.6 98.6 95.2 93.2 75.4 81.2 66.8 17.8 0.47 0.46 0.46
霜 58.4 52.4 44.8 85.0 80.8 68.0 71.8 65.8 54.4 34.0 29.4 13.0 0.44 0.47 0.45
雪 53.0 47.6 52.2 96.2 85.0 94.8 86.2 66.6 80.6 58.8 28.0 20.4 0.46 0.47 0.45
溅射 71.0 56.2 46.2 94.4 97.6 96.0 94.2 87.8 79.4 71.4 80.2 59.8 0.46 0.46 0.46
对比度 73.0 55.6 6.0 97.6 98.2 4.2 97.6 95.6 64.6 85.0 68.0 8.0 0.46 0.46 0.47
亮度 74.0 73.2 76.4 97.4 96.6 94.4 98.2 96.8 97.6 87.6 89.0 89.4 0.44 0.46 0.45
饱和度 71.8 70.6 64.6 98.0 96.6 96.4 95.6 97.0 97.2 91.4 88.6 84.8 0.46 0.45 0.46
JPEG 压缩 74.0 70.4 71.4 97.8 98.2 97.4 97.4 95.8 96.0 79.6 80.4 71.0 0.46 0.46 0.46
像素化 61.8 53.8 52.2 96.4 94.2 93.8 97.6 96.6 95.8 86.8 77.2 69.6 0.48 0.47 0.45
弹性变换 30.6 19.4 11.8 94.2 91.6 68.2 68.0 40.8 14.4 47.0 19.8 0.4 0.45 0.45 0.44

附录 D 雷达图详情

图 5(a) 展示了 18 种损坏类型下的归一化鲁棒性得分。对于每种损坏类型,得分是在干净图像和严重程度 3–5 上取平均,然后进行归一化,使得最佳方法等于 1。损坏类型索引列于表 13。

媒体内容 · 前往原文查看
表 13:雷达图的损坏类型索引。
索引 损坏类型 索引 损坏类型
1 高斯噪声 10 霜
2 散粒噪声 11 雪
3 脉冲噪声 12 溅射
4 斑点噪声 13 对比度
5 高斯模糊 14 亮度
6 散焦模糊 15 饱和度
7 运动模糊 16 JPEG 压缩
8 变焦模糊 17 像素化
9 雾 18 弹性变换
*LIBERO-Spatial 包含玻璃模糊作为索引 19。

附录 E 真实世界实验的定性结果

Refer to caption
图 7:真实世界实验的定性结果。该图展示了机器人使用 StableVLA 执行的五个不同操作任务的成功执行序列。

附录 F 详细的相关工作与预备知识

F.1 视觉-语言-动作(VLA)模型

利用预训练的视觉-语言模型(VLM)[liu2023visual, comanici2025gemini, liu2024nvila, bai2025qwen2, zhu2025internvl3, xie2024show, li2024llava]进行机器人控制,已成为具身智能领域的主流范式[brohan2023rt-1, zitkovich2023rt-2, kim2024openvla, team2024octo]。然而,从头开始预训练这些模型依赖于海量数据集,例如 Open X-Embodiment [oneill2024open] 和 AgiBot [contributors2024agibotworldrepo],这需要大量的计算资源。为了减轻这种计算负担,VLA-Adapter [wang2025vla-adapter] 提出了一种资源高效的替代架构。与标准范式不同,它跳过了在大规模数据集上昂贵的预训练阶段,从而将 VLM 的通用感知能力直接迁移到特定的机器人领域。

尽管在训练效率方面取得了进展,但在架构鲁棒性方面仍然存在一个关键差距。在标准的 VLA 模型中,视觉编码器 [zhai2023sigmoid, oquab2023dinov2] 通常在端到端训练期间被冻结,以保留语义先验知识 [kim2024openvla, kim2025fine-tuning],这意味着输入级别的噪声或损坏会通过视觉主干网络传播。为了将视觉特征与下游策略的动作空间对齐,现有模型使用简单的 MLP 投影器,这些投影器理想情况下充当接口,在扰动影响策略网络之前对其进行抑制。标准的 MLP 虽然能有效保留空间细节,但缺乏过滤掉与任务无关的干扰的内在机制。我们的工作通过重新设计投影器的架构来解决这个问题,使其能够在模态对齐过程中实现噪声抑制。

F.2 视觉与机器人领域的鲁棒性

感知鲁棒性对于机器人策略的可靠部署至关重要。在计算机视觉领域,这通常通过 ImageNet-C [hendrycks2019robustness] 等基准来评估,这些基准引入了噪声、模糊、天气和数字损坏等视觉扰动。虽然分类任务使用平均分类误差(mCE)作为标准指标,但在视觉-语言-动作(VLA)语境下,鲁棒性从根本上与策略在类似扰动下的成功率挂钩。增强鲁棒性的主流策略主要依赖于数据增强。在计算机视觉中,像 [hendrycks2021many] 这样的技术会在训练过程中模拟损坏,以提高稳定性。类似地,在机器人学习中,域随机化 [tobin2017domain] 是标准方法,它会在仿真中随机扰动视觉纹理或物理参数。

然而,这些以数据为中心的方法面临两个显著限制。首先,它们会产生巨大的训练成本,通常需要模型在大量增强数据集上进行训练。其次,这些方法往往依赖于记忆特定的噪声模式,这使得它们难以泛化到未见过的损坏类型。因此,我们提出了 StableVLA,它通过架构设计专注于内在鲁棒性。我们证明,通过利用信息瓶颈原则重构模态对齐接口,VLA 模型能够有效过滤视觉扰动,而无需进行详尽的噪声模式模拟。

F.3 从信息瓶颈视角看注意力机制

与卷积神经网络相比,视觉Transformer(ViT)在应对各类图像损坏时展现出更强的鲁棒性 [bai2021transformers, paul2022vision]。[zhou2022understanding] 将这一特性归因于自注意力机制,该机制促进了视觉分组,使模型token聚合为语义簇。这一现象在理论上基于信息瓶颈(IB)原理 [tishby2000information],该原理优化了输入压缩与相关信息保留之间的权衡。值得注意的是,[zhou2022understanding] 证明,在高斯假设下,信息瓶颈目标的迭代优化在数学上等价于自注意力运算。

标准注意力机制在空间维度上运作,而近期研究则探索了跨通道的视觉分组。XCiT [ali2021xcit] 引入了交叉协方差注意力,用于计算通道间的交互,从而显著降低了计算复杂度。FAN [zhou2022understanding] 进一步指出,该机制起到了子空间聚类的作用;通过将信息瓶颈原理应用于通道维度,模型能够在抑制噪声通道的同时,识别出连贯的语义子空间。StableVLA 将这一洞见扩展至视觉-语言-动作(VLA)模态对齐,集成了多头协方差机制以过滤噪声通道,从而确保具身决策中稳健的语义传播。

来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org