AFUN: 迈向功能理解的可供性基础模型
AFUN: Towards an Affordance Foundation Model for Functionality Understanding
AFUN是一个用于功能理解的可供性基础模型。它从单个RGB-D观察和语言任务描述出发,能同时预测任务条件的功能掩码(where)和3D接触后运动曲线(how)。为实现开放世界泛化,该研究构建了一个大规模标准化数据管道,整合了机器人、人类、仿真与真实扫描数据。评估结果显示,AFUN在可供性分割任务上,于4个基准的8个测试集中平均gIoU/cIoU指标分别大幅领先基线模型+23.9/+26.3;在接触点预测上,命中率比最佳基线高出12.7%–61.3%;在3D运动预测上也取得最佳性能。该模型无需针对特定机器人实体进行微调即可直接部署。
在 affordance 基础模型方向做出一步,跨 8 个测试集大幅超越基线,并可直接部署到真实机器人,对具身智能的通用化是个值得关注的信号。
王兆宁
钟毅
付嘉伟
亨里克·I·克里斯滕森
高军
密歇根大学
加州大学圣迭戈分校
摘要
功能理解(Affordance understanding)连接了视觉感知与物理动作,为在开放且非结构化的真实世界环境中进行机器人操作提供了一个可解释的接口。然而,构建一个不仅能理解交互应在何处以及如何进行,还能在多样化的环境、物体和任务中泛化的功能基础模型(affordance foundation model),仍然是一个长期存在的研究挑战。现有方法通常只解决这一挑战的部分问题:要么定位任务相关区域但未指定可执行的动作,要么预测动作但可扩展性有限。在本文中,我们提出了 AFUN,这是迈向用于功能理解的功能基础模型的一步。通过单张 RGB-D 观测图像和一条语言任务描述,AFUN 能够预测一个任务条件功能掩码(在哪里交互)和一个三维接触后运动曲线(如何交互)。为了支持开放世界泛化,我们构建了一个大规模标准化数据流水线,将异构的机器人、人类、仿真和真实世界扫描数据转换为一个共享的功能模式(affordance schema),包含语言、掩码和以物体为中心的三维运动标签。我们从三个方面评估了 AFUN:在功能分割方面,AFUN 在来自 4 个基准测试的 8 个测试集上以较大优势超越了所有基线方法,平均 gIoU/cIoU 分别提升了 +23.9/+26.3;在接触点预测方面,它预测的点位显著更准确,命中率相比最佳基线提升了 12.7–61.3%;在三维运动方面,它在所有三个测试集上都取得了最佳性能。AFUN 可直接部署用于真实世界的机器人操作,无需针对机器人本体进行微调或使用任务特定的启发式规则,展示了适应开放世界功能任务的能力。项目页面:https://www.zhaoningwang.com/AFUN
1 引言
想象一下走进一间全新的卧室;人类能立刻理解哪个物体可以做什么,以及如何去做。例如,抽屉可以通过其把手打开或关闭,而人类在实际动作之前就能识别出精确的抓取位置。这种理解物体功能性的视觉可供性概念,支撑着人类在非结构化真实环境中执行日常任务的能力。在机器人学和具身AI领域,可供性理解充当着视觉理解与物理动作之间关键且可解释的接口。然而,构建一个能够跨不同环境、物体和任务进行扩展的可供性理解基础模型,是一项长期存在的研究挑战。
构建这样一个可供性基础模型需要满足三个相互关联的要求。(一)用于训练模型的数据集必须反映真实世界操作任务的多样性,以实现泛化能力,而非从狭窄领域或封闭的物体类别集合中收集。(二)模型需要精确生成基于指令的分割掩码:不仅要定位机器人可以交互的位置,还要根据指令进行调整,因为同一物体在不同任务下会提供不同的可供性区域。(三)为使交互对机器人具有可操作性,模型必须进一步预测交互应如何执行,并提供机器人可遵循的3D运动表征。该3D运动应保持足够的表达能力以捕捉多样化行为,同时具备足够的结构化程度以支持稳定的监督和机器人执行。
然而在实际应用中,现有的可供性方法主要只关注第二个要求,将问题建模为静态分割[73, 47]、关键点检测[88]或基于推理的定位[70]。这些方法能够定位交互区域,但无法描述物体在交互后应如何移动。对于关注第三个要求的方法,有些在二维空间中预测运动[79, 2],导致在提升到三维时机器人执行存在歧义,而其他方法[87]则需要启发式地定位可操作物体。除了每种模态的局限性之外,当前大多数用于可供性理解的深度学习模型[79, 2, 7, 87]由于数据集规模小且多样性有限,仍然缺乏开放世界泛化能力。
为解决这些不足,我们提出了AFUN,这是迈向开放世界可供性基础模型的一步。首先,我们构建了一个大规模标准化数据流水线,将公开的机器人、人类和仿真数据集转换为连贯的可供性数据,包含任务描述、功能掩码和三维运动,将当前的可供性数据集扩展为迄今为止最大的公开可供性数据集之一(图1(a))。然后,我们引入了一个统一的可供性基础模型,该模型根据用户的文本指令和机器人原生RGB-D观测,联合预测在哪里行动(功能分割)以及交互应如何发生(三维运动,表示为贝塞尔样条曲线),如图1(b)所示。随后,掩码可以反投影到三维点,供机器人利用AnyGrasp[18]等下游抓取模块执行动作。
我们在 8 个基于分割的功能性基准和 3 个基于运动的基准上评估了 AFUN。AFUN 的平均分割 gIoU 达到 69.3,而最强的分割基线 [70] 为 45.4;在运动预测方面,它大幅超越了独立的基线方法 [79, 2, 7]。当在开放世界图像上进行定性评估时(图 1(c)),AFUN 还展现出强大的泛化能力。此外,我们将 AFUN 部署到真实机器人上进行操作。无需任何针对特定机器人的微调,AFUN 就能预测出精确的掩码和运动轨迹,供机器人规划并执行成功的操作路径,如图 1(d) 和图 7 所示。
2 相关工作
功能性定位。
可供性定位主要研究在何处可以通过各种基础表征方式实现任务指定的交互。密集二维方法涵盖了经典的实例级和部件级分割[55, 14]、弱监督跨视角基础定位[46, 37, 29, 78]、基于自我中心视角和人体视频的掩码监督[38, 24, 47]、利用大语言模型隐藏状态进行LISA风格SAM基础定位[36, 58]、使用大语言模型生成的坐标或边界框的两阶段视觉语言模型到分割器流水线[70, 40, 26, 6],以及语言条件化的SAM风格基准和解码器[73, 68, 30, 27]。稀疏替代方法则预测接触点或关键点,包括语言条件化的图像关键点[88]、编码接触位置和方向的三维关键点四元组[44],以及通过语义对应或检索实现的跨类别接触迁移[32, 35]。三维方法使用点云,涵盖从基础基准和二维到三维交互基础定位[13, 80]到开放词汇和语言条件化的三维多模态大语言模型基础定位[56, 60, 45, 93, 9, 85, 71]、跨实例或对象到对象的迁移[67, 15],以及从人机交互中学习视频驱动的多模态大语言模型[69, 48]。以手部为中心的工作定位功能性抓取和灵巧接触,涵盖从类别级抓取生成[10]和语言引导的任务导向抓取[65, 91, 86]到灵巧且针对特定手指的可供性预测[72, 22]。这些研究方向大多未明确指定接触后的运动——即物体应如何移动——这促使AFUN提出联合掩码与运动的表述方式。
可供性的运动表征。
以运动为核心的功能可供性研究关注的是物体在接触后应如何运动,其表征方式在粒度和结构上各不相同。一些方法使用离散的提示词或参数化关节运动:将基本的推/拉类型与可操作区域绑定[52],包含运动类型和轴线的场景级功能类别[12],或针对可铰接物体的可打开部件运动参数回归[31, 61, 39]。另一些方法则预测连续的交互几何结构,包括密集的视觉动作轨迹和逐点的3D关节运动流[75, 16, 90, 59]、以自我为中心的接触热力图和6自由度物体轨迹[84, 83]、从野外视频中蒸馏出的手部和手腕轨迹[2, 7],以及作为基础功能可供性的2D点轨迹或3D物体点流[5, 87]。第三类方法利用功能可供性来调控策略,包括由3D接触和接触后轨迹引导的扩散策略与流匹配动作生成器[76, 92, 89]、分层空间功能可供性加底层执行方案[79, 54],以及用于生成式控制的语义3D流[8]。与输出离散运动类型、密集流、手部/末端执行器轨迹或策略调控信号不同,AFUN预测的是一个紧凑的、以物体为中心的3D运动曲线,并同时输出功能掩码。
功能可供性数据流水线与数据集。
可供性标注可按标注目标、运动来源和标注成本进行分类。直接标注的数据集涵盖了早期RGB-D部件级可供性基准[53]、图像级功能定位数据集[46, 73, 70, 68]、场景级和形状级3D功能标注[13, 12]、机器人操作基准[64, 23]以及源自人类视频的数据集[47, 24, 84]。除了静态可供性标签外,轨迹和运动标注可从互联网视频中的手部和手腕轨迹[2, 7]、带有动作描述的第一人称6自由度物体轨迹[84, 83, 82]、手-物姿态追踪数据集[4]、场景级3D运动基准[12]以及模拟铰接物体交互[52, 75, 16, 90]中获取。为降低标注成本,自动或弱监督流程通过以下方式生成可供性标签:基于基础模型知识蒸馏而无需密集标注[63]、第一人称视频可供性提取[38, 24]、大规模人类行为挖掘[47]、部件先验弱监督[78]、用于VLM可供性学习的生成式AI增强[23],以及从人-物交互视频中进行的多模态大语言模型辅助定位[69, 48]。尽管有这些努力,现有资源在规模上仍然有限,尤其是3D运动标注方面;AFUN通过一个可扩展的流程弥补了这一不足,该流程整合了迄今为止最大的运动可供性数据集之一。
3 AFUN数据流程
开放世界可供性学习需要一个大规模数据集,该数据集需覆盖多样化的场景、任务、物体和动作序列,同时提供关于操作对象(分割)和操作方式(运动)的真实标注。现有数据集要么规模过小,要么仅包含部分信息。在本文中,我们构建了一个统一的数据处理流水线(图2),并整理了大量公开可用的数据,包括机器人演示、以自我为中心的人类视频以及模拟交互。我们使用统一的可供性标注方案对所有数据进行标注。每个数据样本包含一个带有任务描述的RGB-D观测数据、一个功能性可供性掩码以及一条紧凑的3D运动轨迹。
数据集整理。
我们整理了多个数据集,这些数据集中的视频记录了具有功能目的的物体交互,并且包含可见的动作区域和物体运动。基于这些标准,我们从10个公开来源收集了321,190个原始视频,涵盖人类演示[51, 21, 17, 11]、机器人演示[33, 17, 1, 74, 25]、仿真数据[49, 28]以及真实世界扫描[12]。由于一段录像可能包含多个动作,我们将视频片段分割成动作区间,最终得到1,242,740个初始区间。如此广泛的数据源池为我们提供了多样化的物体类别、相机视角、交互任务和具身形态,以构建我们的数据集。更多细节见附录B。
数据集预处理。
为了进行大规模标注,我们首先将所有上述数据集预处理为一种通用的基于区间的格式,如图2-灰色部分所示。对于数据集中的每个视频片段,我们首先利用现有标注或基于数据集的启发式方法分解动作区间。然后,针对每个动作,我们提取标准化的模式,该模式包含一个输入观测RGB-D帧、任务语言、相机参数以及对应的区间视频片段。数据集特定的适配器还会解析原始存储格式并标准化相机。对于移动相机视频,我们使用相机位姿将跟踪点表达在观测帧的相机规范坐标空间中。我们还使用单目深度估计器[62, 41]来提升深度质量。数据集预处理步骤通常依赖于具体数据集。更多细节见附录B.1。
标注物体轨迹与掩码。
先前的工作常使用手部或夹爪轨迹作为功能可供性的运动信号。然而,这会将不期望的接触前手部运动与功能可供性相关的接触后物体运动纠缠在一起,如图3(右侧)所示。相反,在我们的功能可供性基础模型中,我们使用对物体的跟踪作为接触后运动(图3,左侧),因为它直接指示了物体在受到机器人或人类接触后如何移动。为了获得跟踪结果,我们首先使用视觉语言模型根据任务指令和观测/接触帧生成一个简短的可操作部件查询,然后使用SAM3 [50]在动作区间内跟踪被操作的物体(图2-绿色部分)。此步骤生成一个以物体为中心的运动轨迹和一个功能可供性掩码。
优化3D运动曲线。
利用物体掩码和跟踪轨迹,我们通过反向投影跟踪到的掩码,并取每一帧中三维点位置的均值,来恢复物体的三维运动轨迹。然而,由此得到的离散路径通常采样不均匀,并且由于深度估计误差和跟踪不一致性而存在噪声。为了解决这个问题,我们拟合一条平滑的参数曲线,并将其转换为我们最终的规范运动表示(贝塞尔样条曲线)用于训练。该过程在图 2-蓝色部分中概述,更多细节见附录 B.2。
过滤与数据集统计。
在过滤之前,我们的数据池包含 1,242,740 个动作区间,涵盖机器人遥操作、人类第一人称视角记录、仿真以及真实世界扫描。在每个处理步骤中,我们会过滤掉低质量的片段,例如那些任务基础差、存在遮挡、分割不可靠以及运动不充分的片段。每一步会移除大约一半的样本,最终得到 223,334 个带有有效运动标签的样本。随后,我们进行人工标注和质量控制,并为 AFUN 保留了 59,867 个训练样本。达到此规模的数据集使模型能够接触到多样化的交互类型、物体类别、相机视角和具身形态。
4 方法
AFUN 以 RGB-D 观测和任务短语作为输入,并在单次前向传播中联合预测任务条件化的功能分割掩码以及一条三维接触后运动曲线。如图 4 所示,我们的模型采用简单的架构,包含两个主要组件。首先,我们利用 MetaQuery 机制 [57] 将冻结的视觉语言模型(Qwen3-VL [3])与分割模型(SAM3 [50])连接起来,以预测功能掩码。其次,我们使用三维特征编码器 [77] 和 Transformer 解码器来预测三维接触后运动,该运动表示为一条贝塞尔样条曲线。我们在 §4.1 中描述详细的网络架构,在 §4.2 中描述训练方案。
4.1 网络架构
MetaQuery 条件化。
由 Pan 等人 [57] 提出,MetaQuery 作为一种接口,用于连接冻结的 VLM 与下游模型。具体来说,一小部分可学习的特殊 token 被附加到 VLM 的输入提示词中,并通过 Transformer 进行处理。VLM 最后一层的隐藏状态作为下游模型的紧凑条件化特征。Pan 等人 [57] 表明,这种方法可以提取详细的视觉条件,并将推理能力迁移到多模态生成任务中,例如图像编辑。
我们将 MetaQuery 方法引入到我们的可供性预测模型中,融合了 VLM 的推理能力,用于功能性掩码分割和运动理解。具体来说,我们维护两组可学习的 token:,其中第一组将 VLM 与分割模型连接起来,第二组将其与运动预测模型连接起来。这两组可学习的 token 被一起附加到输入提示词中,并通过 Qwen3-VL [3] 中的 Transformer 进行处理。然后,每组 token 的最后一个隐藏状态分别被输入到下游的分割模型和运动模型中。这种联合公式使得分割模型和运动模型能够在单次前向传播中共享来自 VLM 的推理能力。
分割与运动解码。
利用来自视觉语言模型的 MetaQuery 模型 token,我们预测功能分割掩码和三维接触后运动。在分割预测方面,我们主要使用 SAM3 [50]。具体来说,语义 MetaQuery 模型 token 首先通过一个两层 MLP 映射到 SAM3 的语言特征空间。然后,它们被送入 SAM3 的掩码解码器,该解码器预测每个检测的边界框、掩码以及用于运动预测的目标查询特征。通过利用预训练的 Qwen3-VL 和 SAM3,我们的模型继承了从大规模预训练中学到的先验知识,用于功能分割理解。在运动预测方面,我们额外使用一个预训练的 Sonata [77] 网络对(从深度输入反投影得到的)点云进行编码,以提供三维信息,然后将其投影回图像空间并池化为几何特征。之后,运动解码器(一个 Transformer 解码器,对编码后的几何特征进行自注意力计算,并对来自 SAM3 的每个目标特征和运动 MetaQuery 模型 token 进行交叉注意力计算)用于预测下方运动曲线的参数。
曲线运动表示。
用于开放世界可供性的运动表示必须足够有表现力以应对复杂交互,同时又足够结构化以实现稳健操作。因此,我们将接触后运动表示为一条由控制点参数化的、锚定的三维贝塞尔样条曲线。掩码深度图的质心定义了起始点,运动解码器以相对三维坐标的形式预测其余有序控制点。随后,使用伯恩斯坦多项式基计算轨迹:
| (1) |
其中 是归一化时间 处的三维位置。起始点将曲线锚定在接触质心处,而预测的控制点则参数化曲线的整体形状。对 进行均匀采样可为机器人生成可执行的三维航点。
4.2 训练方案
直接训练完整模型是不稳定的:随机初始化的 MetaQuery token 为 SAM3 提供的条件信号质量较差,而带有噪声的掩码预测反过来又会使运动监督变得模糊不清。因此,我们分三个阶段训练模型:(I) 将 MetaQuery 接口与 SAM3 对齐,(II) 学习可靠的任务条件化功能分割,(III) 在模型已具备稳健的分割预测能力后,微调运动预测。预训练先验模型 Qwen-VL、SAM3 和 Sonata 在整个训练过程中保持冻结状态。
阶段 1:MetaQuery–SAM3 对齐。
在端到端训练之前,我们通过在 Visual Genome 数据集 [34] 上将 Qwen 提取的特征与 SAM3 的原生文本条件空间对齐,来初始化并训练 MetaQuery token 和投影 MLP。对于每对描述-图像,我们使用 SAM3 的文本编码器对描述进行编码;同时,Qwen3-VL 处理相同的描述和图像,投影 MLP 将生成的 MetaQuery 特征投影到 SAM3 文本空间中。然后,我们运行 SAM3 解码器,使其对投影后的 MetaQuery 特征和原始 SAM3 文本特征都进行交叉注意力计算。来自两个分支的解码器隐藏状态通过均方误差(MSE)损失进行优化,这比直接通过掩码监督训练新 token 提供了更稳定的初始化。此对齐步骤为 MetaQuery token 和 Qwen 到 SAM3 的 MLP 提供了良好的初始化,从而稳定了后续的联合功能训练。
阶段 2:用于功能分割的端到端训练。
在第二阶段,我们在四个可供性数据集的聚合混合数据上端到端地训练可供性分割模型:HOVA-500K [47]、RAGNet [73]、InstructPart [68] 和 ReasonAFF [70]。未冻结的参数与第一阶段相同:MetaQuery token 和投影 MLP。运动预测分支被禁用,我们仅使用 SAM3 [50] 的目标函数来训练模型,该目标函数结合了匈牙利匹配的边界框回归(+ GIoU)、存在性分类、每个查询的掩码预测(focal BCE + Dice)以及一个语义分割项(focal + Dice + 存在性),所有项均使用与 SAM3 相同的超参数进行平均。更多细节请参阅原论文。
第三阶段:联合运动与分割训练。
在最后阶段,我们在第 3 节整理的自有聚合可供性数据集以及第二阶段训练数据上,联合训练分割和运动预测。总目标函数结合了第二阶段 SAM3 定位损失(降低权重以防止分割头过拟合)和采样轨迹点上的曲线损失,以学习运动:
| (2) |
我们遵循 Curve-GCN [42] 的点采样损失来监督运动预测。具体来说,对于匈牙利匹配器返回的每个 SAM3 匹配查询,我们在固定的均匀时间间隔上评估预测的贝塞尔曲线及其匹配的真实曲线,并最小化采样点之间的距离,
| (3) |
在实践中,我们发现这种点采样监督方法比直接回归控制点位置有效得多。
5 实验
5.1 实现细节
我们使用 Qwen3-VL-8B [3] 作为视觉语言模型主干,SAM3 [50] 作为分割模型,Sonata [77] 作为 3D 特征编码器;这三个预训练组件在整个训练过程中均保持冻结。运动解码器使用六个 Transformer 层。结合 MLP 和 MetaQuery token,我们的模型在预训练模型基础上仅增加了 32.21M 可训练参数。我们总共使用 64 个 MetaQuery token,其中语义分支和运动分支各 32 个。我们设置相应参数,并以 的学习率训练模型。对于点采样损失,我们在每条曲线上采样 个点。我们在 NVIDIA GH200 GPU 上训练 AFUN 约八天。上述三个阶段分别使用 196、128 和 96 的批次大小,并分别运行 10,000、40,000 和 20,000 步。
5.2 可供性评估
为全面展示 AFUN 的可供性理解能力,我们从三个角度进行评估:可供性掩码分割的准确性、从掩码导出的接触点的正确性,以及 3D 运动的质量。
5.2.1 可供性分割评估
我们首先通过衡量分割质量来评估 AFUN 推理可供性所在位置的能力。我们与三个基线进行比较:零样本 Qwen3-VL-8B [3] 目标查询生成 + SAM3 [50] 掩码生成流程、AffordanceNet [73] 和 Affordance-R1 [70]。
我们在图 5 中展示了定性任务条件可供性掩码分割结果。AFUN 能够针对多样化的任务指令一致地预测正确的可供性区域,可以精确分割复杂区域(带孔剪刀手柄),并严格与给定任务对齐(铲子铲斗–盛装、锤子手柄–使用),在推理任务特定可供性方面展现出优于基线的性能。
在定量方面,我们沿用基线方法 [73, 47, 70],从四个功能属性基准中选取八个测试集进行评估,并在表 1 中报告 gIoU 和 cIoU 指标。在所有测试集上,AFUN 均优于所有基线方法,取得了最佳的 gIoU 和 cIoU 结果,并在整体平均 gIoU/cIoU 上比最强基线提升了若干个百分点。值得注意的是,即使使用参数量更少的 Qwen3-VL-2B 变体,AFUN 仍以较大优势领先于基线模型。
| 方法 | HANDAL-Mini | 3DOI | HANDAL Easy | HANDAL Hard | 3DOI Easy | HOVA-500K | ReasonAFF | InstructPart | 平均 |
|---|---|---|---|---|---|---|---|---|---|
| Qwen3-VL-8B [3] + SAM3 [50] | 40.3 / 44.4 | 36.4 / 22.5 | 44.8 / 50.6 | 45.2 / 52.2 | 44.3 / 27.2 | 63.3 / 38.5 | 31.9 / 19.6 | 41.4 / 28.1 | 42.5 / 36.5 |
| Affordance-R1 [70] | 18.2 / 10.6 | 51.8 / 38.5 | 39.8 / 32.0 | 37.4 / 26.5 | 61.4 / 53.6 | 27.9 / 14.1 | 67.1 / 62.1 | 67.2 / 58.6 | 45.4 / 36.2 |
| AffordanceNet [73] | 59.6 / 58.8 | 39.9 / 37.8 | 55.2 / 50.7 | 52.8 / 50.3 | 36.3 / 36.6 | 51.7 / 28.1 | 25.4 / 19.9 | 29.0 / 21.8 | 45.0 / 40.9 |
| AFUN(我们的方法) | 60.3 / 59.9 | 58.9 / 56.0 | 67.7 / 68.8 | 68.9 / 69.2 | 75.5 / 72.6 | 80.8 / 53.9 | 78.1 / 78.2 | 78.3 / 81.4 | 69.3 / 67.2 |
| AFUN-2B | 60.3 / 60.3 | 56.0 / 37.9 | 66.0 / 66.8 | 66.5 / 67.1 | 75.8 / 76.8 | 80.8 / 56.1 | 71.9 / 73.5 | 65.8 / 54.1 | 66.6 / 61.8 |
| 方法 | HANDAL-Mini | 3DOI | HANDAL Easy | HANDAL Hard | 3DOI Easy | HOVA-500K | ReasonAFF | InstructPart |
|---|---|---|---|---|---|---|---|---|
| A0 [79] | 4.6 | 3.6 | 5.0 | 6.0 | 3.6 | 3.8 | 20.7 | 22.7 |
| VRB [2] | 31.5 | 46.6 | 31.5 | 31.3 | 48.4 | 22.4 | 35.2 | 39.8 |
| GLOVER++ [47] | 67.6 | 6.8 | 39.2 | 34.4 | 4.9 | 28.6 | 4.3 | 4.7 |
| AFUN(我们的方法) | 80.3 | 67.3 | 88.2 | 88.8 | 82.6 | 88.3 | 96.5 | 95.5 |
5.2.2 接触点评估
除了使用掩码来表示可供性,先前的工作也采用接触点作为可供性的一种表示形式;因此,我们与 A0 [79]、GLOVER++ [47]、VRB [2] 进行比较,并衡量预测的接触点是否落在真实可供性掩码上。对于 AFUN,我们取预测掩码的不可达极点 [19] 作为接触点。我们使用命中率作为评估指标,该指标衡量预测的接触点是否落在可供性掩码上。如表 2 所示,AFUN 显著优于最佳基线,在 InstructPart 上提升了 –,在 ReasonAFF 上提升了 –。
5.2.3 3D 运动评估
评估数据集。
我们在三个具有不同领域偏移的测试集上评估 D 运动。(I)AFUN 测试集(示例)是我们从整理的高质量数据集中随机采样的跨源划分。该测试集通过第二次人工质量控制检查进一步验证,并且我们将这些数据样本从训练集中排除,以防止数据泄露。(II)SceneFun3D [12] 测试集(示例)来自 SceneFun3D 的原始验证集,包含训练集中未出现的场景。对于每个场景中的每个任务,我们使用目标物体可见的第一帧进行评估(数据集处理细节见附录 B.1)。(III)RoboMIND2 数据集测试集(示例)是一个特意从训练中排除的域外测试集。我们保留与功能相关的任务,并移除诸如“将 A 放置到 B”之类的纯重定位指令进行评估,因为此类路径通常是非确定性的。
评估指标与基线方法。
我们使用平均位移误差(ADE)、最终位移误差(FDE)[43, 87](分别在绝对尺度和相对尺度下计算)以及掩码内接触命中率(CIM)来评估预测的3D运动曲线。我们将AFUN与四种3D可交互性基线方法进行比较:A0 [79]、VRB [2]、VidBot [7]和General Flow [87]。对于每种基线方法,我们遵循其官方协议获取3D运动预测,并将每个预测结果和每个真实轨迹线性插值到统一的公共长度点,以便进行评估。需要注意的是,General Flow [87]需要手动指定查询点来进行运动预测,因此我们“借用”了来自我们模型的预测掩码,用于其查询采样。
| 数据集 | 方法 | ADE | FDE | ADE | FDE | CIM % | 失败次数 |
|---|---|---|---|---|---|---|---|
| AFUN 测试集 () | A0 [79] | 0.378 | 0.369 | 0.140 | 0.284 | 6.6 | 0 |
| VRB [2] | 0.242 | 0.297 | 0.087 | 0.220 | 11.0 | 3 | |
| VidBot [7] | 0.520 | 0.614 | 0.192 | 0.364 | 6.7 | 2 | |
| General Flow† [87] | 0.110 | 0.230 | 0.088 | 0.225 | – | 0 | |
| AFUN (我们的方法) | 0.098 | 0.139 | 0.080 | 0.135 | 81.0 | 0 | |
| SceneFun3D 测试集 () | A0 [79] | 1.008 | 1.066 | 0.249 | 0.476 | 3.3 | 0 |
| VRB [2] | 0.606 | 0.702 | 0.227 | 0.446 | 11.8 | 36 | |
| VidBot [7] | 0.772 | 0.848 | 0.201 | 0.393 | 9.4 | 11 | |
| General Flow† [87] | 0.413 | 0.572 | 0.212 | 0.413 | – | 4 | |
| AFUN (我们的方法) | 0.351 | 0.441 | 0.135 | 0.260 | 67.3 | 1 | |
| RoboMIND2 测试集 () | A0 [79] | 0.374 | 0.388 | 0.193 | 0.327 | 3.2 | 0 |
| VRB [2] | 0.299 | 0.373 | 0.190 | 0.330 | 27.4 | 10 | |
| VidBot [7] | 0.368 | 0.479 | 0.240 | 0.414 | 23.7 | 5 | |
| General Flow† [87] | 0.260 | 0.369 | 0.184 | 0.314 | – | 2 | |
| AFUN (我们的方法) | 0.254 | 0.323 | 0.177 | 0.276 | 62.2 | 0 |
评估结果。
我们在表3中提供了定量结果,在图6中展示了定性结果。AFUN在所有三个测试集上的绝对尺度和相对尺度下均取得了最佳的ADE和FDE,并在CIM指标上显著优于基线方法。即使General Flow在有利协议下进行评估(即为其提供AFUN预测的掩码和起始锚点),AFUN仍然实现了明显更优的运动预测结果。这一优势在图6中得到了进一步体现:AFUN生成了与任务对齐的掩码和运动轨迹,而基线方法往往同时产生不合理的物体定位和与任务不一致的轨迹。
5.3 消融实验
| 变体 | 平均gIoU | 平均cIoU |
|---|---|---|
| AFUN(我们的方法) | 69.3 | 67.2 |
| 使用 Qwen3-VL-2B | 66.6 | 61.8 |
| 使用 Qwen3.5-9B | 61.8 | 54.4 |
| 变体 | ADE | FDE |
|---|---|---|
| AFUN(我们的方法) | 0.254 | 0.323 |
| 使用 DFormerv2 [81](3D特征编码器) | 0.273 | 0.348 |
| 使用 OPD [31](曲线参数化) | 0.282 | 0.374 |
我们对模型的三种不同设计选择进行了消融实验:大语言模型骨干网络、3D特征编码器以及运动曲线参数化。结果如表5和表5所示。
针对不同的大语言模型骨干网络,我们使用与默认模型相同的训练方案进行训练,并在全部8个测试集上报告评估性能。我们采用Qwen3-VL-8B的默认模型取得了最佳的分割性能,优于较小的Qwen3-VL-2B模型和较大的Qwen3.5-9B模型。我们推测:较大的Qwen3.5-9B表现不佳的原因在于,其通用型MoE设计可能不太适合密集的视觉-语言预测任务。
对于3D特征编码器,我们将Sonata替换为DFormerv2 [81]架构,并使用相同的训练方案进行训练。我们在开放域RoboMIND2测试集上评估性能。我们的默认3D特征编码器优于DFormerv2 [81],这得益于从点云特征中提取的更强大的3D几何线索。
对于运动曲线表示,我们将我们的曲线参数化方法与OPD [31]中使用的表示进行了比较。我们的表示取得了更好的结果,因为OPD中对多种运动类型采用单一参数化可能会引入歧义。
5.4 真实机器人演示
在真实机器人平台上部署 AFUN 十分直接,无需任何额外的任务特定启发式规则。给定来自一台摄像头的已标定 RGB-D 输入,AFUN 会预测一个接触掩码和接触后的运动轨迹;该掩码通过反投影来定位目标物体,而 AnyGrasp [18] 则从重建的场景点云中估计可行的抓取姿态。预测的轨迹以平滑样条曲线的形式呈现,提供了用于调整夹爪方向的局部切线方向,从而能够实现诸如打开微波炉等旋转操作。这种面向姿态的执行方式难以从先前方法 [2, 79, 87] 中基于直线的轨迹预测中获得。
我们在四个真实世界任务上评估了 AFUN:拿起螺丝刀、取下锅盖、打开抽屉和打开微波炉,使用了 Franka Research 3 机械臂和两台已标定的第三人称 RGB-D RealSense D435 摄像头。对于每个任务,AFUN 使用一个 RGB-D 观测作为输入,而来自两台摄像头的观测则融合到 AnyGrasp 使用的场景点云中。我们在表 6 中报告了成功率,并在图 7 中展示了定性示例。AFUN 实现了 90% 的平均成功率,展示了其在以接触为中心的抓取和面向姿态的可活动物体操作方面可靠的实机部署能力。
6 结论
在本文中,我们提出了 AFUN,这是迈向用于理解功能性的可供性基础模型的一步。通过单张 RGB-D 观测图像和一项语言任务描述,AFUN 能够预测任务条件功能掩码(在哪里交互)以及一个三维接触后运动曲线(如何交互)。为了实现开放世界泛化,我们构建了一个大规模标准化数据流水线,将异构的机器人、人类、仿真和真实世界扫描数据转换为一个共享的可供性模式,其中包含语言、掩码和以物体为中心的三维运动标注。实验表明,AFUN 在来自四个基准测试的八个测试集上的可供性分割任务中优于所有基线;预测的接触点显著更准确;并在所有三个运动测试集上取得了最佳的三维运动性能。无需针对具体具身形态进行微调,AFUN 即可直接部署到真实机器人上进行操作,这为通往统一功能感知与可执行动作的开放世界可供性模型提供了一条实用路径。我们在附录 A 中提供了局限性、失败案例和未来方向。
参考文献
- [1] AgiBot-World-Contributors, Q. Bu, J. Cai, L. Chen, X. Cui, Y. Ding, S. Feng, S. Gao, X. He, X. Huang, 等. (2025) AgiBot World Colosseo:一个用于可扩展智能具身系统的大规模操作平台. arXiv 预印本 arXiv:2503.06669. 引用自:§3.
- [2] S. Bahl, R. Mendonca, L. Chen, U. Jain, 和 D. Pathak (2023) 来自人类视频的可供性作为机器人学的通用表示. 收录于 IEEE/CVF 计算机视觉与模式识别会议 (CVPR) 论文集. 引用自:§1, §1, §2, §2, §5.2.2, §5.2.3, §5.4, 表 2, 表 3, 表 3, 表 3.
- [3] 白硕、蔡宇、陈睿、陈凯、陈曦、程志、邓磊、丁伟、高畅、葛晨、葛伟、郭志、黄强、黄健、黄峰、惠斌、蒋帅、李哲、李明、李梅、李凯、林志、林杰、刘晓、刘杰、刘畅、刘洋、刘丹、刘帅、卢丹、罗瑞、吕晨、任明、孟磊、任翔、任晓、宋松、孙宇、唐杰、涂俊、万杰、王鹏、王平、王倩、王宇、谢涛、徐阳、徐浩、徐杰、杨志、杨明、杨杰、杨安、余波、张峰、张浩、张晓、郑波、钟华、周杰、周峰、周杰、朱毅、朱凯 (2025) 《Qwen3-VL 技术报告》。arXiv 预印本 arXiv:2511.21631。引用自:图 2、§4.1、§4、§5.1、§5.2.1、表 1。
- [4] P. Banerjee、S. Shkodrani、P. Moulon、S. Hampali、S. Han、F. Zhang、L. Zhang、J. Fountain、E. Miller、S. Basol、R. Newcombe、R. Wang、J. J. Engel、T. Hodan (2025) 《HOT3D:基于自我中心多视角视频的 3D 手部与物体跟踪》。收录于《IEEE/CVF 计算机视觉与模式识别会议 (CVPR) 论文集》,第 7061–7071 页。引用自:§2。
- [5] H. Bharadhwaj、R. Mottaghi、A. Gupta、S. Tulsiani (2024) 《Track2Act:从互联网视频预测点轨迹实现可泛化的机器人操作》。收录于《欧洲计算机视觉会议 (ECCV)》。引用自:§2。
- [6] C. Chen、Y. Cong、Z. Kan (2024) 《Worldafford:基于自然语言指令的可供性定位》。收录于《第 36 届 IEEE 人工智能工具国际会议,ICTAI 2024,美国弗吉尼亚州赫恩登,2024 年 10 月 28-30 日》,第 822–828 页。外部链接:Link, Document。引用自:§2。
- [7] H. Chen、B. Sun、A. Zhang、M. Pollefeys、S. Leutenegger (2025) 《VidBot:从真实世界 2D 人类视频学习可泛化的 3D 动作以实现零样本机器人操作》。收录于《IEEE/CVF 计算机视觉与模式识别会议 (CVPR) 论文集》,第 27661–27672 页。引用自:§1、§1、§2、§2、§5.2.3、表 3、表 3、表 3。
- [8] T. Chen, Y. Mu, Z. Liang, Z. Chen, S. Peng, Q. Chen, M. Xu, R. Hu, H. Zhang, X. Li, 和 P. Luo (2025-06) G3Flow:用于姿态感知与泛化物体操作的生成式三维语义流。收录于《IEEE/CVF 计算机视觉与模式识别会议论文集 (CVPR)》,第 1735–1744 页。引用自:§2。
- [9] H. Chu, X. Deng, Q. Lv, X. Chen, Y. Li, J. Hao, 和 L. Nie (2025) 3D-affordancellm:利用大语言模型在三维世界中进行开放词汇的可供性检测。收录于第十三届国际学习表征会议,ICLR 2025,新加坡,2025年4月24-28日。外部链接:Link。引用自:§2。
- [10] E. Corona, A. Pumarola, G. Alenya, F. Moreno-Noguer, 和 G. Rogez (2020) GanHand:预测多物体场景中人类抓取可供性。收录于《IEEE/CVF 计算机视觉与模式识别会议论文集 (CVPR)》,第 5031–5041 页。引用自:§2。
- [11] D. Damen, H. Doughty, G. M. Farinella, A. Furnari, J. Ma, E. Kazakos, D. Moltisanti, J. Munro, T. Perrett, W. Price, 和 M. Wray (2022) 重新缩放第一人称视觉:EPIC-KITCHENS-100 的数据集、流程与挑战。《国际计算机视觉杂志 (IJCV)》130 (1),第 33–55 页。引用自:§3。
- [12] A. Delitzas, A. Takmaz, F. Tombari, R. Sumner, M. Pollefeys, 和 F. Engelmann (2024) SceneFun3D:三维场景中的细粒度功能性与可供性理解。收录于《IEEE/CVF 计算机视觉与模式识别会议论文集 (CVPR)》。引用自:§2, §2, §3, §5.2.3。
- [13] S. Deng, X. Xu, C. Wu, K. Chen, 和 K. Jia (2021) 3D affordancenet:视觉物体可供性理解的基准。收录于《IEEE 计算机视觉与模式识别会议论文集》。引用自:§2, §2。
- [14] T. Do, A. Nguyen, 和 I. Reid (2018) AffordanceNet:一种用于物体可供性检测的端到端深度学习方法。收录于《国际机器人与自动化会议 (ICRA)》。引用自:§2。
- [15] X. Dong 和 W. Zhi (2026) 通过语义锚定的功能映射实现跨物体实例的可供性迁移。CoRR abs/2602.14874。外部链接:Link, Document, 2602.14874。引用自:§2。
- [16] B. Eisner, H. Zhang, 和 D. Held (2022-06) FlowBot3D:学习三维关节运动流以操控铰接物体。收录于《机器人学:系统与科学会议论文集》,美国纽约州纽约市。外部链接:文献。被 §2、§2 引用。
- [17] H. Fang, H. Fang, Z. Tang, J. Liu, J. Wang, H. Zhu, 和 C. Lu (2023) RH20T:一个用于一次性学习多样化技能的综合性机器人数据集。arXiv 预印本 arXiv:2307.00595。被 §3 引用。
- [18] H. Fang, C. Wang, H. Fang, M. Gou, J. Liu, H. Yan, W. Liu, Y. Xie, 和 C. Lu (2023) AnyGrasp:时空域中鲁棒且高效的抓取感知。《IEEE 机器人学汇刊》。外部链接:文献。被 §1、§5.4 引用。
- [19] D. Garcia-Castellanos 和 U. Lombardo (2007-09) 难以到达极点:地球上最偏远地点的计算算法。《苏格兰地理学杂志》第 123 卷第 3 期,第 227–233 页。外部链接:ISSN 1751-665X,链接,文献。被 §5.2.2 引用。
- [20] J. J. Gibson (1979) 视觉感知的生态学方法。Houghton Mifflin 出版社。被 §1 引用。
- [21] K. Grauman, A. Westbury, E. Byrne, Z. Chavis, A. Furnari, R. Girdhar, J. Hamburger, H. Jiang, M. Liu, X. Liu, 等 (2022) Ego4D:通过 3000 小时第一人称视频环游世界。收录于《IEEE/CVF 计算机视觉与模式识别会议 (CVPR) 论文集》,第 18995–19012 页。被 §3 引用。
- [22] Y. Han, Y. Peng, P. Yi, J. Li, H. Wang, G. Zhang, Q. P. Liu, 和 W. Lian (2026) FSAG:通过扩散模型增强从人类到灵巧手的手指特定功能可供性基础。外部链接:2601.08246,链接。被 §2 引用。
- [23] X. Hao, Y. Tang, L. Zhang, Y. Ma, Y. Diao, Z. Jia, W. Ding, H. Ye, 和 L. Chen (2025) RoboAfford++:一个用于机器人操作与导航中多模态功能可供性学习的生成式 AI 增强数据集。arXiv 预印本 arXiv:2511.12436。被 §2 引用。
- [24] M. Heidinger, S. Jauhri, V. Prasad, 和 G. Chalvatzaki (2025-10) 2HandedAfforder:从人类视频中学习精确的可操作双手功能可供性。收录于《IEEE/CVF 国际计算机视觉会议 (ICCV) 论文集》,第 14743–14753 页。被 §2、§2 引用。
- [25] C. Hou, K. Wu, J. Liu, Z. Che, D. Wu, F. Liao, G. Li, J. He, Q. Feng, Z. Jin 等 (2025) 《RoboMIND 2.0:面向可泛化具身智能的多模态双臂移动操作数据集》。arXiv 预印本 arXiv:2512.24653。引用于:§3。
- [26] S. Huang, I. Ponomarenko, Z. Jiang, X. Li, X. Hu, P. Gao, H. Li 和 H. Dong (2024) 《ManipVQA:将机器人可供性及物理基础信息注入多模态大语言模型》。载于 IEEE/RSJ 智能机器人与系统国际会议(IROS 2024),阿联酋阿布扎比,2024年10月14-18日,第 7580–7587 页。外部链接:Link, Document。引用于:§2。
- [27] Y. Huang, F. Yang, G. Zhu, G. Li, H. Shi, Y. Zuo, W. Chen, Z. Li 和 K. Yang (2025) 《利用互补深度与语义提示词实现资源高效的可供性定位》。载于 IEEE/RSJ 智能机器人与系统国际会议(IROS 2025),中国杭州,2025年10月19-25日,第 7788–7795 页。外部链接:Link, Document。引用于:§2。
- [28] S. James, Z. Ma, D. R. Arrojo 和 A. J. Davison (2020) 《RLBench:机器人学习基准与学习环境》。IEEE 机器人与自动化快报(RA-L)第5卷第2期,第 3019–3026 页。引用于:§3。
- [29] J. H. Jang, H. Seo 和 S. Y. Chun (2024) 《INTRA:基于交互关系感知的弱监督可供性定位》。载于欧洲计算机视觉会议(ECCV),第 18–34 页。引用于:§2。
- [30] D. Jiang, Z. Wang, H. Li, S. Dang, T. Ma, W. Wei, G. Dai, L. Zhang 和 M. Wang (2025) 《AffordanceSAM:在可供性定位中再次分割一切》。外部链接:2504.15650, Link。引用于:§2。
- [31] H. Jiang, Y. Mao, M. Savva 和 A. X. Chang (2022) 《OPD:单视图三维可开启部件检测》。载于欧洲计算机视觉会议(ECCV)。引用于:§2, §5.3, 表5。
- [32] Y. Ju, K. Hu, G. Zhang, G. Zhang, M. Jiang 和 H. Xu (2024) 《Robo-abc:基于语义对应实现超越类别的可供性泛化以用于机器人操作》。载于欧洲计算机视觉会议,第 222–239 页。引用于:§2。
- [33] A. Khazatsky、K. Pertsch、S. Nair、A. Balakrishna、S. Dasari、S. Karamcheti、S. Nasiriany、M. K. Srirama、L. Y. Chen、K. Ellis 等人 (2024) DROID:一个大规模真实环境机器人操作数据集。收录于《机器人学:科学与系统会议论文集》(RSS),注:arXiv:2403.12945,被 §3 引用。
- [34] R. Krishna、Y. Zhu、O. Groth、J. Johnson、K. Hata、J. Kravitz、S. Chen、Y. Kalantidis、L. Li、D. A. Shamma、M. S. Bernstein 和 L. Fei-Fei (2017) Visual Genome:利用众包密集图像标注连接语言与视觉。《国际计算机视觉杂志》(IJCV) 第 123 卷第 1 期,第 32–73 页。被 §4.2 引用。
- [35] Y. Kuang、J. Ye、H. Geng、J. Mao、C. Deng、L. Guibas、H. Wang 和 Y. Wang (2024) RAM:基于检索的可迁移性表征学习,用于可泛化的零样本机器人操作。收录于《第八届机器人学习会议论文集》(CoRL),《机器学习研究论文集》第 270 卷,第 547–565 页。外部链接:链接,被 §2 引用。
- [36] X. Lai、Z. Tian、Y. Chen、Y. Li、Y. Yuan、S. Liu 和 J. Jia (2024) LISA:基于大语言模型的推理分割。收录于《IEEE/CVF 计算机视觉与模式识别会议论文集》(CVPR),第 9579–9589 页。被 §2 引用。
- [37] G. Li、V. Jampani、D. Sun 和 L. Sevilla-Lara (2023) LOCATE:面向弱监督可操作性定位的物体部件定位与迁移。收录于《IEEE/CVF 计算机视觉与模式识别会议论文集》。被 §2 引用。
- [38] G. Li、N. Tsagkas、J. Song、R. Mon-Williams、S. Vijayakumar、K. Shao 和 L. Sevilla-Lara (2025) 从第一人称视频中学习精确的可操作性表征用于机器人操作。收录于《IEEE/CVF 国际计算机视觉会议论文集》。被 §2、§2 引用。
- [39] S. Li、X. Chen、H. Cheng、G. Zhou、H. Zhao 和 G. Tian (2024) Locate n’ Rotate:基于几何基础模型先验的两阶段可打开部件检测。收录于《计算机视觉 - ACCV 2024 - 第 17 届亚洲计算机视觉会议,2024 年 12 月 8-12 日,越南河内,会议论文集,第七部分》,M. Cho、I. Laptev、D. Tran、A. Yao 和 H. Zha 编,《计算机科学讲义》,第 716–732 页。外部链接:链接,文献标识码:文档,被 §2 引用。
- [40] X. Li, M. Zhang, Y. Geng, H. Geng, Y. Long, Y. Shen, R. Zhang, J. Liu, 和 H. Dong (2024) ManipLLM: 面向以物体为中心的机器人操作的具身多模态大语言模型。收录于 IEEE/CVF 计算机视觉与模式识别会议,CVPR 2024,美国华盛顿州西雅图,2024年6月16-22日,第18061–18070页。外部链接:链接,文献编号,被§2引用。
- [41] H. Lin, S. Chen, J. Liew, D. Y. Chen, Z. Li, G. Shi, J. Feng, 和 B. Kang (2025) Depth Anything 3: 从任意视角恢复视觉空间。arXiv 预印本 arXiv:2511.10647。被§3引用。
- [42] H. Ling, J. Gao, A. Kar, W. Chen, 和 S. Fidler (2019) 基于 Curve-GCN 的快速交互式目标标注。收录于 IEEE/CVF 计算机视觉与模式识别会议 (CVPR) 论文集。被§4.2引用。
- [43] S. Liu, S. Tripathi, S. Majumdar, 和 X. Wang (2022) 基于第一人称视频的联合手部运动与交互热点预测。收录于 IEEE/CVF 计算机视觉与模式识别会议 (CVPR) 论文集。被§5.2.3引用。
- [44] Z. Liu, R. Zhao, L. Zhou, C. Yuan, Y. Wu, S. Guo, Z. Zhang, C. Liu, M. H. Ang, 和 F. E. H. Tay (2024) 面向机器人操作的3D可供性关键点检测。收录于 IEEE/RSJ 智能机器人与系统国际会议,IROS 2024,阿拉伯联合酋长国阿布扎比,2024年10月14-18日,第7528–7534页。外部链接:链接,文献编号,被§2引用。
- [45] D. Lu, L. Kong, T. Huang, 和 G. H. Lee (2025-06) GEAL: 基于跨模态一致性的可泛化3D可供性学习。收录于 IEEE/CVF 计算机视觉与模式识别会议 (CVPR) 论文集,第1680–1690页。被§2引用。
- [46] H. Luo, W. Zhai, J. Zhang, Y. Cao, 和 D. Tao (2022) 从外部视角图像学习可供性基础。收录于 CVPR。被§2, §2引用。
- [47] T. Ma, J. Zheng, Z. Wang, Z. Gao, J. Zhou, 和 J. Liang (2025) GLOVER++: 释放从人类行为中学习可供性以用于机器人操作的潜力。收录于第9届机器人学习会议 (CoRL) 论文集,机器学习研究论文集,第305卷,第3972–3994页。外部链接:链接,被§B.4, §1, §2, §2, §4.2, §5.2.1, §5.2.2, 表2引用。
- [48] A. Mao, K. Huang, Y. Liu, C. S. Chan, 和 Y. He (2026) 《VAGNet:从视频中的人-物交互进行三维可供性定位》。外部链接:2602.20608,链接。引用于:§2, §2。
- [49] O. Mees, L. Hermann, E. Rosete-Beas, 和 W. Burgard (2022) 《CALVIN:面向长时程机器人操作任务的语言条件策略学习基准》。IEEE 机器人与自动化快报 (RA-L) 第7卷第3期,第7327–7334页。引用于:§3。
- [50] Meta AI 研究团队 (2025) 《SAM 3:基于概念分割一切》。arXiv 预印本 arXiv:2511.16719。引用于:§B.2, 图2, §3, §4.1, §4.2, §4, §5.1, §5.2.1, 表1。
- [51] 微软 VITRA 团队 (2025) 《VITRA:利用真实人类活动视频进行机器人操作的可扩展视觉-语言-动作模型预训练》。arXiv 预印本 arXiv:2510.21571。引用于:§3。
- [52] K. Mo, L. Guibas, M. Mukadam, A. Gupta, 和 S. Tulsiani (2021) 《Where2Act:从像素到可活动三维物体的动作》。收录于:国际计算机视觉大会 (ICCV)。引用于:§2, §2。
- [53] A. Myers, C. L. Teo, C. Fermüller, 和 Y. Aloimonos (2015) 《基于几何特征的工具部件可供性检测》。收录于:ICRA。引用于:§2。
- [54] S. Nasiriany, S. Kirmani, T. Ding, L. Smith, Y. Zhu, D. Driess, D. Sadigh, 和 T. Xiao (2024) 《RT-Affordance:可供性是机器人操作的通用中间表示》。CoRR abs/2411.02704。外部链接:链接,文档,2411.02704。引用于:§2。
- [55] A. Nguyen, D. Kanoulas, D. G. Caldwell, 和 N. G. Tsagarakis (2017) 《基于卷积神经网络和密集条件随机场的物体可供性检测》。收录于:IEEE/RSJ 智能机器人与系统国际会议 (IROS)。引用于:§2。
- [56] T. Nguyen, M. N. Vu, A. Vuong, D. Nguyen, T. Vo, N. Le, 和 A. Nguyen (2023) 《三维点云中的开放词汇可供性检测》。收录于:IEEE/RSJ 智能机器人与系统国际会议 (IROS)。引用于:§2。
- [57] X. Pan, S. N. Shukla, A. Singh, Z. Zhao, S. K. Mishra, J. Wang, Z. Xu, J. Chen, K. Li, F. Juefei-Xu, J. Hou, 和 S. Xie (2025) 《通过 MetaQueries 实现模态间迁移》。arXiv 预印本 arXiv:2504.06256。引用于:§4.1, §4。
- [58] S. Qian, W. Chen, M. Bai, X. Zhou, Z. Tu, 和 L. E. Li (2024) 《AffordanceLLM:基于视觉语言模型的功能可供性接地》。载于《IEEE/CVF 计算机视觉与模式识别会议,CVPR 2024 - 研讨会,美国华盛顿州西雅图,2024年6月17-18日》,第7587–7597页。外部链接:链接,文献。引用自:§2。
- [59] D. Seita, Y. Wang, S. Shetty, E. Li, Z. Erickson, 和 D. Held (2022) 《ToolFlowNet:通过从点云预测工具流实现机器人工具操控》。载于《机器人学习会议 (CoRL)》。引用自:§2。
- [60] Y. Shao, W. Zhai, Y. Yang, H. Luo, Y. Cao, 和 Z. Zha (2025) 《GREAT:面向开放词汇3D物体功能可供性接地的几何-意图协同推理》。载于《IEEE/CVF 计算机视觉与模式识别会议 (CVPR) 论文集》,第17326–17336页。引用自:§2。
- [61] X. Sun, H. Jiang, M. Savva, 和 A. X. Chang (2024) 《OPDMulti:面向多物体的可开启部件检测》。载于《国际3D视觉会议,3DV 2024,瑞士达沃斯,2024年3月18-21日》,第169–178页。外部链接:链接,文献。引用自:§2。
- [62] B. Tan, C. Sun, X. Qin, H. Adai, Z. Fu, T. Zhou, H. Zhang, Y. Xu, X. Zhu, Y. Shen, 和 N. Xue (2026) 《面向空间感知的掩码深度建模》。arXiv 预印本 arXiv:2601.17895。引用自:§3。
- [63] Y. Tang, W. Huang, Y. Wang, C. Li, R. Yuan, R. Zhang, J. Wu, 和 L. Fei-Fei (2025) 《UAD:面向机器人操控泛化的无监督功能可供性蒸馏》。载于《IEEE 国际机器人与自动化会议 (ICRA)》。引用自:§1, §2。
- [64] Y. Tang, L. Zhang, S. Zhang, Y. Zhao, 和 X. Hao (2025) 《RoboAfford:面向增强机器人操控中物体与空间功能可供性学习的数据集与基准》。载于《第33届ACM国际多媒体会议论文集》,第12706–12713页。引用自:§2。
- [65] Y. Tang, S. Zhang, X. Hao, P. Wang, J. Wu, Z. Wang, 和 S. Zhang (2025) 《AffordGrasp:面向杂乱场景中开放词汇任务导向抓取的上下文内功能可供性推理》。载于《IEEE/RSJ 国际智能机器人与系统会议,IROS 2025,中国杭州,2025年10月19-25日》,第9433–9439页。外部链接:链接,文献。引用自:§2。
- [66] Q. Team (2026-02) Qwen3.5:通过原生多模态智能体加速生产力。外部链接:链接 引用自:§B.2, §B.4, §B.4。
- [67] T. Tian, X. Kang, 和 Y. Kuo (2025) O3Afford:面向通用机器人操作的一次性三维物体到物体可供性定位。引用自:§2。
- [68] Z. Wan, Y. Xie, C. Zhang, Z. Lin, Z. Wang, S. Stepputtis, D. Ramanan, 和 K. Sycara (2025) InstructPart:基于指令推理的任务导向部件分割。载于《第63届计算语言学协会年会论文集》(ACL)。引用自:§B.4, §2, §2, §4.2。
- [69] H. Wang, M. Liu, X. Chen, C. Ma, Y. Zhong, W. Yin, Y. Liu, Z. Cui, J. Yuan, L. Dai, Z. Ma, 和 H. Xiong (2026) VideoAfford:通过多模态大语言模型从人-物交互视频中定位三维可供性。外部链接:2602.09638, 链接 引用自:§2, §2。
- [70] H. Wang, S. Wang, Y. Zhong, Z. Yang, J. Wang, Z. Cui, J. Yuan, Y. Han, M. Liu, 和 Y. Ma (2026) Affordance-R1:面向多模态大语言模型中通用可供性推理的强化学习。载于《AAAI人工智能大会论文集》(AAAI)。引用自:§B.4, §1, §1, §1, §2, §2, §4.2, §5.2.1, §5.2.1, 表1。
- [71] X. Wang, X. Yang, Y. Xu, Y. Wu, Z. Li, 和 N. Zhao (2025) AffordBot:基于多模态大语言模型的三维细粒度具身推理。载于《神经信息处理系统进展》(NeurIPS)。引用自:§2。
- [72] Y. Wei, M. Lin, Y. Lin, J. Jiang, X. Wu, L. Zeng, 和 W. Zheng (2025) AffordDexGrasp:基于通用可指导可供性的开放集语言引导灵巧抓取。载于《IEEE/CVF国际计算机视觉大会论文集》(ICCV)。引用自:§2。
- [73] D. Wu, Y. Fu, S. Huang, Y. Liu, F. Jia, N. Liu, F. Dai, T. Wang, R. M. Anwer, F. S. Khan, 和 J. Shen (2025) RAGNet:面向通用抓取的大规模基于推理的可供性分割基准。载于《IEEE/CVF国际计算机视觉大会论文集》(ICCV)。引用自:§B.4, §1, §2, §2, §4.2, §5.2.1, §5.2.1, 表1。
- [74] K. Wu, C. Hou, J. Liu, Z. Che, X. Ju, Z. Yang, M. Li, Y. Zhao, Z. Xu, G. Yang, 等. (2024) RoboMIND:面向机器人操作的多具身智能体规范性数据基准. arXiv 预印本 arXiv:2412.13877. 引用于:§3.
- [75] R. Wu, Y. Zhao, K. Mo, Z. Guo, Y. Wang, T. Wu, Q. Fan, X. Chen, L. Guibas, 和 H. Dong (2022) VAT-mart:学习用于操作 3D 铰接物体的视觉动作轨迹提案. 发表于国际学习表征会议,外部链接:Link 引用于:§2, §2.
- [76] S. Wu, Y. Zhu, Y. Huang, K. Zhu, J. Gu, J. Yu, Y. Shi, 和 J. Wang (2025) AffordDP:具有可迁移可供性的可泛化扩散策略. 发表于计算机视觉与模式识别会议论文集,第 6971–6980 页. 引用于:§2.
- [77] X. Wu, D. DeTone, D. Frost, T. Shen, C. Xie, N. Yang, J. Engel, R. Newcombe, H. Zhao, 和 J. Straub (2025) Sonata:可靠点表征的自监督学习. 发表于 IEEE/CVF 计算机视觉与模式识别会议论文集. 引用于:§4.1, §4, §5.1.
- [78] P. Xu 和 Y. MU (2025) 基于部件级语义先验的弱监督可供性定位. 发表于第十三届国际学习表征会议,外部链接:Link 引用于:§2, §2.
- [79] R. Xu, J. Zhang, M. Guo, Y. Wen, H. Yang, M. Lin, J. Huang, Z. Li, K. Zhang, L. Wang, Y. Kuang, M. Cao, F. Zheng, 和 X. Liang (2025) A0:一种面向通用机器人操作的可供性感知层次化模型. 发表于 IEEE/CVF 国际计算机视觉会议论文集. 引用于:§1, §1, §2, §5.2.2, §5.2.3, §5.4, 表 2, 表 3, 表 3, 表 3.
- [80] Y. Yang, W. Zhai, H. Luo, Y. Cao, J. Luo, 和 Z. Zha (2023-10) 从图像中的二维交互定位三维物体可供性. 发表于 IEEE/CVF 国际计算机视觉会议论文集,第 10905–10915 页. 引用于:§2.
- [81] B. Yin, J. Cao, M. Cheng, 和 Q. Hou (2025) DFormerv2:用于 RGBD 语义分割的几何自注意力机制. 发表于计算机视觉与模式识别会议论文集,第 19345–19355 页. 引用于:§5.3, 表 5.
- [82] T. Yoshida, S. Kurita, T. Nishimura, 与 S. Mori (2025) 从第一人称视频开发视觉-语言-动作模型。CoRR abs/2509.21986。外部链接:Link, Document, 2509.21986 引用自:§2。
- [83] T. Yoshida, S. Kurita, T. Nishimura, 与 S. Mori (2025-06) 在第一人称视觉中根据动作描述生成六自由度物体操作轨迹。收录于:IEEE/CVF 计算机视觉与模式识别会议(CVPR)论文集,第 17370–17382 页。引用自:§2, §2。
- [84] T. Yoshida, S. Kurita, T. Nishimura, 与 S. Mori (2025) 基于文本驱动的第一人称视觉可供性学习。Adv. Robotics 39 (16), 第 1041–1052 页。外部链接:Link, Document 引用自:§2, §2。
- [85] C. Yu, H. Wang, Y. Shi, H. Luo, S. Yang, J. Yu, 与 J. Wang (2025) SeqAfford:基于多模态大语言模型的序列化三维可供性推理。收录于:IEEE/CVF 计算机视觉与模式识别会议(CVPR)论文集,第 1691–1701 页。引用自:§2。
- [86] Q. Yu, S. Huang, X. Yuan, Z. Jiang, C. Hao, X. Li, H. Chang, J. Wang, L. Liu, H. Li, P. Gao, 与 C. Lu (2025) UniAff:一种结合视觉语言模型的工具使用与关节操作可供性统一表征。收录于:IEEE 国际机器人与自动化大会(ICRA 2025),美国佐治亚州亚特兰大,2025年5月19-23日,第 8980–8987 页。外部链接:Link, Document 引用自:§2。
- [87] C. Yuan, C. Wen, T. Zhang, 与 Y. Gao (2024) 通用流作为可扩展机器人学习的基础可供性。收录于:第八届机器人学习会议(CoRL)论文集,机器学习研究论文集,第 270 卷,第 1541–1566 页。外部链接:Link 引用自:§1, §2, §5.2.3, §5.4, 表 3, 表 3, 表 3。
- [88] W. Yuan, J. Duan, V. Blukis, W. Pumacay, R. Krishna, A. Murali, A. Mousavian, 与 D. Fox (2024) RoboPoint:一种用于机器人空间可供性预测的视觉语言模型。收录于:第八届机器人学习会议(CoRL)论文集,机器学习研究论文集,第 270 卷,第 4005–4020 页。外部链接:Link 引用自:§1, §2。
- [89] F. Zhang 和 M. Gienger (2024) 基于可供性的机器人操作与流匹配。CoRR abs/2409.01083。外部链接:Link, Document, 2409.01083 被引用于:§2。
- [90] H. Zhang, B. Eisner 和 D. Held (2023) FlowBot++:通过关节投影学习通用铰接物体操作。收录于《机器人学习会议,CoRL 2023,2023年11月6-9日,美国佐治亚州亚特兰大》,J. Tan, M. Toussaint 和 K. Darvish 编,《机器学习研究论文集》,第1222–1241页。外部链接:Link 被引用于:§2, §2。
- [91] Z. Zhao, J. Gao 和 D. Zheng (2026) 基于可供性引导的机器人抓取与多模态大语言模型推理。IEEE 自动化科学与工程汇刊 23,第4088–4100页。外部链接:Link, Document 被引用于:§2。
- [92] Z. Zhao, K. Fan, H. Xu, N. Qiao, B. Peng, W. Gao, D. Li 和 H. Shen (2025) AnchorDP3:面向机器人操作的3D可供性引导稀疏扩散策略。CoRR abs/2506.19269。外部链接:Link, Document, 2506.19269 被引用于:§2。
- [93] H. Zhu, Q. Kong, K. Xu, X. Xia, B. Deng, J. Ye, R. Xiong 和 Y. Wang (2025) 结合语言指令、视觉观察与交互的3D物体可供性基础。收录于《IEEE/CVF计算机视觉与模式识别会议,CVPR 2025,2025年6月11-15日,美国田纳西州纳什维尔》,第17337–17346页。外部链接:Link, Document 被引用于:§2。
技术附录与补充材料
本附录提供支持主论文主张的补充材料。附录A阐述了我们方法的局限性、失败案例分析以及我们的社会责任。附录B描述了如何将异构数据源转换为我们统一的可供性数据模式,涵盖特定于数据源的预处理、SAM3查询生成、曲线拟合、AFUN数据集图库以及用于分割训练的HOVA-500K转换。附录C详细说明了我们实验的更多细节,并附带了额外的定性结果以及更多机器人演示示例。
附录A 局限性、失败案例分析与社会责任
局限性与失败案例。
尽管我们的模型能够基于运动数据集适应开放世界图像,但这种适应能力在面对完全新颖的运动时仍然有限。我们在图8中展示了两个示例。数据集中没有类似物体可供模型关联此类动作。因此,模型无法准确预测这些任务中运动将如何发展。一个合理的下一步是创建规模更大的数据集——真正达到百万量级——并实现真正的开放世界。
社会影响与责任。
AFUN 可能通过预测可检查的接触区域和接触后运动来支持更具可解释性的机器人操作,其数据流水线可能有助于跨异构来源标准化功能监督。然而,它并非独立的策略或安全系统:物理部署应包含人工监督、碰撞检测、力和工作空间限制、紧急停止以及特定任务的验证,尤其是在靠近人员、易碎物体或危险材料时。由于改进的操作模型在配备高性能机器人时可能被滥用,我们将发布带有明确使用意图指南、记录在案的故障模式以及源数据集、许可、隐私和再分发约束的工作;下游用户应在自身环境中评估偏差和泛化能力,而非假设基准性能能够统一迁移。
附录B 数据集流水线详情
我们通过一个两阶段流水线,将来自机器人遥操作、人类自我中心视频、仿真数据和真实世界扫描的异构演示数据,转化为统一的具身数据集。首先,一个特定于数据集的预处理模块处理原始格式差异,并导出一个共享的每间隔模式。然后,一个与数据集无关的主处理模块使用该模式生成训练数据:一个 SAM3 任务查询、一个跟踪对象掩码、深度信息、一个 3D 对象轨迹以及拟合的贝塞尔样条曲线参数。这种设计将格式处理与具身标签提取分开,因此添加新的数据源只需编写一个新的预处理适配器。每个数据源的统计数据见表 7。
| 数据源 | 模态 | Episodes | Intervals | Views | 拟合曲线 |
|---|---|---|---|---|---|
| agibot | 机器人遥操作 | 17,124 | 25,395 | 25,395 | 1,493 |
| droid | 机器人遥操作 | 47,508 | 66,212 | 132,424 | 7,381 |
| rh20t | 机器人遥操作 | 3,588 | 4,512 | 34,163 | 4,127 |
| robomind | 机器人遥操作 | 14,695 | 22,642 | 48,826 | 17,198 |
| robomind2 | 机器人遥操作 | 6,738 | 8,918 | 28,663 | 4,965 |
| hoi4d | 人类自我中心 | 1,020 | 2,165 | 2,165 | 1,974 |
| vitra | 人类自我中心 | 3,024 | 1,098,944 | 1,098,944 | 129,433 |
| calvin | 仿真 | 181 | 6,649 | 6,649 | 4,002 |
| rlbench | 仿真 | 268 | 276 | 1,104 | 69 |
| scenefun3d | 真实扫描 | 585 | 7,027 | 148,603 | 52,692 |
| 总计 | 94,731 | 1,242,740 | 1,526,936 | 223,334 |
B.1 跨数据集预处理
我们的数据预处理流水线围绕特定于数据源的适配器构建,这些适配器共享相同的处理逻辑和结构。每个适配器都写入相同的间隔级模式:观测/接触帧、RGB-D、任务语言、相机标定和视频跨度。不同之处在于如何从每个原始数据集中恢复这些字段。下面我们总结一下特定于数据集的处理方法。
AgiBot。
AgiBotWorld-Beta 提供了动作间隔注释,我们将每个注释的动作作为一个间隔使用。我们加载该间隔的配对头部 RGB/深度帧,并使用已标定的非鱼眼头部相机。
DROID。
DROID 提供了 ZED 立体相机录制数据,以及同步的机器人和相机元数据。我们从每台外部立体相机解码左 RGB-D 流。校准数据在官方补丁文件可用时优先使用;否则回退到原始 HDF5 元数据。我们附加补丁文件中的语言标注,并丢弃标记为失败的运行记录。
RH20T。
对于 RH20T,操作片段并未直接标注。我们通过夹爪指令轨迹推断:当夹爪开始闭合时,新间隔开始;当夹爪再次张开时,间隔结束。间隔结束点会在释放后略微延长,以保留接触后的运动。我们仅导出静态相机视角,并移除过短、无法提供有意义的运动轨迹的间隔。
RoboMIND。
RoboMIND-v1 混合了多种机器人本体,因此主要的预处理问题是使其相机布局和标注保持一致。我们为每种本体识别静态相机视角,并丢弃安装在机械臂上的视角。RGB-D 流被解码,深度值被归一化到统一的公制尺度。操作间隔来自 RoboMIND 发布的逐步骤语言标注,这些标注提供了每个步骤的帧边界。
RoboMIND-v2。
RoboMIND-v2 融合了 Tien Kung、Franka、UR5 和 Ark 的录制数据,主要挑战在于它们的夹爪信号和可用相机视角编码方式不同。我们首先识别每个片段的机器人系列,仅保留能在我们流程中可靠使用的相机视角。然后根据特定机器人系列的夹爪信号恢复操作间隔;Ark 需要额外的范围检查,因为其录制使用了两种不同的夹爪值编码。当未找到有效的夹爪间隔时,我们回退到整个片段,并移除布料折叠、绳索等非刚性任务。请注意,该数据集完全排除在训练集之外,仅用作测试集。
HOI4D。
HOI4D 与机器人数据源不同,因为其摄像头是移动的,但该数据集也提供了精确的几何标注:动作事件标记、相机外参、3D 物体资产、物体掩码以及物体姿态轨迹。由于这些标注已经确定了时间跨度和3D物体运动,我们通过自定义路径而非机器人适配器接口来处理HOI4D。我们使用诸如伸手、抓取和拾取等事件边界来构成操作区间,并直接从记录的物体姿态轨迹中恢复运动标签,而不是运行基于深度的掩码追踪。由于提供的掩码是物体级别的,我们仍然运行SAM来获取用于功能监督的部分级掩码。
VITRA。
VITRA是我们人类操作片段的主要来源。以自我为中心的人类视频的一个主要挑战是嘈杂的相机运动,而VITRA为EPIC-KITCHENS和Ego4D片段提供了每帧的SLAM相机内参和外参。因此,我们利用这些相机姿态使轨迹在几何上可用。当使用预测深度时,首先将追踪到的掩码点反投影到其被观测到的相机坐标系中;然后,每帧的SLAM姿态通过世界坐标系将该3D点变换到观测帧的相机坐标系中。由于VITRA将标注与源视频分开存储,我们首先将每个标注的帧索引解析回对应的EPIC-KITCHENS或Ego4D帧。我们使用接触索引文件来剔除没有真实手-物接触的片段,并在观测帧的相机坐标系中表达所有投影量。
Calvin。
Calvin 是一个模拟机器人操作数据集,包含任务语言描述、RGB-D 观测数据和机器人状态轨迹。我们仅使用静态场景摄像头,并丢弃了夹爪安装视角和触觉视角,因为它们无法提供稳定的场景视图。Calvin 的语言标注在连续 rollout 中标记了任务级窗口,但这些标注并非接触标记。我们将它们用作语义锚点,然后利用夹爪动作轨迹来细化时间跨度:只有当附近存在夹爪闭合片段时,才保留该标注,最终的时间区间同时覆盖语言窗口和匹配的交互动作。我们使用静态 RGB-D 观测数据进行 3D 反投影,但不使用仅模拟器可用的物体变量(如物体位姿、抽屉状态或按钮状态)作为监督信号。
RLBench。
RLBench 是一个模拟机器人操作数据集,包含任务语言描述、RGB-D 观测数据、机器人位姿以及二值化的夹爪张开信号。我们保留静态场景摄像头,并排除了腕部摄像头,因为它会随机械臂移动。RLBench 在回合级别提供任务语言描述,而非逐步骤的时间跨度。因此,我们尽可能从夹爪信号中恢复时间区间:夹爪闭合片段成为操作区间,并将观测帧向前偏移以包含接近动作。模拟器深度数据被转换为公制深度用于 3D 反投影,但我们不使用特权模拟器输出(如真实掩码或物体状态)来生成可供性标签。
SceneFun3D。
SceneFun3D 提供了带有姿态信息的 ARKit RGB-D 视图,用于扫描房间。每个任务都与一个带注释的 3D 功能区域和一个运动基元相关联。与机器人或人类动作区间不同,该数据集中没有物体运动。因此,我们在 SceneFun3D 的数据处理流程中跳过了跟踪、投影和曲线拟合阶段。我们以每秒 10 帧的速率对数据集视频进行帧采样。我们保留步骤 2 和步骤 3(图 2 中的绿色模块)来获取目标物体的掩码,并保留那些物体掩码靠近运动注释起点以及投影物体 3D 注释的帧。然后,我们直接将运动轨迹转换为我们定义的贝塞尔样条曲线表示,其中圆形运动取 90 度半径,线性运动取固定的 0.3 米长度。
我们在整个过程中使用一套统一的单位和帧约定:深度图以毫米为单位,3D 位置以米为单位,刚体变换表示为 。每个适配器在集成前都会根据此约定进行单元测试。
B.2 主流程
通过 vLLM Qwen3.5 生成查询。
查询生成的目标是生成一个文本查询,使 SAM3 [50] 能够为每个任务区间分割出功能掩码。该掩码应覆盖观察图像中可见的、需要接触以执行任务的物体部分。由于 SAM3 可以通过文本提示词驱动,我们首先将区间的高级指令(例如,“打开橱柜门。”)和视觉证据转换为一个简短的、开放词汇的分割短语。该短语需要命名最小的可操作目标部件,例如把手、旋钮、按钮、插销或盖子边缘,而不是重复动作或在可见更小接触部件时命名整个物体。观察帧决定了在目标图像中应如何描述该部件,而接触帧则有助于消除实际使用哪个部件的歧义。下游的 SAM3 视频预测器使用该短语作为文本提示词,因此 的精度直接影响功能掩码和恢复的 D 运动。
我们使用 Qwen3.5-35B-A3B-FP8 [66] 来生成 SAM3 任务查询。该模型返回一个 JSON 对象,其中包含简要的推理说明以及最终的 sam3_prompt。完整的系统提示词和用户提示词如下所示。
[SYSTEM] You are an expert at converting robotics task language + visual evidence into a compact open-vocabulary segmentation query for SAM3. Project context Affordance Understanding: This data is used to train an affordance prediction model. Given an RGB image and a task-level instruction (e.g., "Open the cabinet door"), the model must predict (1) the **affordance region** the spatial area on the object where physical contact should occur, and (2) the **post-contact motion trajectory**. The task description intentionally specifies *what to do*, NOT *where to touch*; the model must learn the functional mapping from task intent to contact region. Therefore, only data samples with clear, physically grounded manipulation targets and meaningful task-level semantics are valuable for training. Your goal is to produce a short noun phrase that uniquely identifies the **smallest manipulable target part** (e.g., "top-left drawer handle", "right knob", "front latch", "left hinge", "power button") that the robot will operate in the observation image. You must be extremely concise and precise. You must not describe actions; only describe the target object/part to segment. Prefer concrete part names + discriminative attributes (location, row/column, color, shape, relative position).
[USER]
You are given:
* ‘instruction‘: the task language instruction for this episode/action
interval
* ‘obs_frame‘: the observation frame image (the first frame of the
action interval)
* ‘contact_frame‘: the contact frame image (the frame at the gripper-
close moment)
Task:
Generate a segmentation text query ‘sam3_prompt‘ for SAM3 that will
produce a mask of the **minimal target part** the robot is about to
manipulate **in ‘obs_frame‘**.
Guidelines:
1. Output a **single short noun phrase** (1-10 words) suitable for
open-vocabulary segmentation.
2. When a smaller part is clearly the interaction target, the phrase
must refer to a **physical part** (handle/knob/lid/button/lever/
edge/latch/hinge/tab/strap/rim) rather than a whole object.
3. Use ‘contact_frame‘ to infer the true contact target (where the
gripper touches). Use ‘obs_frame‘ to phrase it in visible terms.
4. Preserve and include spatial qualifiers if present or inferable
(e.g., "top-left", "second row right", "front", "leftmost",
"upper", "nearest", "on the right side").
5. If the instruction is ambiguous, resolve it using visual evidence.
If still ambiguous, choose the most likely minimal part and add
one discriminative qualifier (e.g., color/position).
6. Avoid verbs and action words (open/pull/push/turn). Avoid pronouns
("it", "that"). Avoid long descriptions.
7. Do NOT mention "robot", "gripper", "contact", "frame", "image",
"mask", "SAM", or "segmentation".
8. If the target is a drawer/door, prefer **handle** or **edge**. If
it’s a button/switch, prefer **button**/**switch**. If it’s a lid,
prefer **lid tab**/**lid edge**. If it’s a black cup, prefer
**black cup handle**.
Output format (strict):
Return ONLY a JSON object with two keys:
{"rationale": "<your rationale>", "sam3_prompt": "<your noun phrase>"}
Where:
* ‘rationale‘ is a very concise and very brief explanation of your
reasoning.
* ‘sam3_prompt‘ is the best phrase.
Hard-Fail Policy (must follow):
- You output {"rationale": "<your rationale>", "sam3_prompt": null}
ONLY when the instruction and the images are fundamentally
incompatible such that selecting a manipulable target part would
be guesswork.
- "Fundamentally incompatible" means: the instruction refers to an
object/affordance category that is not present in obs_frame AND
there is no clear gripper-contact target in contact_frame that
could plausibly satisfy the instruction.
- Do NOT fail just because multiple candidates exist; only fail if
it is genuinely impossible to identify any plausible target part.
Hard-Fail Affordance-Relevance Filter (must follow):
- You output {"rationale": "<your rationale>", "sam3_prompt": null}
when the task is NOT useful for affordance model training. This
includes:
1. **No clear physical manipulation target**: the task does not
involve contacting and manipulating a specific, localizable
part (e.g., "move to the left", "wait", "look around",
"navigate to the kitchen").
2. **Ambiguous / unresolvable target**: even with both images, it
is impossible to determine a single, well-defined contact
region e.g., the instruction is too vague ("do something with
the stuff on the table") and the images provide no
disambiguating evidence.
3. **Non-rigid / deformable / soft-body object**: the target is a
deformable, soft, or fabric-like object that lacks a well-
defined rigid part structure. Our project focuses on rigid
objects with strong part-level affordances (handles, knobs,
lids, buttons, etc.). Filter out tasks involving cloth, fabric,
towels, rope, dough, sponges, or similar soft bodies (e.g.,
"fold the towel", "hang the cloth", "flatten the dough",
"squeeze the sponge"). Exception: if the task involves grasping
a rigid part OF a soft object (e.g., a zipper pull on a
jacket), keep it.
4. **Trivial / non-functional interaction**: the task does not
teach a meaningful affordance mapping e.g., the instruction
directly names the exact contact part rather than describing a
functional task ("grasp the handle", "touch the knob"), or the
task is purely a sensor/state check with no physical
manipulation.
5. **Pick-and-place / whole-object relocation**: the task is
simply grasping an entire object and moving it to a different
location. These do not teach meaningful part-level affordances
because (a) the contact region is any graspable surface rather
than a specific functional part, and (b) the post-contact
trajectory is generic relocation (lift -> translate -> place)
rather than a functionally determined motion (pull, rotate,
press, flip, slide, etc.). Filter out instructions that
describe picking up, moving, transferring, or placing an object
from one location to another e.g., "move the cup to the
left", "pick up the apple and put it in the bowl", "place the
block on the shelf", "put the bottle on the counter",
"transfer A to B", "stack the cubes", "sort the objects into
the bin". Exception: keep the task if it requires interacting
with a specific functional part to achieve the relocation
(e.g., "pick up the pot by its handle" names a functional
grasp point; "slide the drawer out" involves a handle/edge
affordance).
- You strictly filter. Leave out borderline samples. If a task even
partially matches one of the above categories, output null. High-
quality training data is far more valuable than quantity a noisy
sample hurts the model more than a missing one. Only output a
valid sam3_prompt when you are confident the task has a clear,
rigid, localizable manipulation target with meaningful task-level
semantics.
instruction:
{instruction}
曲线拟合。
对于每个有效的物体轨迹,我们从恢复的 3D 掩码质心轨迹中,拟合第 4.1 节中使用的贝塞尔监督信号。设 表示按帧排序的反投影物体位置。由于这些点受到深度噪声、掩码抖动以及偶尔的跟踪跳变的影响,我们首先检测异常大的时间步长,降低其权重,并使用稳健的几何中位数对局部邻域进行平滑处理。然后,将平滑后的轨迹沿累积弧长重采样为一小组近似均匀的支撑点,其权重与局部空间扩散程度成反比。我们通过非线性最小二乘法结合柯西稳健损失函数,对这些支撑点拟合一个平面常曲率基元:该基元由一个原点 、一个正交标架 、曲率 以及单调的弧长坐标 参数化,使得 。如果 乘以拟合弧长低于一个较小的阈值,则该基元被拉直为一条直线,以避免对近似线性的运动进行过拟合。对拟合曲线进行密集采样,并通过求解一个最小二乘问题(固定起点和终点,求解两个内部控制点)将其转换为标准的立方贝塞尔目标。我们将得到的控制点相对于接触锚点 进行存储,以匹配公式 1 中的模型输出;原始轨迹仅保留用于诊断和可视化。
B.3 AFUN 数据集图库
我们从 AFUN 数据集中采样了 48 个条目,并将每个条目可视化为带有 SAM3 可供性掩码(红色掩码 + 黄色边界框)和贝塞尔样条曲线拟合的 3D 轨迹(绿色曲线)的观测帧。样本分别展示在图 9 和图 10 中;每个样本的语言指令直接显示在其图像下方。
B.4 转换 HOVA-500K 用于分割训练
如第 4.2 节“阶段 2:用于功能区域分割的端到端训练”所述,我们的功能区域分割模型在 HOVA-500K [47]、RAGNet [73]、InstructPart [68] 和 ReasonAFF [70] 上进行了训练。RAGNet、InstructPart 和 ReasonAFF 已经符合我们要求的格式:一张 RGB 图像、一个任务查询和一个二值功能区域掩码。而 HOVA-500K 提供的是点级接触监督。在我们的加载器中,每个 HOVA 样本被归一化为一张图像、一个物体名词字段、一个动词字段和一个接触点。接触点从 3DOI、Ego4D 和 HANDAL 的高斯接触热力图峰值中恢复,对于 EPIC-100 则从标注接触点的均值中恢复。这是有用的功能区域证据,但在训练我们的分割解码器之前,必须将其转换为密集掩码。
为了将点标注转换为掩码,我们运行了功能区域分割标注流程的单帧版本。Qwen [66] 模型接收图像、名词和动词字段以及接触点,为 SAM3 生成一个紧凑的部件级提示词,例如“抽屉把手”。然后 SAM3 使用该提示词对图像进行分割。我们仅保留既置信度高又在空间上与 HOVA 接触点一致的掩码:在置信度高于阈值的掩码中,我们选择质心位于接触点像素范围内的排名最高的掩码,其中 为图像宽度。没有此类掩码的样本将被剔除。
部件级的 SAM3 提示词仅用于获取掩码;它不被用作训练查询,因为直接命名被接触的部件会泄露答案。因此,我们对原始图像和所选掩码叠加图运行第二次 Qwen [66] 处理。这次处理将样本重写为一条自然的任务级指令,该指令暗示了功能区域,但并未明确命名高亮区域。
附录 C 扩展评估定性结果
功能区域分割评估的扩展定性图库。
从图12到图15,我们展示了在AFUN、AffordanceNet、Affordance-R1和Qwen3+SAM3上的可供性分割评估结果的定性图集。每一行显示输入查询、三个基线模型的预测结果、AFUN以及真实标注掩码。红色叠加层表示预测区域,绿色叠加层表示真实标注,黄色框标记掩码框。
3D运动评估的扩展定性图集。
从图16到图20,我们额外提供了在AFUN、VRB、VidBot、A0和General-Flow上的3D运动评估定性图集。每一行在最左侧列显示输入任务查询,随后是四个基线模型的预测结果、AFUN以及最右侧列的真实标注。在每个单元格内,上方图块是投影到输入帧上的预测轨迹和掩码,下方图块是带有相同叠加层的反投影3D点云。预测轨迹从起点到终点由黄色渐变为蓝色;真实轨迹以绿色曲线呈现。
机器人演示的额外定性结果。
我们展示了机器人演示的额外结果,其中AFUN被指示提供轨迹以拾取场景中的螺丝刀(图11)。
来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org