跳到正文
北京时间
原文
MarkTechPost(RSS)· Asif Razzaq·· 2026-07-04精选AI 评分70

NVIDIA 联合多所大学提出 ASPIRE:自我改进机器人框架,零样本成功率最高提升 77 分

NVIDIA AI Introduces ASPIRE: A Self-Improving Robotics Framework Reaching 31% Zero-Shot on LIBERO-Pro Long Tasks

AI 导读

NVIDIA 联合密歇根大学、UIUC、UC Berkeley 等提出 ASPIRE,一个持续学习机器人框架。它通过协调器-执行器架构、闭环执行引擎、技能库和进化搜索,编写并优化机器人控制程序。编程智能体使用 Claude Code(Claude Opus 4.6,1M token 上下文窗口)。在 LIBERO-Pro 上最高比最强基线提升 77 分;Robosuite 双手交接成功率从 20% 提升至 92%;BEHAVIOR-1K 收音机拾取任务从 56% 提升至 88%。利用 LIBERO-90 积累的技能,ASPIRE 在零样本条件下对 LIBERO-Pro Long 任务达到约 31% 成功率,此前方法饱和在 4% 附近。

推荐理由

ASPIRE让机器人编程从单次尝试变成持续学习,把失败调试沉淀成可复用技能库,长任务零样本直接从4%拉到31%,这条思路比具体数字更有启发性。

正文 · AI 翻译

传统的机器人编程难以规模化。它需要人工编排多模态感知、物理接触动力学、多样化的配置以及执行失败的处理。代码即策略(Code-as-policy)系统让语言模型将这些编排为可执行的机器人程序。这使得机器人行为可检查、可编辑、可调试。

但现有的机器人编码智能体运行在简陋的执行环境中。它们只能收到粗粒度的、任务级别的反馈。一次失败的 rollout 只表明任务失败了,而非为何失败。根本原因可能出在感知、运动规划、抓取、接触动力学或长时程协调上。这些系统还会在任务结束后丢弃修复方案。因此,智能体在解决其第一百个任务时,并不比第一个任务时更有经验。

来自 NVIDIA、密歇根大学、UIUC、UC Berkeley 和 CMU 的研究团队推出了 ASPIRE(Agentic Skill Programming through Iterative Robot Exploration)。这是一个持续学习系统,能够编写并改进机器人控制程序。它还将经过验证的修复方案提炼为可复用、可迁移的技能库。

ASPIRE 的工作原理

ASPIRE 运行一个由三个组件构成的开放式学习循环。它采用协调者—执行者(coordinator–actor)架构。一个中央协调者管理共享技能库,并将执行者编码智能体派发到各个任务。执行者之间不交换完整的对话历史或原始轨迹。只有提炼后的技能在它们之间流转。

闭环机器人执行引擎:它以逐原语的多模态轨迹取代粗粒度的 rollout 反馈。对于每一次感知、规划和控制调用,它都会存储输入、输出和返回状态。它还会存储 RGB 关键帧、叠加层、抓取候选、物体位姿以及运动规划结果。智能体只检查与失败相关的那些调用。随后它定位故障,并通过重新执行来验证修复。

技能库:可复用的知识很少是一整套任务程序。因此,该库存储的是异构的修复方案。这些包括定位启发式方法、感知提示词、抓取约束、运动原语以及调试工作流。每个技能都是紧凑的上下文内指导。它包含一个失败特征、一个何时适用的条件、一个修复策略,并且通常还有一段代码草图。协调器只接纳通过调试验证和 API 策略检查的模式。

进化式搜索:仅靠轨迹引导的调试可能会陷入局部修复循环。智能体会不断修补同一个失败的策略。为了拓宽探索,ASPIRE 每轮提出 K 个候选程序。候选程序以表现最佳的先前程序及其剩余失败轨迹为条件。下一轮探索的是不同的策略,而不是对单一解决方案进行精修。

在仿真中,编码智能体是 Claude Code,搭配 Claude Opus 4.6 和 1M token 的上下文窗口。程序用 CaP-X 编写,这是一个基于 MuJoCo Playground 构建的开源代码即策略框架。智能体无法读取仿真器的真值。读取物理引擎状态或诸如 .bddl、.xml 或 .urdf 之类的资产文件是被禁止的。规则很简单。如果一台带摄像头的真实机器人能做到,那就是允许的。

交互式讲解

一个完整示例:多角度方法技能

考虑一个 BEHAVIOR-1K 任务,机器人必须捡起桌子附近的一台收音机。感知返回了收音机的位姿,但反复调用 navigate_to_pose 都失败了。生成的目标位置距离桌边约 20 厘米以内。这落在了桌子的碰撞规避缓冲区内,cuRobo 返回 PLANNING_ERROR。

智能体读取追踪记录并定位到原因。失败原因是目标不可行,而非感知或抓取问题。随后它编写了一个修复方案,在收音机周围采样多个避让位姿。

# radio_pos, safe_navigate() and dist_to() are provided by ASPIRE's robot API
for angle_deg in [180, -90, 90, -45, 45]:
    angle = np.radians(angle_deg)
    tx = radio_pos[0] + 0.7 * np.cos(angle)      # standoff 0.7 m from the radio
    ty = radio_pos[1] + 0.7 * np.sin(angle)
    face_yaw = np.arctan2(radio_pos[1] - ty, radio_pos[0] - tx)
    moved = safe_navigate([tx, ty, face_yaw], f"ang_{angle_deg}")
    if moved and dist_to(radio_pos[:2]) < 0.8:   # reached a pose within 0.8 m
        break

每个角度都把目标放在物体的不同侧面。当一侧被挡住时,另一侧往往是畅通的。在这里,180 度的位姿避开了缓冲区。经过验证的修复方案被接纳为一个可复用的导航恢复技能。

基准测试与结果

ASPIRE 在三个基准系列上进行评估。LIBERO-Pro 测试在物体、目标和空间扰动下的短时程鲁棒性。Robosuite 涵盖接触密集的单臂和双臂操作。BEHAVIOR-1K 涵盖长时程家庭移动操作。主要的编码智能体基线是 CaP-Agent0。它使用视觉差分、预定义技能库以及每回合的测试时重试。对比还包括端到端视觉-语言-动作策略:OpenVLA、π0 和 π0.5。

在 LIBERO-Pro 上,ASPIRE 在 Object 套件上最高提升 77 分。该数字是对最强基线在两个扰动轴上的平均值。它还在 Goal 上提升 41.5 分,在 Spatial 上提升 42.5 分。在 Robosuite 上,双臂交接从 20% 提升到 92%。在 BEHAVIOR-1K 上,无线电拾取任务从 56% 提升到 88%。

零样本结果值得注意。复用 LIBERO-90 上积累的技能,ASPIRE 在留出的 LIBERO-Pro Long 任务上达到约 31%。此前的方法在接近 4% 处饱和。

维度端到端 VLA(OpenVLA、π0、π0.5)CaP-Agent0ASPIRE
范式学习权重策略代码即策略智能体代码即策略智能体
跨任务经验无(冻结权重)每个任务后丢弃蒸馏进技能库
失败反馈测试时无粗粒度场景级摘要逐基元多模态轨迹
测试时策略直接推理逐种子推理 + 重试每个任务一个程序
LIBERO-Pro 总体0–13%18%72%
LIBERO-Pro Long 零样本0–5%~4%~31%

真实机器人技能迁移

研究团队在一台真实的双臂 YAM 工作站上测试了三项由仿真发现的技能。真实机器人编码智能体为 OpenAI Codex GPT-5.5。其具身形态与 API 均与仿真环境不同。迁移后的技能降低了调试成本。汽水罐抓取从 13/20 提升至 19/20,同时使用的 token 数量减少了约 10 倍。抽屉打开从 0/20 提升至 11/20,而无技能基线从未成功过。

核心要点

  • ASPIRE 能够编写和调试机器人程序,随后将验证过的修复方案保存为可复用的上下文内技能。
  • 逐图元的多模态轨迹让智能体能够定位故障,而非仅凭 rollout 结果进行猜测。
  • 它在 LIBERO-Pro 上最高提升 77 分,并将 Robosuite 交接任务从 20% 提升至 92%。
  • 零样本迁移在 LIBERO-Pro Long 上达到约 31%,而此前方法仅约 4%。
  • 由仿真发现的技能在一种不同的具身形态和 API 上降低了真实机器人的调试成本。

来源:MarkTechPost(RSS) · marktechpost.com