跳到正文
北京时间
原文
Anthropic:Research(发表成果 · 网页)·· 2026-06-18精选AI 评分77

Anthropic Project Fetch 第二阶段:Claude Opus 4.7 自主完成任务,速度比人类团队快约20倍

Project Fetch: Phase two

AI 导读

Anthropic 发布 Project Fetch 实验第二阶段结果。在2024年8月原始实验中,配备 Claude Opus 4.1 的人类团队在操控四足机器人时显著超越无 AI 团队。新实验中,Claude Opus 4.7 无需人类协助即完成所有任务,速度比最快人类团队快约20倍,比无 Claude 团队快37倍以上,编码量减少近10倍。模型在传感器连接、路径规划等环节表现出色,但在精确移动沙滩球等闭环控制任务上仍存在困难。这些进展源于通用模型规模化,而非针对机器人领域的专项优化。

推荐理由

Anthropic 用 Claude Opus 4.7 自主操作机器狗,比当初的人类志愿者快 18-37 倍,代码量却少了十倍。这让「语言模型上手物理工具」从假想变成了可视的进度条,做具身智能和 agent 的人都该看一眼。

正文 · AI 翻译

Project Fetch: Phase two

Michael Ilie、C. Daniel Freeman 和 Kevin K. Troy

2025 年 8 月,我们开展了一项实验,考察 Claude 能在多大程度上帮助 Anthropic 的员工——他们并非机器人专家——用一台现成的四足机器人(以下称机器狗)完成复杂(且有趣)的任务。我们把这个项目称为 Project Fetch。我们发现,使用我们当时最先进的模型(Claude Opus 4.1)的那一组,表现大幅优于只能依靠互联网和自身聪明才智的另一组。使用 Claude 的那一组完成得更多、更快。

在我们把同事们拉到仓库做实验之前,我们再次确认了 Opus 4.1 能否完全靠自己完成这些任务。毫无疑问,它做不到。和我们那组没有 Claude 的团队很像,它卡在了如何连接机器人这个前置任务上。

但 AI 模型进步飞快——甚至比 8 月那台差点撞上我们其中一支人类团队的失控机器狗还要快。

视频 · 前往原文观看

我们觉得是时候重新审视 Project Fetch,看看更新的模型能否超越上一代。它们不仅做到了,而且Claude Opus 4.7——在无人协助的情况下运行——在不到一年前我们参与者完成的所有任务上,比最快的人类团队快约 20 倍。

这并不意味着大语言模型如今已经解决了机器人技术难题。远非如此。最新的 Claude 模型在使用机器人精确移动沙滩球时仍然吃力——也就是 Project Fetch 中“取球”的那部分。而且这些实验中的任务都没有涉及机器人控制中更具挑战性的底层要素,比如开发特定的驱动策略。然而,我们再一次看到了这样一种模式:首先,模型对人类有帮助。然后,人类对模型有帮助。最后,模型在很大程度上能够自己完成任务。我们已经在网络安全领域看到了这一点,如今同样的动态正在 AI 与物理世界的交汇处开始成形。

我们做了什么?

最初的 Project Fetch 让 Anthropic 员工组成的团队(随机分配为使用或不使用 Claude 进行工作)完成以下步骤:使用厂商提供的控制器操作机器狗,连接机器狗的视频和激光雷达传感器,编写并运行一个手动控制机器狗的程序,开发一种监控机器狗在空间中行进路径的方法,编写一个检测沙滩球的程序,最后将这一切整合起来以自主取回球。

在这次自主化更新中,我们无法要求 Claude 使用物理控制器,也没有评估研究人员使用 Claude 编程的控制器取回球所需的时间(不过我们确实确认了它能按预期工作)。在剩余的子任务上,我们对 Opus 4.7 进行了三次试验,在 Claude Code 中使用自适应思考并将 effort 设为 maximum。我们测量了每个目标的耗时,并对模型的成功情况进行了定性评估。

我们这位研究员的职责仅限于:把一台运行 Claude Code 的笔记本电脑接到机器狗上、输入初始提示词、批准命令,以及批准模型进入下一个任务。

Claude 在哪些方面表现出色?

非常简单:在 8 月份至少由一支人类团队完成的每一项任务上,Opus 4.7 完成同一任务的速度都至少快十倍。1如果看两支人类团队都完成的那四项任务,Opus 4.7 平均比无 Claude 团队快 37 倍以上,比 Claude 团队快 18 倍以上。

Bar chart labeled "Total time comparison: 4 tasks completed by all teams." The chart shows that Team Claude-less completed tasks in 361 minutes; Team Claude completed tasks in 181 minutes, and Claude Opus 4.7 alone completed tasks in 9 minutes 35 seconds. Opus 4.7 was 37.7 times faster than Team Claude-less and 18.9 times faster than Team Claude.

该表将原始团队(Claude 团队和无 Claude 团队)的速度与 Opus 4.7 在我们第二阶段测试的所有任务上的速度进行了对比。

Table comparing Claude Opus 4.7 to Team Claude-less and Team Claude performance on tasks related to programmatic control and autonomous operation. Tasks include "Connect to robodog's video camera," "Connect to robodog's lidar sensor," and "Detect beach ball." Opus 4.7 was faster than Team Claude-less and Team Claude on all tasks. Team Claude-less did not complete all 5 tasks in the table; Team Claude completed them in 264 minutes; and Opus 4.7, averaged over 3 trials, completed them in 12 minutes 7 seconds.

人类在多种与机器狗传感器对接的不同方案之间难以取舍,而 Opus 4.7 能够迅速找出最佳路径。它写出的许多代码一次就奏效(在最初的实验中,Claude 团队和无 Claude 团队都做不到这一点)。事实上,从 Opus 4.7 生成的代码量中,我们就能看出它的高效:它比两支人类团队都同样成功甚至更成功,而生成的代码量却比 Claude 团队少了近十倍。

Bar chart showing total code volume for Team Claude, Team Claude-less, and Opus 4.7 alone. Team Claude wrote 10,309 lines of code; Team Claude-less wrote 1,136 lines of code; Opus 4.7 alone wrote 1,045 lines of code.

Opus 4.7 并非完美无缺。例如,它默认使用了一种过时的目标检测算法。但即便如此,它仍能绕过这一问题,得出有效的解决方案。

我们观察到,对于模型完成的步骤,其完成时间在任务内的方差(以绝对值衡量)很小。(不过,前述次优的算法选择很可能是其中一次沙滩球检测试验耗时明显长于其他几次的原因。)总体而言,对于本次实验中处于其能力范围内的任务,Claude 现在已相当可靠。(关于 Claude 仍无法完成哪些任务的分析,请见下一节。)

Scatter plot showing Opus 4.7's reliability on task performance. Opus 4.7 performed each task three times; the scatter plot shows that the performance time was relatively consistent across runs.

值得强调的是(正如我们在上一篇文章中所做的那样),这一进展并非源于我们为提高模型机器人能力而付出的专门努力。这些改进,如同 LLM 发展史上的许多其他改进一样,源自更为通用的规模化。

Claude 在哪些方面遇到了困难?

在使用双手并经过一些练习后,我们的人类参与者能够操控机器狗,轻轻地将沙滩球推回起始位置——即机器人出发时所在的那片假草坪。这要求具备快速感知的能力:判断球是否偏离了路线、该误差与上一条指令有何关联、球现在在哪里,以及随后如何调整未来的输入以更精确地移动球。这是一种人类擅长的闭环过程(至少是在犯了一些错误并从中学习之后)。

视频 · 前往原文观看

在我们的第二阶段实验中,Claude 难以捕捉到这种微妙之处。就像那些进入需要编写程序实现自主沙滩球回收阶段的人类参与者一样,Claude 能够将机器人移动到球的后方,并调整位置将球击回起点。但这样做的尝试控制得很差,并且(同样像我们的人类参与者一样)未能成功。

视频 · 前往原文观看

我们的一位研究员比 Phase One 的志愿者拥有更多机器人经验,他成功完成了自主取物编程任务。如果有更多时间和额外的辅助支持,我们认为当前几代 Claude 很可能也能做到同样的事情。不过,我们接下来要观察的是,这些模型能否以它们在 Project Fetch 其他环节中展现出的同样速度和可靠性来完成这最后一项任务。

这意味着什么?

在撰写关于 Phase One 的内容时,我们强调了 LLM 如何能够为需要使用机器人的非专家用户提供能力提升。这一点如今比以往更加成立。模型现在能够比以往更快地独立完成此前需要人类与模型结对编程的工作,这意味着人们可以更快地过渡到控制和操作机器人。而对于某些任务,由人类在环控制机器人,可能仍然胜过(虚拟)手放在方向键上的 AI 模型。

有趣且不同的是,我们现在似乎距离这样一个世界近了很多——模型将能够相对轻松地使用现成的物理工具,至少对有限的目的而言是如此。这类似于 AI 模型在向更具智能体化的编程过渡时,使用诸如字符串替换这类现有软件编辑工具的方式。我们很可能正在进入 物理智能体 AI 的早期时代。

要理解模型能否让这些物理工具更加定制化——无论是通过编写针对特定任务量身定制的控制策略,还是通过设计机器人系统——还需要更多研究。而对于这种更具通用性的、具备物理能力和适应性的语言模型愿景,可能存在重大障碍。但正如我们所见,模型能力上看似巨大的差距可以被迅速跨越。模型构建自己的软件工具在不久之前可能还显得荒诞不经,但它正在发生。认为硬件领域不会走上同样的轨迹,将是不明智的。

6 月 18 日更新:更正了 Project Fetch 第一阶段的日期。

脚注

  1. 我们报告的是 Claude Opus 4.7 的结果,因为在我们进行这项实验时,它是我们最先进的非 Mythos 级模型。用 Claude Mythos Preview 进行的初步试验表明,由于我们设置实验的方式以及该模型的部署方式,它无法与其他模型进行对等的比较。

来源:Anthropic:Research(发表成果 · 网页) · anthropic.com