伯克利RDI发布Agents' Last Exam基准
Agents' Last Exam
2026年6月,伯克利RDI发布Agents’ Last Exam(ALE)基准,包含1,500余项源于真实工作的任务,覆盖55个非体力职业。对Fable 5、GPT-5.5、Composer 2.5等前沿智能体的测评显示:在最困难层级成功率均为0%;整体任务表现接近,但单任务成本差异巨大(Fable 5约$15.70,GPT-5.5约$3.80,Composer 2.5约$1.33)。CLI子集ALE-CLI最佳通过率仅25.2%。主要失败模式是智能体未验证输出即宣称完成。数据集、代码及CLI子集已开源。
在Fable 5发布后,Berkeley的ALE基准首次大规模量化了agent在专业任务上的真实水平,最难任务0%成功率的结果值得所有押注agent落地的团队冷静下来。
Yiyou Sun*、Xinyang Han*、Weichen Zhang*、Yuanbo Pang*、Tianyu Wang*、Yuhan Cao*、Yixiao Huang*、……、Dawn Song
(* 为核心贡献者)
UC Berkeley RDI
2026 年 6 月
(预计阅读时间 5-7 分钟,更多详情请见 https://agents-last-exam.org)
同时发布于 LinkedIn 和 X
所有人都说最新的 AI 智能体很快就能“胜任工作”,尤其是在上周 Fable 5 发布之后。但事实果真如此吗?
在过去许多个月里,Berkeley RDI 一直在构建 Agents’ Last Exam(ALE),这是一个旨在针对真实数字劳动力市场工作来检验上述说法的基准测试。借助 ALE,我们评估了 Fable 5、GPT-5.5、Composer 2.5 以及其他前沿智能体系统,覆盖了横跨 55 种职业的 1500 多个由专家提供的任务。结果既令人印象深刻,也令人清醒。如今的智能体能够解决相当一部分专业任务。然而,当我们审视那些需要持续推理、深厚领域专业知识以及长时程可靠执行的最难任务时,它们仍远未达到人类水平的性能。在 ALE 的最难层级上,我们测试的每一个前沿智能体,包括 Fable 5,都取得了 0% 的成功率。
实用智能体的时代已经到来。真正能胜任工作的智能体的时代尚未到来。
我们希望 Agents’ Last Exam(ALE)能够成为一个新的路标和北极星,指引我们开发出能够在广泛领域内可靠地完成具有经济价值工作的智能体。

ALE 源自真实工作,而非合成任务
每一项任务都源自人类专家此前完成过的真实项目,并被转化为可验证、可客观评分的评测。不靠感觉。不靠人工评判。完全可复现。
ALE 涵盖 55 种非体力职业,基于 O*NET / SOC 2018 这一美国联邦职业分类体系。它由来自 100 多家机构的 300 多位专家共同构建,覆盖科学、工程、医学、法律、金融、教育等众多领域。

ALE 与现有智能体基准相比如何?
随着前沿系统的进步,如今许多智能体基准正迅速趋于饱和。ALE 旨在衡量另一条能力前沿:在真实世界专业领域中持续开展具有经济价值的工作。
- 55 个行业领域
- 1,500+ 项由专家提供的任务
- 完整的 GUI + CLI 环境
- 基于结果、可验证的评测

如果你的智能体只在终端中运行,我们还发布了 ALE-CLI,这是该基准仅限 CLI 的子集。与 Terminal-Bench 和 SWE-bench-Pro 相比,它覆盖面更广(任务横跨 ALE 的 55 个行业子领域中的 40 个,而两者分别为 6 个和 5 个),任务周期更长(人类完成时间从数小时到数周不等,而非数分钟或数天),并且难度更高(最佳智能体仅通过 25.2%,而 Terminal-Bench 上为 82.0%,SWE-bench-Pro 上为 59.1%)。仍有充足的提升空间。

性能只是故事的一半
在 ALE 中,Fable 5 与 GPT-5.5 和 Composer 2.5 同处一个整体性能梯队。但每个任务的成本差异悬殊:
→ Fable 5:约 $15.70 → GPT-5.5:约 $3.80 → Composer 2.5:约 $1.33
按当前定价,Fable 5 在提供相近性能的同时,每个已完成任务的成本大约高出 4–12 倍。

为什么 ALE 的结果看起来与其他一些基准不同?
因为不存在普遍最优的智能体。每一个前沿模型,包括 Fable 5,都有其擅长的领域和吃力的领域。综合得分是对 55 个职业、1500 多个任务的平均,导致许多模型聚在一起。但平均值并不能说明问题。真正的信号在于智能体在哪里成功、在哪里失败,以及这些模式在不同领域之间有何差异。在相同的任务上,不同模型往往因截然不同的原因而失败。

最常见的失败模式依然似曾相识:智能体在真正验证自己的工作之前就宣称成功。一种典型的完成汇报写道:“已完成。所有检查均通过。”然而输出可能缺少必需的文件、包含错误的计数、遗漏关键字段,或违反任务说明中的明确约束。这类失败发生的频率远超许多人的预期。

在我们的博客中探索交互式拆解和具体示例 → https://agents-last-exam.org/blogs/agent-showdown
为什么叫“最后考试”?
“最后考试”这个名字既反映了具有经济价值的工作所需跨越的门槛,也反映了真实、复杂、长周期任务难度的前沿。虽然实用智能体的时代已经到来,但真正能胜任工作的智能体的时代尚未到来。
我们希望 Agents’ Last Exam(ALE)能成为一个新的路标和北极星,指引人们开发出能够在广泛领域可靠执行具有经济价值工作的智能体。
来在 ALE 上测试你的智能体
- 网站: https://agents-last-exam.org
- 任务: https://agents-last-exam.org/demo
- 排行榜: https://agents-last-exam.org/leaderboard
- 论文: https://arxiv.org/abs/2606.05405
- 数据集: https://huggingface.co/datasets/agents-last-exam/agents-last-exam
- 代码: https://github.com/rdi-berkeley/agents-last-exam
加入这项行动
为了推进这一前沿,我们欢迎贡献者通过提交任务和推荐领域专家来帮助我们构建下一轮迭代的基准测试(贡献者将被邀请作为共同作者加入)。请访问 https://agents-last-exam.org/submit 了解如何贡献,并在 https://agents-last-exam.org 查看排行榜、论文和演示。
来源:Berkeley RDI:Blog(AI 安全与评测) · rdi.berkeley.edu