Meta 发布 Gaia2 基准与开源框架 ARE,聚焦真实世界智能体评估
Gaia2 and ARE: Empowering the community to study agents
Meta 在 Hugging Face 发布 GAIA 的后续基准 Gaia2,以及开源评估框架 Meta Agents Research Environments(ARE,MIT 许可),Gaia2 数据集采用 CC BY 4.0 许可。
原文给出新基准的任务分组、开源许可和初步模型结果,读者可据此评估现有模型在真实世界智能体任务上的短板。
在理想世界中,AI 智能体应该是可靠的助手。当收到一个查询时,它们能够轻松处理指令中的歧义,构建逐步计划,正确识别所需资源,执行这些计划而不偏离方向,并适应意外事件,同时保持准确性并避免幻觉。 然而,开发智能体并测试这些行为绝非易事:如果你曾尝试调试自己的智能体,你可能已经观察到这有多么繁琐和令人沮丧。现有的评估环境与其所评估的任务紧密耦合,缺乏现实世界的灵活性,也无法反映开放世界智能体混乱的现实:模拟页面从不会加载失败,事件不会自发出现,异步混乱也不存在。
这就是为什么我们非常高兴地推出 Gaia2,它是智能体基准 GAIA 的后续版本,允许分析相当复杂得多的行为。Gaia2 随开放的 Meta Agents Research Environments(ARE)框架一同发布,用于运行、调试和评估智能体。ARE 模拟复杂的类真实世界条件,并可以定制以进一步研究智能体行为。Gaia2 数据集以 CC by 4.0 许可证发布,ARE 以 MIT 许可证发布。
Gaia2:真实生活助手任务上的智能体评估
GAIA 是 2023 年发布的一个智能体基准,包含 3 个级别的信息检索问题,需要工具、网页浏览和推理来解决。2 年过去,最简单的级别对模型来说已经太容易了,社区也接近解决最难的问题,所以是时候推出一个全新且更难的智能体基准了!
这就是 Gaia2,GAIA 的后续版本,在所研究的能力方面远远超越它!
GAIA 是只读的,而 Gaia2 现在是读写基准,专注于交互行为与复杂性管理。智能体现在不仅在搜索和检索方面接受评估,还在模糊或时间敏感的查询中的指令遵循方面接受评估,且处于一个带有受控故障的嘈杂环境中——这比任何其他模拟环境都更能反映真实世界条件。我们想测试智能体如何管理有时无法工作的工具或 API,如何规划具有非常具体时间框架的连续动作,以及如何适应新事件——这是一系列全新的复杂性!
为此,我们使用以下任务组(得益于 1000 个全新的人工创建场景):
- 执行:多步骤指令遵循和工具使用(例如,联系人更新)
- 搜索:跨来源信息收集(例如,来自 WhatsApp 的朋友城市)
- 歧义处理:澄清冲突请求(例如,日程冲突)
- 适应性:响应模拟中的变化(例如,使用后续信息更新电子邮件)
- 时间/时序推理:时间敏感动作(例如,延迟 3 分钟后叫出租车)
- 智能体间协作:无直接 API 访问的智能体之间通信
- 噪声容忍:对 API 故障和环境不稳定的鲁棒性
本着 GAIA 的精神,这些场景不需要专业知识:人类原则上应该能够达到 100%,这便于模型开发者轻松调试。
想探索这个基准吗?查看我们的数据集,你可以在我们的演示这里中更好地展示它。
Gaia2 如何运行?
Gaia2 与 ARE(一个执行环境)一起运行,在其中你选择的智能体可以访问一组应用程序及相关联的预填充数据。
对于 Gaia2,我们创建了一个智能手机模拟环境,模拟人类在日常生活中会使用的场景。它包含真实世界的应用程序,如消息(Email)、实用工具(Calendar、Contacts、Shopping、FileSystem 等),以及一个用于与智能体对话的聊天界面。所有应用程序也可通过工具调用供智能体访问。最后但同样重要的是,该演示还包含一个模拟人物的对话历史和应用程序交互记录。
所有智能体交互在执行过程中都会自动记录为结构化轨迹,以供深入研究和分析:它们包括工具调用、API 响应、模型思考、时间指标(例如响应延迟)、用户交互等等——并且都可以导出为 JSON。
结果
作为参考,我们比较了一系列大型开源和闭源模型:Llama 3.3-70B Instruct、Llama-4-Maverick、GPT-4o、Qwen3-235B-MoE、Grok-4、Kimi K2、Gemini 2.5 Pro、Claude 4 Sonnet,以及所有推理模式下的 GPT-5。
所有模型均使用相同的设置进行评估(为保持一致性采用统一的 ReAct 循环,温度为 0.5,生成上限为 16K tokens),并根据具体任务结合使用模型作为评判者(Llama 3.3 Instruct 70B)和精确匹配评估。所有 101 个工具(以及总体环境描述)都提供在系统提示中。
在评估的模型中,截至 2025 年 9 月,总体得分最高的模型是采用高推理的 GPT-5,而最佳开源模型是 Kimi K2。
一些能力似乎已经被最好的模型接近解决:简单工具调用的执行和指令遵循(execution),以及总体上的 search(正如我们可以从当前 GAIA 的结果中猜到的那样)。歧义、适应性和噪声这几个分项目前对所有模型来说仍然具有挑战性,而且有趣的是,在曾被认为是复杂智能体任务(指令遵循和搜索)上的表现,并不能很好地代表在更接近真实世界任务上的表现。最后但同样重要的是,目前对所有模型来说最难的分项是 time 这一项:目前模型很难正确处理时间敏感的操作(尽管这很可能可以通过使用专门工具和更好的时间推理来缓解)。对这些结果的详细分析可在论文中找到。
然而,我们认为重要的是将报告超越原始分数:如果模型是正确的,但花费了数千个 token 才得出正确解决方案,或者运行了数小时,那么它就“不如”一个以快几个数量级的速度成功的模型。因此,我们还按成本对分数进行归一化,成本量化为 LLM 调用次数和输出 token 的平均数量(两者共同定义了成本-性能帕累托前沿)。在论文中,你会找到分数与货币成本和时间的关系。
与你最喜欢的模型比较!在 Gaia2 上评估
如果你想在 Gaia2 上评估你的模型,可以按照以下步骤操作:
首先,在你选择的 Python 环境(uv、conda、virtualenv 等)中安装 Meta 的 Agent Research Environment
pip install meta-agents-research-environments
然后,为所有配置运行基准测试:执行、搜索、适应性、时间和歧义。别忘了使用 hf_upload 参数将所有结果上传到 hub!
are-benchmark run --hf meta-agents-research-environments/Gaia2 --split validation --config CONFIGURATION --model YOUR_MODEL --model_provider YOUR_PROVIDER --agent default --max_concurrent_scenarios 2 --scenario_timeout 300 --output_dir ./monitored_test_results --hf_upload YOUR_HUB_DATASET_TO_SAVE_RESULTS
运行 oracle 以获取你的聚合分数文件
are-benchmark judge --hf meta-agents-research-environments/Gaia2 --split validation --config CONFIGURATION --agent default --max_concurrent_scenarios 2 --scenario_timeout 300 --output_dir ./monitored_test_results --hf_upload YOUR_HUB_DATASET_TO_SAVE_RESULTS
最后,在 README 中添加有关你的模型的所有相关信息,并在排行榜上分享,以便将 Gaia2 轨迹集中到此处!
超越 Gaia2:使用 ARE 研究你的智能体
除了基准测试场景之外,你还可以使用 ARE 中的 Gaia2 应用和内容,来查看模型是否能够正确解决那些不太可验证的任务,例如加载电子邮件、撰写跟进邮件、向日历添加事件或预订会议——总之,这提供了完美的设置,以通过交互评估你的 AI 助手!
你还可以轻松自定义环境:1)连接你的工具(通过 MCP 或直接连接)以在其上测试你的智能体;2)实现你自己的场景,包括定义触发器或定时事件(例如:2 分钟后,Mail 应用将收到一封来自 Contact 的新电子邮件),以观察智能体如何适应不断变化的环境
(由于智能体默认是 json agents,它们不会弄乱你的机器,当然除非你将它们连接到具有不安全权限的外部应用。因此,在添加你自己的应用或使用不受信任的 MCP 时,请谨慎操作)
以下是我们使用 ARE 的几个用例:
- 在真实或模拟数据上对任何智能体进行氛围检查,以研究各种设置,包括它们自己的规则、工具、内容和验证
- 测试智能体的工具调用和编排能力,可以使用本地应用或 MCP 工具
- 生成你自己的工具调用轨迹,以微调工具调用模型
- 在统一框架中轻松收集并复现现有的智能体基准测试
- 在用户界面中实时调试并研究智能体之间的交互
- 研究模型在嘈杂环境中的局限性(包括 API 超时和歧义)
我们录制了 3 个视频,以便你可以查看其中一些用例(当然,我们希望社区能在 ARE 上发挥创意 :hugging_face:)。在这些视频中,我们使用了上述默认演示,其中包含机器学习博士生 Linda Renne 的模拟生活。
1) 在简单任务上测试智能体:事件组织
为了测试默认模型在事件组织方面的表现如何,让我们来策划一场生日派对!
我们首先让智能体给 Renne 家族的所有人发短信,告知用户 11 月 7 日的 30 岁生日派对。默认宇宙的联系人列表中有 21 个联系人,其中包括 5 名 Renne 家族成员——模拟“所有者”Linda、她的父母 George 和 Stephie、她的妹妹 Anna,以及她的祖父 Morgan。智能体成功遍历联系人列表,找到这四名家族成员,并给他们发了短信。
接下来,我们让智能体创建日历邀请并将他们添加为受邀者。智能体记住了上述上下文!它在正确的日期创建了日历邀请,并正确地将家族成员添加到了邀请中。
2) 理解智能体:深入探究轨迹
ARE 还允许我们检查智能体所采取行动背后的轨迹。 打开左侧的 Agent logs 工具后,我们可以看到系统提示词、思维链、借助所调用工具采取的多步行动,以及以整齐组织的日志形式呈现的结果。如果你想离线查阅,一切都可以导出为 json!
3) 把玩并扩展演示:将智能体连接到自己的 MCP
在最后一个示例中,我们通过 MCP 将 ARE 连接到一台远程机械臂,这样它就能向我们做手势,然后让智能体通过挥动机械臂来回答我们的“是”或“否”问题!它看起来是这样的。
但这些示例只是非常简单的起点,我们真正期待的是你会构建出什么!(对于更进阶的用户,你甚至可以直接在这里安装并编辑 Meta-ARE 代码。)
结论
Gaia2 和 ARE 是新的研究工具,我们希望它们能让任何人都能轻松构建更可靠、更具适应性的 AI 智能体——通过支持便捷的实验、让真实世界评估对所有人可及,以及通过透明、可复现的基准测试和可调试的轨迹来提升信任。
我们很期待看到你会用这个项目做些什么!
来源:Hugging Face:Blog · huggingface.co



