Sierra 发布 𝜏-bench 基准,测试 AI 智能体真实场景可靠性
𝜏-Bench: Benchmarking AI agents for the real-world
Sierra AI 研究团队发布 𝜏-bench 基准,通过 LLM 模拟用户与工具 API 交互、领域政策遵循和 pass^k 指标评估智能体在真实场景下的性能与可靠性。
基准引入动态用户与工具交互及 pass^k 可靠性指标,测试结果显示现有简单智能体架构在一致完成任务上表现明显不足。
TL;DR
- Sierra 的 AI 研究团队致力于推动对话式 AI 智能体的前沿发展。在我们的新研究论文中,我们提出了一个新的基准测试 𝜏-bench,用于评估 AI 智能体在动态用户和工具交互的真实场景中的性能和可靠性。
- 目前缺乏好的基准测试来衡量智能体在动态真实场景中与人类交互时的可靠性。𝜏-bench 测试智能体在与(LLM 模拟的)用户和工具交互以收集所需信息的同时完成复杂任务的能力。
- 结果表明,使用简单 LLM 构造(如函数调用或 ReAct)构建的智能体即使在相对简单的任务上也表现不佳,这凸显了对更复杂智能体架构的需求。
背景
AI 智能体是由 LLM 驱动的自主软件系统,使它们能够以创造性和灵活性进行推理、做出决策并追求目标,同时保持在为其设定的边界内。智能体在广泛的任务中有着令人难以置信的应用,从处理简单的信息交换和问答,到复杂的故障排除和问题解决。在 Sierra,我们在实现面向真实用户的对话式智能体方面的经验使一件事变得极其清晰:对智能体性能和可靠性的稳健测量对其成功部署至关重要。在公司部署 AI 智能体之前,他们需要衡量它在尽可能真实的场景中的工作效果。
研究社区在过去几年中为 AI 智能体构建了多个基准测试(WebArena、SWE-bench、Agentbench 等),但它们在一些关键领域都存在不足。虽然这些基准测试有助于揭示智能体的高层能力,但它们只评估单轮人机交互,其中所有必要信息一次性交换。这与现实场景形成鲜明对比,在现实场景中,智能体通过多次动态交换来收集信息。此外,这些基准测试通常将评估重点放在平均性能等一阶统计量上,而不提供可靠性或适应性的度量。
我们构建 𝜏-bench 来弥补这一空白。借鉴我们在生产环境中使用实时智能体的经验,我们将现实智能体基准测试的要求提炼为三个关键点。首先也是最重要的是,大多数现实世界环境要求智能体在长时间范围内与人类和程序化 API 无缝交互,以便逐步收集信息并解决复杂问题。其次,智能体必须能够准确遵循特定于任务或领域的复杂策略或规则。这对于确保智能体不违反公司政策或产生不良行为至关重要。第三,智能体必须在数百万次交互中保持大规模的一致性和可靠性。这确保了可预测的智能体行为,并让部署它的公司安心。
𝜏-bench 将所有这些元素整合到一个单一的模块化框架中,用于评估和开发面向真实用例的智能体。
TAU (𝜏)-Bench:一个工具-智能体-用户基准测试
从宏观层面看,𝜏-bench 衡量的是智能体在与(模拟的)人类用户及程序化 API 交互时,能否以一致的方式遵循特定领域的策略。该基准包含多项任务,用于测试基于模块化框架构建的智能体,这些任务包括:(1)逼真的数据库和工具 API,(2)规定智能体所需行为的领域特定策略文档,以及(3)基于 LLM 的用户模拟器,该模拟器由多样化场景的指令引导,以生成与智能体交互的逼真用户话语。
𝜏-bench 中的每项任务都测试智能体在逼真对话中遵循规则、推理、在长而复杂的上下文中记忆信息以及有效沟通的能力。我们采用了一种有状态评估方案,在每项任务完成后将数据库状态与预期结果进行比较,从而客观地衡量智能体的决策能力。这种方法也为对话回复的多样性留出了空间。此外,我们引入了一个新指标 pass^k,用于衡量智能体的可靠性,并确定其能否多次成功完成同一任务(k 代表不同试验的次数)。
以下是 𝜏-bench 的主要特点:
- 逼真的对话与工具使用:得益于语言生成建模的进步,𝜏-bench 具备复杂的数据库和逼真的用户模拟。值得注意的是,通过提示 LLM,我们可以用自然语言指定有趣且多样的用户场景,而无需编写复杂的规则。
- 开放式且多样化的任务:𝜏-bench 的数据模式、API 和策略文档足够丰富,能够支持为智能体创建多样化、开放式且富有创造性的任务。
- 忠实客观的评估:𝜏-bench 侧重于评估智能体在目标数据库状态上的表现(而非评估对话本身),这使得对智能体能力的评估快速且忠实,无需任何人工或基于 LLM 的评估。
- 模块化框架:𝜏-bench 采用模块化构建,便于轻松添加新领域、数据库条目、规则、API、任务和评估指标。
我们分三个阶段构建了 𝜏-bench:
- 阶段 1:受客户支持领域真实用例的启发,我们手动设计了数据库模式、API 和策略。
- 阶段 2:数据模式设置完成后,我们利用 LLM(GPT-4)生成能够大规模生成数据条目的代码片段。
- 阶段 3:我们为每项任务手动生成用户模拟场景及目标状态,并在将任务加入基准之前验证其正确性。
使用上述流程,我们构建了两个领域——𝜏-retail 和 𝜏-airline,分别处理相应领域的常见用例。我们选择这些领域,是因为它们在数据合成与策略规范的难易程度,以及多样化、逼真应用的潜力之间提供了良好的平衡。您可以在论文中阅读更多关于基准构建方法的内容。
主要发现
大多数 AI agent 都相对简单,主要使用函数调用或 ReAct 框架构建,后者涉及 LLM 生成 API 调用来采取行动。作为 𝜏-bench 的首次使用,我们评估了由 12 个流行 LLM 驱动的这类 AI agent,包括专有模型和开源模型。我们发现,我们测试的所有 12 个 agent 在解决 𝜏-bench 中的任务时都遇到困难,即使是表现最好的 GPT-4o agent,在两个领域中的平均成功率也低于 50%。
更有趣的是,所有被测试的 agent 在可靠性测试中表现极差,当 episode 重新运行时,它们无法一致地解决完全相同的任务(请注意,由于用户是模拟的,我们只需重新运行任务,就可以在保持底层任务语义不变的情况下,生成各种词汇变化的表述)。例如,由 GPT-4o 驱动的 agent 在 𝜏-retail 中的 pass^8 下降到约 25%,与其对应的 pass^1 分数相比,下降了惊人的 60%。实际上,这意味着 agent 只有 25% 的概率能够解决 8 个不同客户的同一问题——这一数字远远落后于真实世界面向用户的 agent 的预期。
我们进一步手动分析失败案例,并将其分解为四个象限,这为改进 agent 能力提供了可操作的见解。关键挑战在于提高它们持续遵循规则、进行长时程规划以及关注对话中正确信息的能力,尤其是在可能存在相互冲突的事实时。特别是,我们发现函数调用 agent 不太擅长遵循策略文档中提供的规则。
迈向现实世界中更可靠的 agent
Sierra agent 拥有比上述发现中所描述的更广泛的能力。首先,Sierra 的 Agent SDK 使开发者能够以声明式方式指定 agent 行为,编排它们以准确执行复杂任务。Sierra agent 还受到监督 LM 模型的管理,这些模型确保 agent 性能一致且可预测,同时还能轻松适应独特的对话和无限的用户场景。在我们部署和评估 agent 时,我们的 Agent Development Life Cycle 允许快速迭代,以提高 agent 质量并确保符合特定领域的策略。我们计划使用 𝜏-bench 来帮助编译、定制和微调我们的模型组合,以实现卓越性能。此外,我们的研究团队正在研究新的规范框架和认知架构,以实现更可靠、更一致的 agent。
虽然 𝜏-bench 为动态智能体评估提供了一种新思路,但该基准在未来仍有若干改进方向。首先,我们可以通过更先进的 LLM 来提升用户模拟的保真度,这些 LLM 能够改进推理与规划,同时创建更复杂的场景。其次,我们可以构建新方法,通过使用自动化工具来降低标注难度。最后,我们可以开发更细粒度的评估指标,以测试对话中智能体行为的其他方面(例如使用恰当的语气和风格)。我们希望 AI 研究社区能发现 𝜏-bench 在开发更强大、更可靠的 AI 智能体方面很有用,并在此基础上构建更先进的评估。
你可以在这里找到 𝜏-bench 的代码和数据。
来源:Sierra:Blog · sierra.ai