跳到正文
北京时间
原文
Hugging Face:Blog(RSS)·· 2026-06-04精选AI 评分65

EVA-Bench Data 2.0 发布:覆盖三大领域、121 个工具、213 个场景

EVA-Bench Data 2.0: 3 Domains, 121 Tools, 213 Scenarios

AI 导读

EVA-Bench Data 2.0 将评估范围从单一企业领域扩展至航空公司客户服务管理(CSM)、企业 IT 服务管理(ITSM)和医疗 HR 服务交付(HRSD)三个领域,共涵盖 121 个工具、213 个场景,场景数较原始版本增长约 4 倍。每个场景均经 OpenAI GPT-5.4、Google Gemini 3.1 Pro 和 Anthropic Claude Opus 4.6 验证可解性。数据集遵循语音优先、真实性、多样性、认证流程和可复现性五项设计原则,包含单意图、多意图(最多 4 个意图)和对抗性呼叫类型。所有三个数据集已开源,可通过 `load_dataset` 从 Hugging Face 直接下载。后续将推出多语言扩展。

推荐理由

语音代理评测缺的就是这种真实场景的数据集,EVA-Bench 2.0 把航空、IT、医疗三个最棘手的领域打包了,生成流水线也开源,做评测的可以直接拿来用。

正文 · AI 翻译

Tara Bogavelli tarabogavelli 关注

Gabrielle Gauthier Melancon gabegma 关注

Katrina Stankiewicz kstankiewicz 关注

Nifemi Bamgbose onifemibam 关注

Fanny Riols FannyRiols 关注

Hoang Nguyen hnguy7 关注

Raghav Mehndiratta rmehndir 关注

Lindsay Brin lindsaybrin 关注

Joseph Marinier Joseph-Marinier 关注

Hari Subramani Hari-sub 关注

Anil Madamala anilmadamala 关注

引言

语音智能体的失败往往高度依赖具体领域。一个能在航班改签交易中完美处理字母数字确认码的系统,在处理 HR 系统中的复杂政策时却可能卡壳。不同领域考验智能体适应不同词汇、工作流复杂度和用户预期的能力。因此,本次发布将 EVA-Bench 从一个企业领域扩展到三个:航空客户服务管理(CSM)、企业 IT 服务管理(ITSM)和医疗 HR 服务交付(HRSD)。三者合计覆盖 121 个工具上的 213 个评估场景,相比我们最初的发布,场景覆盖范围扩大了约 4 倍。每个场景都针对三个前沿模型(OpenAI GPT-5.4、Google Gemini 3.1 Pro 和 Anthropic Claude Opus 4.6)进行了可解性验证,确保该基准既具挑战性又公平。三个数据集均为开源,可供下载:

from datasets import load_dataset

# Airline Customer Service Management (CSM) — 50 scenarios
airline = load_dataset("ServiceNow-AI/eva-bench", "airline", split="test")
# Enterprise IT Service Management (ITSM) — 80 scenarios
itsm = load_dataset("ServiceNow-AI/eva-bench", "itsm", split="test")
# Healthcare HR Service Delivery (HRSD) — 83 scenarios
hrsd = load_dataset("ServiceNow-AI/eva-bench", "medical", split="test")

EVA-Bench 面向多类受众而构建。如果你正在评估一个语音智能体,可以用它来跑一组多样化的真实企业场景,覆盖 35+ 个不同的工作流。如果你正在构建自己的评估数据集,本文足够详细地描述了我们的端到端生成与验证流程,可作为实用参考。我们逐一介绍了每个领域是如何设计和生成的,并深入剖析了两个新增领域。我们还预告了即将推出的多语言扩展,它将把该基准的适用范围拓展到仅限英语的企业部署之外。

数据设计原则

五项原则指导了 EVA-Bench 数据集在全部三个领域中的设计。

语音优先的范围。并非每个企业工作流都适合纳入语音基准测试。我们首先确定了每个领域中哪些任务在实践中是通过电话处理的,然后从该子集中选取了最常见的流程。这使得场景始终扎根于真实的通话模式。

真实性。工具 schema 参照生产平台所使用的各类 API 建模。场景策略取自真实的企业约束条件。对于 Healthcare HRSD 领域,这意味着将场景扎根于真实的美国医疗政策与行政管理系统,包括 NPI 编号、FMLA 和保险覆盖范围,从而使该基准测试能够反映从业者在现实生活中所遇到的该领域面貌。

多样性。仅通过重复相同任务来扩展数据集,所能提供的评估信号有限。为避免这一点,我们为每个领域定义了具体的工作流,并在三种场景类型上进行采样:单一意图通话、单次对话中最多包含四个意图的多意图通话,以及对抗性通话——即来电者试图绕过故障排查步骤、错误分类紧急程度,或访问其无权查看的记录。在单一意图和多意图场景中,我们还纳入了用户目标无法被满足的案例,因为真实通话量并非全是顺利路径,而根据我们的经验,模型在无法满足的目标上往往比在成功交互上表现得更吃力。

身份验证。 此前的工作(EVA-Bench 和 τ-Voice)已将身份验证认定为语音智能体最持续出现的失败点之一。EVA-Bench 中的每个领域都包含身份验证流程,且具体机制会根据任务进行校准。例如,基于 OTP 的权限提升只出现在生产系统确实需要它的场景中,而非在所有场景中统一出现。

可复现性。 如果没有可复现的场景,就很难判断分数差异反映的是真实的能力差距,还是场景展开方式所带来的假象。我们在设计数据集时,确保每个场景都恰好只有一条正确的解决路径。用户目标的构建确保模拟器始终拥有所需的信息和指令以保持一致的行为,而场景生成则会显式检查并消除任何存在多条有效动作序列可达成同一结果的案例。

场景生成

联合生成。 场景使用 SyGra 生成,这是一个基于图的合成数据生成流水线,以 GPT-5.4 作为主干模型。每个场景需要三个联合一致的部分,它们被一起生成,以防止各部分独立生成时出现的不一致:

用户目标。可复现性要求用户模拟器在每次运行同一场景时都表现一致。模糊的意图陈述无法实现这一点:模拟器会在不同运行中做出不同的判断,从而产生不一致的评估信号。为消除这一问题,用户目标被结构化为决策树,覆盖模拟器可能遇到的所有情况。用户目标精确指定了用户应当提出哪些请求,以及一个协商序列,该序列精确规定了何时反驳、何时要求替代方案、何时接受。常见的边界情况,例如是否接受候补航班或替代机场,都通过明确指令来处理,而非留给模拟器自行解读。解决条件要求提供已完成操作的证据,例如确认号或案件 ID,而非口头承诺,因此模拟器会持续通话直到操作真正得到确认。最终结果是用户表现得像一个一致、真实的来电者,而非即兴发挥。

初始场景数据库。智能体的工具在场景执行期间将查询和修改的后端状态。与用户目标联合生成,以确保用户目标中引用的每个实体,例如预订 ID、账户详情和身份验证凭据,都存在于数据库中且保持一致。

预期最终数据库状态(基准真值)。我们通过在智能体指令、用户目标和初始场景数据库上运行生成 LLM 来推导预期结果,产生完整的操作轨迹。当 LLM 执行写入工具调用时,数据库被增量更新,由此产生的终态成为验证器在评估期间对照检查的基准真值。

联合生成至关重要,因为这三个组成部分深度相互依赖。独立生成会引入隐蔽的不一致,例如用户目标中引用的案例 ID 在场景数据库中并不存在,这会彻底破坏评估信号。为保证一致性,我们在每次生成尝试后运行一个多阶段验证循环,并将任何失败反馈给生成步骤,由其重试直到所有检查通过。验证分三步进行。

  • 结构检查会依据 Pydantic schema 验证场景数据库,捕获类型错误和缺失字段。
  • 基于 LLM 的验证器会更整体地检查整个场景的一致性:目标中面向用户的细节是否与数据库记录匹配、交叉引用是否在内部有效,以及认证数据是否配置正确。
  • 基于 LLM 的轨迹验证环节会检查完整对话轨迹是否符合策略合规、动作顺序是否正确、所有必需的终止动作是否完成,以及是否存在会引入非确定性的替代写入路径。

进一步验证

在 SyGra 生成之后,所有场景都经过了多轮人工审核。审核人员核实了以下几点:(1) 策略在同一领域内的各个场景中得到了统一应用;(2) 用户目标足够具体,能够对应唯一正确的解决方案;(3) 预期最终状态与用户目标及初始数据库在内部保持一致;(4) 对抗性场景被正确设定,且存在可明确识别的策略违规。存在歧义或不一致的记录被修正或丢弃。

作为最后一道工序,我们在每个场景的纯文本版本上运行了三个前沿模型——OpenAI GPT-5.4、Google Gemini 3.1 Pro 和 Anthropic Claude Opus 4.6,绕过音频处理流程,直接提供对话转录文本。对于任何模型在任务完成度上得零分的场景,我们人工排查了该失败究竟反映的是真实的模型错误,还是数据集问题:策略存在歧义、用户目标描述不充分、工具执行器存在 bug,或者初始数据库状态与预期数据库状态之间存在不一致。经确认存在数据集问题的记录被修正或移除。所有入选样本都至少能被其中一个前沿模型解决。

数据集深度解析

我们创建了三个面向不同企业领域的数据集,每个数据集都针对语音智能体的一项不同难度维度进行设计。这三个数据集都要求在语音中准确转录结构化的命名实体(例如确认码和员工标识符),但在主要挑战和工具数量上各有不同。

下面,我们将深入介绍我们的两个新数据集:Enterprise ITSM 与 Healthcare HRSD。

多语言支持

仅用英语进行评估,无法充分反映语音智能体在其他语言中的实际表现。语音识别准确率、转录保真度和对话流畅度都可能因语言不同而以各自的方式下降,这意味着一个在英语中表现优异的语音智能体,在部署到其他语言环境时可能完全失效。为了让从业者真正了解多语言部署的情况,我们正在增加对更多语言的支持,不仅调整对话语言,还针对每种目标语言和文化调整评估流程:

  • 场景中引用的地点名称
  • 用户的姓名和电子邮件地址
  • 本地化电话号码
英语场景 法语场景
话语:“嗨,我被锁在外面了,需要帮助重新登录我的账户。” 话语“Bonjour, mon compte est bloqué et j’ai besoin d’aide pour y accéder à nouveau.”
地点:[ "downtown", "engineering center" ] 地点:[ "centre-ville", "centre d’ingénierie" ]
姓名:{"first_name": "Marcus", "last_name": "Chen"} 姓名:{"first_name": "Éric", "last_name": "Nicolas"}
邮箱:"marcus.chen@example.com" 邮箱:"eric.nicolas@example.com"
电话:+1-512-555-0148 电话:+33 6 19 41 27 70

这使用户模拟器能够以所选语言提供真实的体验。除数据集之外,我们还在更新我们的指标和评判器,以构建跨语言的值得信赖的评估。

获取数据

EVA-Bench 在 MIT 许可证下完全开源。数据集、评估框架和排行榜均已公开可用。在 HuggingFace 数据集页面下载数据集并浏览各条记录。使用 Hugging Face datasets 库直接加载其中任意一条:

from datasets import load_dataset

# Airline Customer Service Management (CSM) — 50 scenarios
airline = load_dataset("ServiceNow-AI/eva-bench", "airline", split="test")
# Enterprise IT Service Management (ITSM) — 80 scenarios
itsm = load_dataset("ServiceNow-AI/eva-bench", "itsm", split="test")
# Healthcare HR Service Delivery (HRSD) — 83 scenarios
hrsd = load_dataset("ServiceNow-AI/eva-bench", "medical", split="test")

每条记录都包含结构化的用户目标、初始场景数据库以及预期的真实最终数据库状态——运行完整的 bot 对 bot 评估所需的一切。有关设置说明、代码和贡献指南,请参阅 GitHub 仓库。

引用

@misc{bogavelli2026evabenchnewendtoendframework,
      title={EVA-Bench: A New End-to-end Framework for Evaluating Voice Agents}, 
      author={Tara Bogavelli and Gabrielle Gauthier Melançon and Katrina Stankiewicz and Oluwanifemi Bamgbose and Fanny Riols and Hoang H. Nguyen and Raghav Mehndiratta and Lindsay Devon Brin and Joseph Marinier and Hari Subramani and Anil Madamala and Sridhar Krishna Nemala and Srinivas Sunkara},
      year={2026},
      eprint={2605.13841},
      archivePrefix={arXiv},
      primaryClass={cs.SD},
      url={https://arxiv.org/abs/2605.13841}, 
}

@misc{ray2026tauvoicebenchmarkingfullduplexvoice,
      title={$\tau$-Voice: Benchmarking Full-Duplex Voice Agents on Real-World Domains}, 
      author={Soham Ray and Keshav Dhandhania and Victor Barres and Karthik Narasimhan},
      year={2026},
      eprint={2603.13686},
      archivePrefix={arXiv},
      primaryClass={cs.SD},
      url={https://arxiv.org/abs/2603.13686}, 
}

@misc{pradhan2025sygraunifiedgraphbasedframework,
      title={SyGra: A Unified Graph-Based Framework for Scalable Generation, Quality Tagging, and Management of Synthetic Data}, 
      author={Bidyapati Pradhan and Surajit Dasgupta and Amit Kumar Saha and Omkar Anustoop and Sriram Puttagunta and Vipul Mittal and Gopal Sarda},
      year={2025},
      eprint={2508.15432},
      archivePrefix={arXiv},
      primaryClass={cs.AI},
      url={https://arxiv.org/abs/2508.15432}, 
}

来源:Hugging Face:Blog(RSS) · huggingface.co