EVA-Bench:端到端语音智能体评估新框架
EVA-Bench: A New End-to-end Framework for Evaluating Voice Agents
EVA-Bench是一个端到端语音智能体评估框架,解决了模拟真实对话与测量全范围语音故障两大挑战。它通过动态多轮机器对话和自动验证进行仿真,并提出了衡量任务完成度、音频保真度的EVA-A指标,以及评估对话体验的EVA-X指标。框架包含三个领域的213个场景及鲁棒性测试集,采用区分峰值与可靠能力的测量方法。在12个系统的测试中发现,无系统能在两项核心指标上同时超过0.5,峰值与可靠性能差距显著,且口音与噪声扰动暴露出明显的鲁棒性缺陷。该框架已开源。
EVA-Bench 把语音代理评估从「能对话就行」推进到「对话质量+鲁棒性」的全维度打分,还开源了 213 个企业场景,做语音助手的团队该认真看看。
语音智能体,即通过口语对话完成任务的人工智能系统,正越来越多地部署于企业应用场景中。然而,现有基准测试均未能同时解决两大核心评估挑战:生成逼真的模拟对话,以及全面衡量语音特有故障模式下的质量。我们提出 EVA-Bench,一个端到端评估框架,同时应对这两项挑战。在模拟方面,EVA-Bench 编排了机器人之间的音频对话,支持动态多轮交互,并具备自动模拟验证功能,可在评分前检测用户模拟器错误并适时重新生成对话。在测量方面,EVA-Bench 引入了两个复合指标:EVA-A(准确性),涵盖任务完成度、忠实度及音频层面的语音保真度;以及 EVA-X(体验),涵盖对话推进、口语简洁性及话轮切换时机。这两个指标均适用于所有主流智能体架构,支持直接的跨架构比较。EVA-Bench 包含覆盖三个企业领域的 213 个场景、一套用于口音和噪声鲁棒性的受控扰动测试集,以及 pass@1、pass@k、pass^k 三种测量方式,用以区分峰值能力与可靠能力。在对涵盖全部三种架构的 12 个系统进行评估后,我们发现:(1)没有任何系统能在 EVA-A pass@1 和 EVA-X pass@1 上同时超过 0.5;(2)峰值性能与可靠性能之间存在显著差距(EVA-A 上 pass@k 与 pass^k 的中位数差距为 0.44);(3)口音和噪声扰动暴露了巨大的鲁棒性差距,其影响因架构、系统和指标而异(平均 Δ 最高达 0.314)。我们以开源许可证发布完整的框架、评估套件及基准数据。
来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org