EVA-Bench Data 2.0:3大领域、121个工具、213个场景

Hugging Face Blog 工具

摘要

ServiceNow AI 发布 EVA-Bench Data 2.0,这是一个扩展的开源基准测试,用于评估语音智能体在3个企业领域(航空客户服务管理、IT服务管理、医疗人力资源服务交付)中的表现,涵盖213个场景和121个工具,并已针对 GPT-4.5、Gemini 和 Claude 进行验证。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/06/05 02:13

EVA-Bench 数据 2.0:3 个领域、121 个工具、213 个场景

来源:https://huggingface.co/blog/ServiceNow-AI/eva-bench-data 返回文章列表 (https://huggingface.co/blog)

  • 简介 (https://huggingface.co/blog/ServiceNow-AI/eva-bench-data#introduction)
  • 数据设计原则 (https://huggingface.co/blog/ServiceNow-AI/eva-bench-data#data-design-principles)
  • 场景生成 (https://huggingface.co/blog/ServiceNow-AI/eva-bench-data#scenario-generation)
  • 进一步验证 (https://huggingface.co/blog/ServiceNow-AI/eva-bench-data#further-validation)
  • 数据集深度解析 (https://huggingface.co/blog/ServiceNow-AI/eva-bench-data#dataset-deep-dives)
  • 多语言支持 (https://huggingface.co/blog/ServiceNow-AI/eva-bench-data#multilingual-support)
  • 获取数据 (https://huggingface.co/blog/ServiceNow-AI/eva-bench-data#get-the-data)
  • 引用 (https://huggingface.co/blog/ServiceNow-AI/eva-bench-data#citations)

Screenshot 2026-06-03 at 4.59.53 PM (https://cdn-uploads.huggingface.co/production/uploads/66d0b470cc4d59dba5c70879/asHcI2fJBCjMUMhzxsDU6.png)

https://huggingface.co/blog/ServiceNow-AI/eva-bench-data#introduction简介

语音智能体的失败往往具有高度的领域特异性。一个在航班改签中能完美处理字母数字确认码的系统,在处理 HR 系统中复杂的政策时可能会频频出错。不同领域考验的是智能体适应不同词汇、工作流复杂度和用户期望的能力。因此,本次发布的 EVA-Bench 将评测范围从一个企业领域扩展至三个:航空客户服务管理(CSM)、企业 IT 服务管理(ITSM)以及医疗健康 HR 服务交付(HRSD)。三个领域共涵盖 121 个工具下的 213 个评测场景,相比初始版本场景覆盖量提升约 4 倍。 所有场景均针对三个前沿模型(OpenAI GPT-5.4、Google Gemini 3.1 Pro 和 Anthropic Claude Opus 4.6)进行了可解性验证,确保基准测试既有挑战性又公平合理。全部三个数据集均已开源,可免费下载:

`` from datasets import load_dataset

航空客户服务管理 (CSM) — 50 个场景

airline = load_dataset(“ServiceNow-AI/eva-bench”, “airline”, split=“test”)

企业 IT 服务管理 (ITSM) — 80 个场景

itsm = load_dataset(“ServiceNow-AI/eva-bench”, “itsm”, split=“test”)

医疗健康 HR 服务交付 (HRSD) — 83 个场景

hrsd = load_dataset(“ServiceNow-AI/eva-bench”, “medical”, split=“test”) ``

EVA-Bench 面向多类用户群体。如果你正在评测语音智能体,可以在涵盖 35 种以上不同工作流的多样化真实企业场景中运行测试。如果你正在构建自己的评测数据集,本文对端到端生成与验证流程的描述足够详尽,可作为实用参考。我们将逐步介绍每个领域的设计与生成方式,并深入剖析两个新增领域。此外,我们还将预告即将推出的多语言扩展,以拓宽基准测试在英语以外企业部署场景中的适用范围。

https://huggingface.co/blog/ServiceNow-AI/eva-bench-data#data-design-principles数据设计原则

五项原则贯穿了 EVA-Bench 三个领域数据集的设计全程。

以语音为核心。 并非所有企业工作流都适合纳入语音基准测试。我们首先识别了各领域中实际通过电话处理的任务,再从中筛选出最常见的业务流程,从而确保场景贴近真实的电话呼叫模式。

真实性。 工具 schema 参照生产平台使用的 API 类型进行建模,场景策略则来源于实际的企业约束条件。在医疗健康 HRSD 领域,这意味着将场景扎根于真实的美国医疗政策与管理系统,包括 NPI 编号、FMLA 和保险覆盖等内容,使基准测试能够反映从业者在实际工作中所遇到的真实场景。

多样性。 通过简单重复相同任务来扩充数据集,只能提供有限的评测信号。为此,我们为每个领域定义了具体的工作流,并在三种场景类型中进行采样:单意图通话、包含最多四个意图的多意图通话,以及对抗性通话(在这类通话中,呼叫者会试图绕过排查步骤、错误标记紧急程度,或访问其无权查看的记录)。在单意图和多意图场景中,我们还加入了用户目标无法被满足的情况,因为真实的来电并非都是“顺利路径“,而根据我们的经验,模型在处理无法满足的目标时往往比处理成功交互更容易出错。

身份验证。 此前的研究(EVA-Benchτ-Voice)已将身份验证确定为语音智能体最一致的失败点之一。EVA-Bench 的每个领域都包含身份验证流程,且具体机制与任务场景相匹配。例如,基于 OTP 的权限提升仅出现在生产系统实际需要它的场合,而非统一应用于所有场景。

可复现性。 若场景不可复现,则很难判断评分差异究竟反映了真实的能力差距,还是场景运行方式所带来的偶然结果。我们将数据集设计为每个场景只有唯一一条正确的解决路径。用户目标的构建确保模拟器每次都能以一致的方式运行,场景生成过程也明确检查并消除了任何可能导致不确定性的、存在多条有效动作序列的情况。

https://huggingface.co/blog/ServiceNow-AI/eva-bench-data#scenario-generation场景生成

联合生成。 场景通过 SyGra(一种基于图的合成数据生成流水线)生成,以 GPT-5.4 作为骨干模型。每个场景需要三个高度一致的组成部分,这些部分被联合生成,以防止独立生成时出现的不一致问题:

用户目标。 可复现性要求用户模拟器在每次运行场景时表现一致。模糊的意图描述无法达到这一目的:模拟器在不同运行中会做出不同的判断,产生不稳定的评测信号。为此,用户目标被构建为一棵决策树,覆盖模拟器可能遇到的各种情况。用户目标明确规定了用户应提出哪些请求,以及一个协商序列——精确指定何时该反驳、何时该询问替代方案、何时该接受。常见的边界情况,例如是否接受候补航班或备选机场,都通过明确指令处理,而非留给模拟器自行解读。解决条件要求提供已完成操作的证据,如确认编号或工单 ID,而非口头承诺,从而确保模拟器在动作真正确认之前不会结束通话。最终结果是一个行为像真实、一致的呼叫者的用户,而非即兴发挥的用户。

初始场景数据库。 智能体工具在场景执行过程中查询和修改的后端状态。与用户目标联合生成,以确保用户目标中引用的每个实体(如预订 ID、账户详情和身份验证凭据)都在数据库中存在且一致。

预期最终数据库状态(真实标注)。 我们通过在智能体指令、用户目标和初始场景数据库上运行生成 LLM 来推导预期结果,产生完整的动作轨迹。LLM 每执行一个写入工具调用时,数据库随之增量更新,最终的终态即成为评测时验证器对照的真实标注。

联合生成至关重要,因为这三个组成部分之间存在深度依赖关系。独立生成会引入隐性不一致,例如用户目标中引用了一个在场景数据库中不存在的工单 ID,从而完全破坏评测信号。为此,我们在每次生成尝试后运行多阶段验证循环,将所有失败反馈给生成步骤,直至所有检查通过为止。验证分三步进行:

  • 结构检查:根据 Pydantic schema 对场景数据库进行验证,捕获类型错误和缺失字段。
  • 基于 LLM 的验证器:从更全局的视角检查场景一致性:用户目标中面向用户的细节是否与数据库记录匹配、交叉引用是否内部有效、身份验证数据是否正确配置。
  • 基于 LLM 的轨迹验证步骤:对照策略合规性、正确的动作序列、所有必要终端动作的完成情况,以及是否存在可能引入不确定性的其他写入路径,检查完整的对话轨迹。

https://huggingface.co/blog/ServiceNow-AI/eva-bench-data#further-validation进一步验证

在 SyGra 生成完成后,所有场景经过了多轮人工审核。审核人员验证了以下内容:(1)策略在同一领域的各场景中应用一致;(2)用户目标足够具体,只允许唯一一种正确解决方式;(3)预期最终状态与用户目标和初始数据库内部一致;(4)对抗性场景规范正确,具有清晰可识别的策略违规行为。存在歧义或不一致的记录将被修正或丢弃。

作为最终验证,我们在每个场景的纯文本版本上运行了三个前沿模型——OpenAI GPT-5.4、Google Gemini 3.1 Pro 和 Anthropic Claude Opus 4.6——绕过音频管道,直接提供对话文本。对于任何模型在任务完成度上得分为零的场景,我们均人工排查失败原因:是模型真正的错误,还是数据集问题(如策略模糊、用户目标规范不足、工具执行器存在 bug,或初始状态与预期数据库状态之间存在不一致)。已识别出数据集问题的记录将被修正或删除。所有最终选定的样本均可被至少一个前沿模型解决。

https://huggingface.co/blog/ServiceNow-AI/eva-bench-data#dataset-deep-dives数据集深度解析

我们在不同企业领域上创建了三个数据集,每个领域针对语音智能体的一个不同难度维度。三者均要求对语音中的结构化命名实体(如确认码和员工标识符)进行准确转录,但在核心挑战和工具数量上各有不同。

以下是对两个新数据集的深度解析:企业 ITSM 与医疗健康 HRSD。

Screenshot 2026-06-03 at 4.19.42 PM (https://cdn-uploads.huggingface.co/production/uploads/66d0b470cc4d59dba5c70879/qmQbPHcpbwEZUPRRx_hhi.png)

Screenshot 2026-06-03 at 4.25.43 PM (https://cdn-uploads.huggingface.co/production/uploads/66d0b470cc4d59dba5c70879/7ncL-APACVJmpxbvBteLZ.png)

https://huggingface.co/blog/ServiceNow-AI/eva-bench-data#multilingual-support多语言支持

仅针对英语的评测无法充分反映语音智能体在其他语言环境中的真实表现。语音识别准确率、转录保真度和对话流畅度可能各自以语言特有的方式下降,这意味着一个在英语中表现优异的语音智能体,在部署到其他语言环境时可能会完全失效。为了给从业者提供真实的多语言部署洞察,我们正在添加对更多语言的支持,不仅调整对话语言,还将评测流水线适配到各目标语言和文化:

  • 场景中涉及的地点名称
  • 用户姓名和电子邮件地址
  • 本地化电话号码
英语场景法语场景
话语:“Hi, I’m locked out and need help getting back into my account.”话语:“Bonjour, mon compte est bloqué et j’ai besoin d’aide pour y accéder à nouveau.”
地点:[ “downtown”, “engineering center” ]地点:[ “centre-ville”, “centre d’ingénierie” ]
姓名:{“first_name”: “Marcus”, “last_name”: “Chen”}姓名:{“first_name”: “Éric”, “last_name”: “Nicolas”}
邮箱:“[email protected]邮箱:“[email protected]
电话:+1-512-555-0148电话:+33 6 19 41 27 70

这使得用户模拟器能够以所选语言提供真实的交互体验。除数据集之外,我们还将更新评测指标和评判器,以构建跨语言的可信评测体系。

https://huggingface.co/blog/ServiceNow-AI/eva-bench-data#get-the-data获取数据

EVA-Bench 以 MIT 许可证完全开源。数据集评测框架排行榜均已公开发布。你可以下载数据集并在 HuggingFace 数据集页面上浏览各条记录,也可以使用 Hugging Face datasets 库直接加载任意数据集:

`` from datasets import load_dataset

航空客户服务管理 (CSM) — 50 个场景

airline = load_dataset(“ServiceNow-AI/eva-bench”, “airline”, split=“test”)

企业 IT 服务管理 (ITSM) — 80 个场景

itsm = load_dataset(“ServiceNow-AI/eva-bench”, “itsm”, split=“test”)

医疗健康 HR 服务交付 (HRSD) — 83 个场景

hrsd = load_dataset(“ServiceNow-AI/eva-bench”, “medical”, split=“test”) ``

每条记录包含结构化的用户目标、初始场景数据库以及真实标注的预期最终数据库状态——运行完整的机器人对机器人评测所需的一切内容。有关安装说明、代码和贡献指南,请参阅 GitHub 仓库

https://huggingface.co/blog/ServiceNow-AI/eva-bench-data#citations引用

`` @misc{bogavelli2026evabenchnewendtoendframework, title={EVA-Bench: A New End-to-end Framework for Evaluating Voice Agents}, author={Tara Bogavelli and Gabrielle Gauthier Melançon and Katrina Stankiewicz and Oluwanifemi Bamgbose and Fanny Riols and Hoang H. Nguyen and Raghav Mehndiratta and Lindsay Devon Brin and Joseph Marinier and Hari Subramani and Anil Madamala and Sridhar Krishna Nemala and Srinivas Sunkara}, year={2026}, eprint={2605.13841}, archivePrefix={arXiv}, primaryClass={cs.SD}, url={https://arxiv.org/abs/2605.13841}, }

@misc{ray2026tauvoicebenchmarkingfullduplexvoice, title={\tau-Voice: Benchmarking Full-Duplex Voice Agents on Real-World Domains}, author={Soham Ray and Keshav Dhandhania and Victor Barres and Karthik Narasimhan}, year={2026}, eprint={2603.13686}, archivePrefix={arXiv}, primaryClass={cs.SD}, url={https://arxiv.org/abs/2603.13686}, }

@misc{pradhan2025sygraunifiedgraphbasedframework, title={SyGra: A Unified Graph-Based Framework for Scalable Generation, Quality Tagging, and Management of Synthetic Data}, author={Bidyapati Pradhan and Surajit Dasgupta and Amit Kumar Saha and Omkar Anustoop and Sriram Puttagunta and Vipul Mittal and Gopal Sarda}, year={2025}, eprint={2508.15432}, archivePrefix={arXiv}, primaryClass={cs.AI}, url={https://arxiv.org/abs/2508.15432}, ``

相似文章

EVA-Bench:评估语音代理的新型端到端框架

Hugging Face Daily Papers

EVA-Bench 提出了一个全面的端到端评估框架,用于评估语音代理,模拟真实的多轮对话,并通过新颖的准确度(EVA-A)和体验(EVA-X)指标衡量语音特定故障模式下的性能。该基准包含企业领域的 213 个场景以及用于口音和噪声鲁棒性的扰动套件,揭示了当前系统的显著差距。

Evo-Bench:语言模型能否改进智能体工具框架?

Hugging Face Daily Papers

介绍 Evo-Bench,这是首个用于评估语言模型在搜索、办公和通用智能体领域中内在工具框架进化能力的基准,表明顶级模型取得了显著进步,但在办公工作流上仍面临挑战。