ServiceNow 推出 EVA:评估语音智能体的新框架
摘要
ServiceNow 发布 EVA,这是一个面向对话式语音智能体的端到端评估框架,能够同时评估任务准确率和对话体验。
查看缓存全文
缓存时间: 2026/05/08 09:15
评估语音智能体的新框架(EVA)
来源:https://huggingface.co/blog/ServiceNow-AI/eva 返回文章列表 (https://huggingface.co/blog)
- 引言 (https://huggingface.co/blog/ServiceNow-AI/eva#introduction) - 背景与动机 (https://huggingface.co/blog/ServiceNow-AI/eva#background-and-motivation) - EVA (https://huggingface.co/blog/ServiceNow-AI/eva#eva)- 框架 (https://huggingface.co/blog/ServiceNow-AI/eva#the-framework) - 数据 (https://huggingface.co/blog/ServiceNow-AI/eva#data) - 评估方法 (https://huggingface.co/blog/ServiceNow-AI/eva#evaluation-methodology) - 发现 (https://huggingface.co/blog/ServiceNow-AI/eva#findings) - 局限性 (https://huggingface.co/blog/ServiceNow-AI/eva#limitations) - 未来展望 (https://huggingface.co/blog/ServiceNow-AI/eva#whats-next) - 致谢 (https://huggingface.co/blog/ServiceNow-AI/eva#acknowledgements) - 引用 (https://huggingface.co/blog/ServiceNow-AI/eva#citation) https://huggingface.co/blog/ServiceNow-AI/eva#introduction引言
对话式语音智能体带来了一项独特的评估挑战:它们必须同时满足两个目标——准确性(正确、忠实地完成用户任务)和对话体验(以自然、简洁且适合语音交互的方式完成)。这两个目标深度交织:听错确认码会让完美的 LLM 推理变得毫无意义;一连串选项会让无法扫读语音输出的来电者不知所措;延迟响应可能通过所有准确性检查,却在实际使用中无法使用。现有框架将这些视为独立问题——评估任务成功率或对话动态,但无法同时评估两者。
我们推出 EVA,一个端到端的对话式语音智能体评估框架,使用真实的 bot-to-bot 架构评估完整的多轮语音对话。EVA 产出两个高层级分数:EVA-A(准确性)和 EVA-X(体验),旨在揭示各维度的失败情况。EVA 首次对任务成功率和对话体验进行联合评分。我们发布了 EVA 的初始航空数据集,包含 50 个场景,涵盖航班改签、取消处理、代金券等——这是计划中的一系列领域中的首个。
intro (https://cdn-uploads.huggingface.co/production/uploads/66855306fe857bb0701b57e3/c-GGXZwO2s3fbtEdmxeCQ.png)
我们还提供了 20 个级联式和音频原生系统的基准测试结果,包括语音到语音(S2S)模型和大型音频语言模型(LALM)。我们最重要的发现是:存在一致的准确性-体验权衡;任务完成度高的智能体往往用户体验更差,反之亦然。
- 🌐网站 (https://servicenow.github.io/eva)— 探索完整框架、早期结果和演示。
- 💻GitHub (https://github.com/ServiceNow/eva)— 深入了解代码、框架和评判提示词。
- 📂HF 数据集 (https://huggingface.co/datasets/ServiceNow-AI/eva)- 浏览数据集
https://huggingface.co/blog/ServiceNow-AI/eva#background-and-motivation背景与动机
当前该领域缺乏评估语音智能体交互完整质量的框架,因为大多数现有工作仅孤立地评估单个组件。例如,AudioBench (https://aclanthology.org/2025.naacl-long.218v2.pdf)、SD-Eval (https://proceedings.neurips.cc/paper_files/paper/2024/hash/681fe4ec554beabdc9c84a1780cd5a8a-Abstract-Datasets_and_Benchmarks_Track.html)、VoxEVAL (https://aclanthology.org/2025.acl-long.818.pdf)、Kimi-Audio-Evalkit (https://github.com/MoonshotAI/Kimi-Audio-Evalkit)、VoiceBench (https://arxiv.org/pdf/2410.17196) 和 VoxDialogue (https://openreview.net/forum?id=vbmSSIhKAM) 评估语音转文本(STT)的核心语音理解能力——转录、副语言特征、声学线索——但仍局限于单轮、非交互式场景。另一方面,EmergentTTS-Eval (https://openreview.net/forum?id=P3JBBnh10z) 和 SHEET (https://www.isca-archive.org/interspeech_2025/huang25g_interspeech.pdf) 通过主观听测(如平均意见分)评估感知语音质量。除了语音感知,FD-Bench (https://www.isca-archive.org/interspeech_2025/peng25b_interspeech.pdf)、Talking Turns (https://arxiv.org/pdf/2503.01174)、Full-Duplex-Bench (https://arxiv.org/pdf/2503.04721) 对对话动态进行了更深入的分析——打断、反馈、话轮转换——但这些评估与面向任务的工具使用相隔离,未能考察对话质量与智能体能力之间的关系。更近的工作,特别是 VoiceAgentBench (https://arxiv.org/pdf/2510.07978) 和 CAVA (https://talkarena.org/cava),开始朝着评估商用语音智能体系统的智能体能力迈出步伐,包括工具调用和复杂指令遵循。然而,这些语音智能体能力并未在语音智能体实际必须应对的完整对话流程中进行评估:从初始用户请求,经过多步工具编排,到最终任务解决。
缺乏能够同时捕捉准确性和体验的框架,凸显了需要将语音智能体质量视为一个整体来评估的框架。这意味着不仅要评估任务是否成功,还要评估智能体是否在整个过程中准确、简洁、自然地沟通,并揭示这些维度在真实部署条件下如何相互权衡。
https://huggingface.co/blog/ServiceNow-AI/eva#evaEVA
https://huggingface.co/blog/ServiceNow-AI/eva#the-framework框架
端到端评估揭示了组件层面无法察觉的交互动态:智能体是否会在语音自然停顿时打断用户,是否能在用户纠正转录错误时平滑恢复,或者高延迟是否足以破坏对话流畅性,导致用户重复话语或放弃任务。
architecture (https://cdn-uploads.huggingface.co/production/uploads/66855306fe857bb0701b57e3/vjXPPdcgsXdBgrVH2Q7uG.png)
EVA 模拟多轮语音对话,通过实时音频让智能体调用适当的工具、遵循特定任务策略,并达到可确定性验证的终态。EVA 使用 bot-to-bot 音频架构评估语音智能体,包含五个核心组件:
- 用户模拟器— 配置特定目标和角色的对话 AI,扮演来电者。它使用高质量文本转语音(TTS)模型在音频中运行,确保评估能够捕捉自然对话语音中的代表性语音理解挑战和真实的话轮转换动态。
- 语音智能体— 待评估的语音智能体,基于 Pipecat 构建,这是一个用于实时语音应用的开源 Python 框架。EVA 支持级联架构(STT → LLM → TTS)和音频原生模型(S2S 或 LALM → TTS)。
- 工具执行器— 通过自定义 Python 函数提供确定性、可复现工具响应的引擎。它动态查询和修改每个场景的预定义数据库。
- 验证器— 一组验证指标,检查对话是否完整,以及用户是否忠实再现了预期行为和语音,无需人工标注。任何在此验证步骤中失败的对话都会被重新生成,确保只有有效、正确执行的对话进入评估。这与依赖事后人工标注来识别模拟器错误的方法形成对比。
- 指标套件— 使用对话录音、转录文本和工具调用日志评估语音智能体的一套指标。
https://huggingface.co/blog/ServiceNow-AI/eva#data数据
我们框架中的每个测试用例(场景)都是一个评估记录,结构化为可复现测试:
- 用户目标— 来电者试图完成的事项。包含高度具体的用户目标和精确决策树,引导用户模拟器完成对话,对预期结果不留歧义。
- 用户角色— 来电者的行为方式——说话风格、耐心程度和性格特征。
- 场景数据库— 智能体工具将查询的后端数据。
- 基准真值— 成功对话后场景数据库的预期终态。
我们发布的 EVA 包含一个合成的航空数据集,50 个场景和 15 个工具,涵盖 IRROPS 改签、自愿行程变更、取消、当日候补和补偿代金券。场景设计用于测试时间推理、策略遵循、约束满足和命名实体处理。
demo (https://cdn-uploads.huggingface.co/production/uploads/64e7ac350c47bf287ca307ef/FSfnG6CHmQEfI5fqOyJI4.png)
查看完整演示请访问此处 (https://servicenow.github.io/eva/#demo)。
https://huggingface.co/blog/ServiceNow-AI/eva#evaluation-methodology评估方法
EVA 从两个基本维度评估语音智能体:EVA-A 用于准确性,EVA-X 用于体验。EVA 还包含一组诊断指标。与主要指标不同,这些不直接用于比较或排名模型——而是提供细粒度洞察,帮助理解模型为何获得该分数,识别和理解特定故障模式(如 ASR、语音合成等)。我们报告 pass@k(k 次运行中至少一次成功的概率)和 pass^k(k 次运行全部成功的概率),每个场景进行三次试验(k = 3),以捕捉峰值性能和行为一致性。
methodology_eva_scores (https://cdn-uploads.huggingface.co/production/uploads/66855306fe857bb0701b57e3/z5KslZhMfjp2TVg3phWoh.png)
EVA 使用两种评估方法:确定性基于代码的指标,直接从结构化数据计算,速度快;以及 LLM-as-Judge 指标,使用大型语言模型(LLM)评估对话的定性方面,或使用大型音频语言模型(LALM)直接评估语音。每个基于评判的指标使用在该特定指标的人工精选评估数据集上表现最佳的模型。
https://huggingface.co/blog/ServiceNow-AI/eva#eva-a-accuracyEVA-A:准确性
仅凭任务完成度不足以衡量准确性。智能体可能达到正确的终态,同时编造策略细节、朗读时读错确认码,或对话中途 hallucinate 航班号。这些失败对二元通过/失败检查不可见,但直接伤害用户。因此 EVA-A 衡量三个准确性维度:
- 任务完成度【确定性】— 通过比较场景数据库的预期终态与对话后的实际终态,衡量智能体是否正确完成任务。
- 忠实度【LLM-as-Judge】— 衡量智能体的回应是否基于其指令、策略、用户输入和工具调用结果——标记编造、歪曲、策略违规和幻觉。
- 语音保真度【LALM-as-Judge】— 衡量语音系统是否忠实再现预期文本为口语音频,特别关注在语音场景中必须正确处理的实体,如确认码、航班号和金额。这是任何端到端语音智能体基准中唯一在音频层面评估智能体自身口语输出质量的指标。
https://huggingface.co/blog/ServiceNow-AI/eva#eva-x-experienceEVA-X:体验
话轮转换时机重要,但只是故事的一部分。智能体可能时机完美,却用一连串来电者无法扫读的口语选项将其淹没,或反复询问已提供的信息。这些失败降低了体验,却无需涉及时机不当的回应。因此 EVA-X 衡量三个体验维度:
- 简洁性【LLM-as-Judge】— 衡量智能体的回应对于口语交付是否恰当简洁且聚焦,因为电话用户无法扫读、重读或回滚长回应。
- 对话推进【LLM-as-Judge】— 衡量智能体是否有效推进对话——避免重复、跨轮次保留上下文、不拖延地推动任务完成。
- 话轮转换【LLM-as-Judge】— 衡量智能体是否在正确时间说话——既不打断用户,也不在其说完后引入过度沉默。
https://huggingface.co/blog/ServiceNow-AI/eva#findings发现
我们评估了 20 个系统——专有的和开源的,级联式的和音频原生的——发现存在一致的准确性-体验权衡:任务完成度高的智能体往往用户体验更差,反之亦然——这是仅评分任务完成度的基准无法察觉的权衡。没有单一配置在两个维度上都占优,证实了准确性和体验必须联合测量。
此外,我们识别出命名实体转录是主要故障模式。单个听错字符可能级联为认证失败和整个对话崩溃。同时,多步骤工作流以可预测的方式使智能体失效。在保留辅助服务(座位、行李)的同时重新预订航班,是所有配置中的主要复杂性破坏因素。最后,我们观察到真实用例需要额外校准。所有配置的 pass@3 与 pass^3 差距显著。即使能完成任务的智能体,也往往无法稳定完成,这对真实世界成功至关重要。
early_results_scatter (https://cdn-uploads.huggingface.co/production/uploads/66855306fe857bb0701b57e3/3Go_qvjZHCZizjJFiRdeO.png)
查看早期结果请访问此处 (https://servicenow.github.io/eva/#early-results)。
https://huggingface.co/blog/ServiceNow-AI/eva#limitations局限性
EVA 旨在为对话式语音智能体提供严格的端到端评估,但有几个重要局限性需要承认,涵盖框架、数据和指标维度:
- 指标— LLM-as-judge 模型存在固有偏见,可能独立于质量偏好某些回应风格,当评估模型和评判模型共享同一提供商时,系统性偏见风险额外增加。虽然我们针对标注数据集验证评判模型并在网站上报告对齐分数,但这些对齐分数无法完全消除系统性偏见。此外,任务完成度测量为二元值,无法捕捉部分得分,可能低估优雅失败与灾难性失败系统的相对质量差异。
- 模拟— 当前版本包含单一领域(航空)的 50 个英语场景;结果可能无法推广到其他领域、语言或口音。此外,用户模拟器可能无法完美复现真实来电者行为(如不流畅、犹豫、情绪)或保证完全遵循策略。
- 框架— 用户模拟器依赖单一商业提供商,其语音特征可能系统性偏好某些 ASR 系统;bot-to-bot 流水线——包括音频格式转换和实时音频接口——可能无法完全代表生产部署。此外,完整复现需要商业 API 访问,延迟测量将因提供商和基础设施而异。
https://huggingface.co/blog/ServiceNow-AI/eva#whats-next未来展望
On the
相似文章
EVA-Bench:评估语音代理的新型端到端框架
EVA-Bench 提出了一个全面的端到端评估框架,用于评估语音代理,模拟真实的多轮对话,并通过新颖的准确度(EVA-A)和体验(EVA-X)指标衡量语音特定故障模式下的性能。该基准包含企业领域的 213 个场景以及用于口音和噪声鲁棒性的扰动套件,揭示了当前系统的显著差距。
EVA-Bench Data 2.0:3大领域、121个工具、213个场景
ServiceNow AI 发布 EVA-Bench Data 2.0,这是一个扩展的开源基准测试,用于评估语音智能体在3个企业领域(航空客户服务管理、IT服务管理、医疗人力资源服务交付)中的表现,涵盖213个场景和121个工具,并已针对 GPT-4.5、Gemini 和 Claude 进行验证。
@rohanpaul_ai: 我非常喜欢 @voicearena_ai 如何设计这个评估。而不是简单地问一个语音模型是否“更好”……
这条推文强调了 VoiceArena 对语音模型的评估方法,该方法通过盲对投票将任务完成度与自然度分开,并宣布 Jarvis Bench v0.5 作为对话代理基准。
推出 Real World VoiceEQ:衡量语音AI的拟人化质量
Real World VoiceEQ 是一个新基准,用于评估语音AI的拟人化质量,基于超过一百万的人类评分,在真实世界条件下评估语音识别、合成和理解的模型。
τ-Elicitation:评估语音代理中多轮实体提取的基准
本文介绍了τ-Elicitation,一个用于评估语音代理中多轮实体提取的基准,指出了策略选择和错误恢复是关键瓶颈。