推出 Real World VoiceEQ:衡量语音AI的拟人化质量
摘要
Real World VoiceEQ 是一个新基准,用于评估语音AI的拟人化质量,基于超过一百万的人类评分,在真实世界条件下评估语音识别、合成和理解的模型。
查看缓存全文
缓存时间: 2026/07/15 16:20
介绍 Real World VoiceEQ:衡量语音 AI 的人类质量
来源:https://huggingface.co/blog/real-world-voiceeq
返回文章 (https://huggingface.co/blog)
- 语音 AI 的更广泛基准 (https://huggingface.co/blog/real-world-voiceeq#a-broader-benchmark-for-voice-ai)
- Real World VoiceEQ 的关键发现 (https://huggingface.co/blog/real-world-voiceeq#key-findings-from-real-world-voiceeq)
- 语音 AI 的进展正变得越来越专业化 (https://huggingface.co/blog/real-world-voiceeq#progress-in-voice-ai-is-becoming-increasingly-specialized)
- 语音模型变得更擅长说话而非真正倾听 (https://huggingface.co/blog/real-world-voiceeq#voice-models-have-become-better-at-speaking-than-actually-listening)
- 传统基准测试日益高估真实世界性能 (https://huggingface.co/blog/real-world-voiceeq#traditional-benchmarks-increasingly-overestimate-real-world-performance)
- 人类评估仍然至关重要 (https://huggingface.co/blog/real-world-voiceeq#human-evaluation-remains-essential)
- 为什么语音 AI 需要新的衡量层级 (https://huggingface.co/blog/real-world-voiceeq#why-voice-ai-needs-a-new-measurement-layer)
现有基准测试表明语音 AI 接近人类水平,但真实对话却并非如此。
语音正迅速成为 AI 的主要交互界面。从客户支持、医疗保健到教育、娱乐和个人助手,语音正在逐渐取代文本,成为人们与 AI 互动的方式。
在过去几年中,语音模型取得了巨大进步。词错误率持续下降,延迟已达到对话速度,许多已有基准测试接近饱和。然而,任何经常使用语音 AI 的人都知道,某些地方仍然不对劲。
语音模型可能在一次对话的不同阶段听起来像不同的人,会错过犹豫或不自信的迹象,并且在处理口音、噪音或带有情感的语音时表现不佳。这些缺陷在专注于延迟和词错误率的基准测试中很容易被忽略。人们在乎的是一个语音系统能否真正倾听、恰当回应,并在真实对话中保持自然和可靠。
https://huggingface.co/blog/real-world-voiceeq#a-broader-benchmark-for-voice-ai 语音 AI 的更广泛基准
为了衡量这些品质,我们构建了 Real World VoiceEQ (https://www.hume.ai/rw-voice-eq)——一个旨在评估语音交互人类质量的基准测试。它评估语音系统是否能识别、产生并回应那些转录文本遗漏的声学信息,从语气、情感到说话者身份和背景环境。
Real World VoiceEQ 评估了超过 40 个领先的专有和开源语音模型,涵盖 15 个以上的关键评估维度 以及超过 60 个指标,包括自动语音识别 (ASR)、文本转语音 (TTS)、语音到语音 (S2S) 和语音理解。
Real World VoiceEQ 的四个组成部分——文本转语音、语音到语音、语音理解和 ASR 鲁棒性——各自有其评估维度。 (https://huggingface.co/datasets/huggingface/documentation-images/resolve/main/blog/real-world-voiceeq/benchmark-overview.png)
Real World VoiceEQ 基于超过 100 万个个人人类评分开发,这些评分来自不同人口统计特征、说话风格和声学环境。当前基准测试包含 785,000 个 TTS 评分和 48,000 个 STS 评分,使其成为迄今为止规模最大的语音 AI 人类评估之一。
每项评估均使用 Kairos (https://www.hume.ai/kairos) 进行,这是我们灵活、原生语音的评估平台。相同的基础设施使前沿 AI 实验室和企业能够运行针对特定用例定制的评估,识别生产语音系统中的细粒度故障模式,生成人类偏好数据,并通过强化学习和人类反馈持续改进模型。
https://huggingface.co/blog/real-world-voiceeq#key-findings-from-real-world-voiceeq Real World VoiceEQ 的关键发现
https://huggingface.co/blog/real-world-voiceeq#progress-in-voice-ai-is-becoming-increasingly-specialized 语音 AI 的进展正变得越来越专业化
对单一“最佳”语音模型的追逐正让位于一系列专业化能力。
当今的领先系统针对不同优势进行优化——包括技术准确性、情感理解、对话智能、表现力和鲁棒性。一个擅长复述预订参考号、银行账户细节或复杂药名的模型,可能难以产生富有情感的语音。另一个模型可能听起来非常自然,但在精度导向的任务上可靠性较差。
随着语音 AI 的成熟,衡量进展越来越需要独立评估这些能力,而不是将它们合并为单一的总体分数。在我们的 TTS 评估中,没有系统配置在所有八个能力组中进入前五名——这凸显了为什么不存在单一的“最佳”语音模型。
https://huggingface.co/blog/real-world-voiceeq#voice-models-have-become-better-at-speaking-than-actually-listening 语音模型变得更擅长说话而非真正倾听
语音到语音模型在我们评估的任何类别中展现出的差异最大。一些系统在识别情感方面表现异常出色,但在自然回应方面却困难重重。我们发现,访问音频并不能保证代理会使用其中包含的副语言信息。一些系统仍然主要受转录文本驱动,依赖说出的单词,而忽略了语气、节奏、犹豫、强调和音量等线索。
人类自然会使用这些线索来推断自信、不确定、沮丧、讽刺和同理心。当今的模型常常错过它们。
想象一下,一个银行代理询问你是否认出一笔潜在的欺诈交易。自信的“是的”和犹豫的“……是的……”可能具有完全不同的含义,尽管转录文本完全相同。人类立即就能识别出这种差异。许多当今的语音模型却做不到这一点。
https://huggingface.co/blog/real-world-voiceeq#traditional-benchmarks-increasingly-overestimate-real-world-performance 传统基准测试日益高估真实世界性能
许多已有基准测试正接近其极限,且不能反映真实世界条件。模型在处理带口音的语音、重叠说话者、情感、背景噪音和较长对话时仍然存在困难。在我们的评估中,领先的开源和专有模型之间的性能差异远大于传统基准测试所显示的那样。在一个例子中,噪声背景语音的转录词错误率大约是音乐背景语音的四倍,这表明单一的背景音频分数如何掩盖了真正的故障模式。
https://huggingface.co/blog/real-world-voiceeq#human-evaluation-remains-essential 人类评估仍然至关重要
在初步研究中,我们发现一些模型可能针对已有的公开基准测试进行了优化的迹象。有几个模型复制了参考转录中的已知错误,遵循任意的拼写约定,甚至重构了音频中不存在的遮蔽词。
LLM 现已被广泛用于评估基于文本的模型,但我们的发现表明,语音语言模型 (SLM) 在用于语音评估时应更加谨慎。当我们在文本转语音评估中将领先的 SLM 与训练有素的人类评分者进行比较时,在发音准确性等具有清晰、可验证答案的任务上一致性最高。
在更主观的评估上一致性下降。SLM 有时似乎从基于文本的语境线索推断情感,而对于开放式判断,如声音是否适合某个表演角色或保持了连贯的身份,一致性最弱。自动评估器对于定义明确的任务很有价值,但当判断依赖于声学语境、感知和社会解释时,它们尚不能替代人类听众。
https://huggingface.co/blog/real-world-voiceeq#why-voice-ai-needs-a-new-measurement-layer 为什么语音 AI 需要新的衡量层级
随着语音成为 AI 的定义性界面之一,速度和技术准确性将不再单独决定哪些系统能够成功。人们最终选择的模型将是那些能够像人类一样理解、表达和回应的模型——不仅是在理想的基准测试条件下,而且是在真实世界对话的复杂性中。
几十年来,语音 AI 通过针对标准化基准测试上的定量指标进行优化而取得进步:从用于转录准确性的 WER,到用于语音质量的客观感知指标如 PESQ 和 DNSMOS。我们希望 Real World VoiceEQ 能够通过提供一种基于人类的度量标准来评估合成语音交互的组成部分,从而扩展这一范式。
阅读完整的技术报告 (https://cdn.sanity.io/files/xqnc2for/production/84e7925ad3694bcbd12cbf2d107bd9bf2da4f3d8.pdf) 并探索公共排行榜 (https://huggingface.co/spaces/HumeAI/rw-voice-eq)——或联系我们 (https://www.hume.ai/sales-form) ,了解 Hume 如何使用 Real World VoiceEQ 评估您的语音模型或代理,或设计针对您具体用例的定制评估。
相似文章
SpeechEQ:在社交感知语音对话模型中评估情商指数的基准
SpeechEQ引入了一个用于评估语音语言模型情商的基准和数据集,涵盖2,265个对话中的15个情商子量表。实验表明,当前模型在处理副语言线索时存在困难,表现出依赖文本的捷径以及其他局限性。
EVA-Bench:评估语音代理的新型端到端框架
EVA-Bench 提出了一个全面的端到端评估框架,用于评估语音代理,模拟真实的多轮对话,并通过新颖的准确度(EVA-A)和体验(EVA-X)指标衡量语音特定故障模式下的性能。该基准包含企业领域的 213 个场景以及用于口音和噪声鲁棒性的扰动套件,揭示了当前系统的显著差距。
@zohaibahmed: @resembleai研究团队的新语音AI模型:Dramabox!一个语音AI模型应该给你两样东西:奥斯卡级别的表演和可验证的签名,以证明它是你的。
Dramabox,来自Resemble AI的全新开源语音AI模型,声称既能提供高质量的表演效果,又能提供可验证的签名以证明其真实性。
ServiceNow 推出 EVA:评估语音智能体的新框架
ServiceNow 发布 EVA,这是一个面向对话式语音智能体的端到端评估框架,能够同时评估任务准确率和对话体验。
Voice of India:面向印度真实场景的大规模语音识别基准
研究者发布 Voice of India,一个包含 536 小时、覆盖 15 种印度语言和 139 个区域集群的即兴电话对话闭源基准,揭示地理与人口统计学层面的 ASR 性能差异。