VoiceCodeBench: 评估自动语音识别中的精确结构化令牌恢复

arXiv cs.CL 论文

摘要

VoiceCodeBench 是一个用于评估自动语音识别中精确结构化令牌恢复的新基准,表明传统 WER 指标不足以满足生产语音工作流程的需求。

arXiv:2608.28916v1 Announce Type: new 摘要:自动语音识别 (ASR) 系统通常使用词错误率 (WER) 进行评估,但许多语音工作流程依赖于标识符、路径和测量量的精确书面值。一个转录可能看起来流畅并实现低 WER,同时损坏了下游系统必须解析、存储或执行的值。 我们引入 VoiceCodeBench,一个用于评估英语 ASR 中精确结构化令牌恢复的基准。它包含 300 个由人录制的工作场所片段,涵盖八个工作流程领域和 1,482 个审计目标实体,分布在 26 种实体类型中,每种类型都有一个可以从音频恢复的规范书面形式。在仅原始音频协议下,系统接收音频字节而不提供额外上下文或元数据。除了 WER,我们还评估规范令牌/实体匹配 (CTEM)、任务成功率 (TSR) 和每种类型的精确恢复。 在 12 个基线 ASR 系统中,较低的 WER 通常对应于更好的结构化令牌恢复,但并未完全决定它:WER 与 CTEM 和 WER 与 TSR 的 Spearman 相关系数均为 -0.73。按 TSR 计算的最强基线仅达到 68.7%,导致近三分之一的录音至少有一个未恢复的工作流程关键值。这些结果表明,需要实体敏感的指标来评估 ASR 输出是否保留了生产系统必须解析、路由、存储、比较或执行的精确值。
查看原文
查看缓存全文

缓存时间: 2026/09/01 12:09

# VoiceCodeBench:评估自动语音识别中的精确结构化标记恢复能力
来源:https://arxiv.org/html/2608.28916
Brandon Tai、Lisa Kaelin-Martin、Candice Fan  
作者单位:Luc Debaupte、Bill Wang 和 Yi Zhong  
作者单位:Besimple AI,加利福尼亚州圣马特奥市  
邮箱:[\{tyler,yi\}@besimple\.ai](mailto:)

###### 摘要

自动语音识别(ASR)系统通常使用词错误率(WER)进行评估,但许多语音工作流依赖于关键实体的精确书面值。一份转录文本可能看起来流畅并取得低WER,却可能损坏下游系统必须解析或存储的标识符、路径或测量值。在构建语音智能体时,这些错误不仅仅是转录缺陷——当转录文本看似合理时,它们可能成为错误的工具参数、无效的数据库字段、路由错误的请求或不安全的指令。

我们推出VoiceCodeBench——一个用于评估英语ASR精确结构化标记恢复能力的基准测试。VoiceCodeBench包含八个工作流领域中300个人工录制的工作片段,以及26种实体类型中1,482个经审计的目标实体,每个实体都具有从语音证据中可恢复的规范书面形式。

VoiceCodeBench采用仅原始音频的评估协议。系统仅接收音频字节流,不提供任何额外上下文或元数据。除了WER,我们还引入了实体敏感指标,包括规范标记/实体匹配(CTEM)、任务成功率(TSR)和按类型精确恢复率,以对比广泛转录准确性与工作流关键值的精确恢复能力。

在12个基线ASR系统中,较低的WER通常对应更好的结构化标记恢复效果,但WER并不能完全决定恢复效果:WER与CTEM的斯皮尔曼相关系数为-0.73,WER与TSR的相关系数同样为-0.73。即使按TSR计算表现最强的基线ASR系统也仅达到68.7%的TSR,这意味着近三分之一的录音仍包含至少一个未恢复的工作流关键值。这些结果表明,WER是评估转录质量的有用指标,但需要实体敏感指标来衡量ASR输出是否保留了标识符、指令、路径、测量值等生产系统必须解析、路由、存储、比较或执行的精确值。

## 引言

语音界面越来越多地介入需要精确书面值的工作流,例如联系方式、文件路径、账户号和测量值。在此类场景中,转录文本不仅是语音的可读近似——它是可能被存储、路由、比较或执行的软件输入。一个句子可能看起来流畅,却对使用它的应用程序毫无用处。

这造成了常见自动语音识别(ASR)评估与生产需求之间的差距。词错误率(WER)仍然是评估广泛转录质量的标准摘要指标(美国国家标准与技术研究院,2021),但它在很大程度上将词级编辑视为可互换的。缺失的冠词与损坏的结构化值可能被同等对待,尽管后者可能导致支持请求路由错误、记录填充错误标识符、应用错误的数量或单位,或执行错误的工具调用。对于结构化标记,标点、大小写、分隔符、标记边界、数字和语音到书面的规范化可能是值本身的一部分。因此,低WER的转录文本可能对人类可读,但对消费它的软件系统却可能不安全。

现有的ASR基准测试在多个困难源上实现了可衡量的广泛进展。LibriSpeech标准化了有声读物朗读语音,Common Voice通过众包扩大了说话者/语言覆盖范围,GigaSpeech在网络上扩展了英语ASR,FLEURS强调了多语言迁移,而AMI捕捉了多人会议语音(Panayotov等人,2015;Ardila等人,2020;Chen等人,2021;Conneau等人,2022;Carletta,2007)。这些资源支持测量声学鲁棒性、领域和语言泛化以及对话转录。另一系列工作将ASR质量与意义和应用效用联系起来,包括口语理解准确性、语义距离、下游可用性、ASR转录文本上的命名实体识别以及上下文ASR(Wang等人,2003;Kim等人,2021;Roy,2021;Szymanski等人,2023;Wang等人,2025)。然而,这些评估通常以转录保真度、语义相似性、命名实体识别或上下文利用为主要目标。它们并未直接回答一个更具体的生产问题:仅给定原始音频,ASR输出是否保留了足够的证据,以便每个工作流关键书面值都能被精确恢复?

VoiceCodeBench通过将精确书面值的可恢复性作为分析单位来扩展这一基础。该基准测试聚焦于普通工作领域,其中结构化值通常是语音交互的目的而非偶然的边界情况。它采用实体优先的方法构建,在编写转录文本之前分配目标实体,从而实现按类型、领域和难度进行受控覆盖。每个实体都有一个可从声学证据中恢复的规范书面形式,因此评估可以询问转录文本是否保留了应用程序需要存储、路由、比较或执行的特定值。

VoiceCodeBench包含300个人工录制的英语工作片段,涵盖8个工作流领域中的26种实体类型共1,482个目标实体。在其仅原始音频的协议下,12个ASR系统接收音频字节流,没有目标实体、领域标签、候选值、提示、自定义词汇或其他元数据。报告中除WER外,还包括规范标记/实体匹配(CTEM)、任务成功率(TSR)和按类型精确恢复率。这些指标使不同的部署问题显而易见:WER衡量广泛转录质量,CTEM衡量值级恢复负载,TSR衡量整个片段能否无需修复即通过自动化工作流,而按类型恢复率则识别需要确认提示、约束解码或ASR后验证等保护措施的类别。因此,该基准测试不仅测试ASR输出是否可读,还测试其是否保留了工作流正确性所依赖的精确值。

## 方法

### 基准测试设计

VoiceCodeBench被设计为仅测试用的基准,用于评估自动语音识别(ASR)中的精确结构化标记恢复。每个基准项目包含人工录制的英语音频片段、参考转录文本、包括说话者和音频质量字段在内的项目元数据,以及一组目标实体——这些实体的规范书面形式可从其语音形式中恢复。该基准测试聚焦于紧凑的工作场景式话语,包含下游应用程序可能解析、路由、存储、比较或执行的值。

在评估期间,ASR系统在推理时仅接收音频文件。这种范围反映了一种常见模式:开发者将音频提交给ASR提供商,并直接使用返回的转录文本或配合轻量级下游处理。

数据集包含八个工作流领域中300个人工录制的英语片段,总结见表1(https://arxiv.org/html/2608.28916#Sx2.T1)。领域分布并非旨在估计这些工作流在生产语音中出现的频率,而是为每种结构化标记失败模式提供足够的示例以进行按类型分析。

表1:工作流领域分布。该基准测试包含26种实体类型共1,482个目标实体,每个录音平均包含4.94个目标实体。黄金声学转录文本长度根据难度区间从95到206个单词不等。每个录音被分配一个结合实体负载、实体复杂度、转录文本长度和预期恢复挑战的难度区间。表2(https://arxiv.org/html/2608.28916#Sx2.T2)总结了区间设计。

表2:难度区间设计。所有场景和结构化值均为合成数据。伦理与隐私考虑部分(https://arxiv.org/html/2608.28916#Sx4.SSx6)描述了构造这些值时使用的隐私约束。

VoiceCodeBench按恢复行为而非仅按工作流领域组织目标实体。该分类法包含26种实体类型,分为六个大类(表3(https://arxiv.org/html/2608.28916#Sx2.T3))。

表3:用于结构化标记评分的实体分类法。该分类法捕捉了对精确度敏感且对真实世界ASR支持的生产工作流至关重要的值。某些实体(如电话号码或日期)可能在常规格式规范化下可恢复;而其他实体(如文件路径或命令行标志)则将标点和分隔符视为值本身的一部分。

VoiceCodeBench不旨在作为通用ASR语料库或训练集,而是作为诊断评估资源发布。

### 实体和转录文本生成

VoiceCodeBench采用实体优先的方式构建。对于每个项目,我们首先指定工作流领域、难度区间、目标实体数量和目标实体类型。然后为所需槽位生成唯一的合成实体,为每个值分配声学形式和规范形式。最后,围绕该计划实体组合编写工作场景式转录文本。这种排序防止了数据集仅仅提取自由格式脚本中恰好出现的结构化值,并允许跨实体类型、工作流领域和难度区间进行覆盖控制。

生成过程由大语言模型辅助但受约束驱动。我们使用仓库感知的大语言模型工作流在固定元数据、实体和验证约束下草拟和检查项目。实现细节见生成工具附录(https://arxiv.org/html/2608.28916#A2)。此工作流有助于维护基准测试元数据结构、填充模板、声学和规范转录文本层,并强制执行请求的领域、难度和实体类型约束。候选项目仅在通过领域适配性、自然性、唯一性、实体一致性和可恢复性验证和审查后才被接受。

声学形式表示说话者预期说出的内容。它可能包含口语符号、拼写提示、大小写指令或格式指令。规范形式表示下游应用程序必须恢复的确切书面值。这种区分明确区分了说出的内容与软件需要处理的内容之间的差距。

“double dash dry dash run” → \-\-dry\-run  
“all caps database underscore URL” → DATABASE\_URL  
\begin\{array\}\[\]\{@\{\}rcl@\{\}\}  
\\text\{\\footnotesize\`\`double dash dry dash run''\}&\\rightarrow&\\text\{\\footnotesize\{\-\\kern 0\.0pt\-dry\-run\}\}\\\\  
\\text\{\\footnotesize\`\`all caps database underscore URL''\}&\\rightarrow&\\text\{\\footnotesize\{DATABASE\\\_URL\}\}  
\\end\{array\}

仅凭声学形式必须为细心的听者提供足够的信息以推断出预期的规范值。如果其规范值无法从预期声学形式中唯一恢复,则实体将被拒绝或修订。例如,需要DATABASE\_URL的目标必须包含足够关于下划线和大小写惯例的口语证据。

场景和结构化值是合成的,而发布的音频是人工录制的。合成内容避免暴露真实的联系方式、账户、凭证或操作系统。电子邮件地址和URL使用保留的文档域和受控域。电话号码使用虚构的NANP 555-0100至555-0199号码及不同区号。公共外观的IPv4地址使用文档范围,而内部网络示例使用私有地址范围。邮政地址、账户号、产品代码、参考ID和工作流场景均为合成数据。

当公共组织、产品或平台名称作为普通工作词汇时,数据集可能包含它们,但这些名称不会与真实的私人联系记录或实际可路由信息配对。这使得基准测试能够测试对常见工作术语的识别,同时保持敏感字段的合成性或保留性。

### 录制与验证

每个转录文本由人工说话者录制,朗读一个紧凑的工作场景式片段。说话者朗读声学转录文本层,该层以预期口语形式呈现目标实体,而非其规范评分值。说话者被指示自然但清晰地朗读,保留听写标点短语、拼写序列、大小写提示和格式指令。预期风格是审慎的工作听写,而非戏剧表演或随意对话。

录音通过众包平台远程收集,参与者为同意数据集使用和发布的付费贡献者。录制后,每个音频文件都经过人工审计。存在严重音频质量问题或包含口语错误的文件将被拒绝并重新录制。接受的音频文件无需额外后处理即发布。

### 转录协议

所有ASR系统仅接收每个录音的原始音频文件。批处理系统转录每个完整文件;流式传输系统在固定分块策略下接收按时间顺序排列的音频块。仅最终转录文本被评分。除选择预期模型或英语语言模式所需的设置外,使用提供商默认设置。允许提供商标点、大小写和格式化,但特定基准提示、自定义词汇、实体提示、语法约束和ASR后纠正不包含在主要原始音频评估中。对于每个基线ASR系统,我们记录提供商、模型、端点或API、批处理或流式传输模式、评估日期和重现相关的推理设置。

### 实体提取

实体提取询问每个黄金规范值是否可从ASR转录文本中恢复。当格式变体保留相同值时(例如电话号码渲染为不间断数字序列或货币金额渲染为明确的口语金额),格式变体被接受。分隔符、大小写提示、单位、数字、标记边界和标点在确定规范字符串时被视为承载值,如电子邮件地址、文件路径、URL、环境变量、代码符号和命令行标志。

实体提取策略由大语言模型支持的恢复验证器执行。验证器接收ASR转录文本和目标实体(包括类型、声学形式和规范形式),并返回严格的JSON,每个目标索引一个结果,包括类型、规范值、存在/不存在决策、证据范围和原因。它被指示仅在转录文本包含足够证据恢复确切规范值时才标记实体存在,并拒绝改变值的错误、缺失、额外或替换的字母、数字、分隔符、单位、日期、时间、金额或单词。跟踪的验证器是版本化产物openai\_gpt\_5\_5\_v1,使用GPT-5.5。完整的验证器系统提示词见验证器提示附录(https://arxiv.org/html/2608.28916#A3)。验证器输出包括证据和原因,在基线分析中识别的边缘情况经过人工审查。作为可靠性检查,人工审计员审查了跨ASR模型和实体类型的200个实体决策的分层样本。与验证器决策的一致率为100%。审查的行作为audit/verifier\_audit\_samples发布。

相似文章

EVA-Bench:评估语音代理的新型端到端框架

Hugging Face Daily Papers

EVA-Bench 提出了一个全面的端到端评估框架,用于评估语音代理,模拟真实的多轮对话,并通过新颖的准确度(EVA-A)和体验(EVA-X)指标衡量语音特定故障模式下的性能。该基准包含企业领域的 213 个场景以及用于口音和噪声鲁棒性的扰动套件,揭示了当前系统的显著差距。

是什么来着?自动语音识别的认证鲁棒性

arXiv cs.LG

本文提出了一种基于认证的自动语音识别机制,采用双门诊断流水线(Two-Sided Atomic Audit 和 Rank-Based Tournament)来提供认证鲁棒性,并在多种架构上实现了词错误率高达55%的相对降低。

测量语音识别中的基准优化

Hugging Face Blog

本文探讨了关于测量语音识别中基准优化的研究,指出某些语音识别模型可能针对测试基准进行优化而非真实场景性能,并介绍了用于量化该现象的测试方法。

商业ASR系统在代码切换语音上的基准测试:阿拉伯语、波斯语和德语

arXiv cs.CL

本文提出了一个基准测试,评估了五个商业ASR系统在阿拉伯语-英语、波斯语-英语和德语-英语代码切换语音上的性能,使用两阶段管道为每个语言对选择300个样本,并通过WER和BERTScore评估性能。ElevenLabs Scribe v2在整体上取得了最低的WER(13.2%)和最高的BERTScore(0.936),并提供公开数据集。