将转录策略作为潜在变量:通过词级时间控制实现可调控的逐字ASR
摘要
本文针对ASR模型中转录风格这一未被控制的潜在变量,提出了一种方法,利用覆盖感知的解码器任务令牌实现可调控的逐字转录,并具备准确的词级时间信息,通过零样本跨语言迁移达到了较高的不流畅检测F1值。
arXiv:2607.18934v1 公告类型:新
摘要:现代ASR模型在异构标注数据上训练时,将转录风格(逐字vs.意图)视为未受控制的潜在变量,导致可测的解码不稳定性、评估混淆(高达60%的报告WER可归因于风格不匹配)以及不可靠的词级时间信息。我们证明模型已经编码了两种风格;挑战在于受控激活。通过使用在平行逐字/意图转录对上训练的覆盖感知解码器任务令牌,我们将德语不流畅检测F1从10%提升到79%,尽管仅在英语上训练。仅使用英语进行完整微调,在逐字准确率、不流畅检测和意图模式质量上均超越所有基线,且跨语言适用。我们还引入了有监督的交叉注意力微调,改进了不流畅语音的词级时间戳,超越了强制对齐基线。最后,我们提出了verbatimize任务,这是一种可扩展的新任务,用于创建和丰富带有高质量规范逐字转录的语音语料库。
查看缓存全文
缓存时间: 2026/07/22 08:24
# 转录策略作为潜在变量:通过词级时间信息激活可控的逐字语音识别 来源: https://arxiv.org/html/2607.18934 Wagner Zusag Thallinger ###### 摘要 现代 ASR 模型在异构标注数据上训练时,会将转录风格(逐字 vs. 意图)视为不受控的潜在变量,导致可测量的解码不稳定性、评估混淆(高达 60% 的报告 WER 源自风格不匹配)、以及不可靠的词级时间信息。我们证明模型已经编码了两种风格,挑战在于如何可控地激活。利用在并行逐字/意图转录对上进行训练的覆盖感知解码器任务标记,我们将德语的不流利 F1 从 10% 零样本提升至 79%(仅使用英语训练)。仅使用英语的完整微调在逐字准确率、不流利检测和两种语言的意图模式质量上均超越了所有基线。我们引入了有监督的交叉注意力微调,在不流利语音上改进了词级时间戳,超越了强制对齐基线。最后,我们提出了一项新任务:逐字化(verbatimize),使得能够通过插入有声学依据的不流利现象,以高质量的标准逐字转录来可扩展地创建/丰富语音语料库。 ###### 关键词:语音识别,人机交互,计算副语言学 ###### 关键词:逐字转录,转录策略,不流利检测,词级时间信息,跨语言迁移 ## 1. 引言 语音转录需要一个策略决策,而大多数训练流程对此并未明确说明:输出应该保留*逐字*所说的内容,包括填充停顿、重复、自我修正、中断和副语言声音(例如,“I i [uh] li- like intended transcripts”),还是应该生成*意图*文本,仅保留说话者流畅的内容(“I like intended transcripts”)?意图转录能改善下游文本处理的可读性[liu2024cos2w],而逐字转录则保留了自发性语音在临床和语言学上有意义的结构[shriberg1994preliminaries]。不流利模式可作为神经系统和言语障碍的诊断标志物[clinical_disfluency2021, process_berns, zusag2023careful],副语言标注能改善表达性语音合成中的自然度[he2025emilia, disfluencyspeech2024, liao2024spontts, nvspeech2025],并且口吃者会经历系统性的 ASR 失败,包括截断和错误率升高[stutterzero2025, lea2023stutter_asr, sep28k_whisper2024]。 尽管这一区别很重要,但大规模 ASR 系统通常是在混合了两种约定且没有控制信号的数据上训练的。Whisper[radford2023robust] 在 680,000 小时的异构标注数据上训练,可能会根据声学环境省略、不一致地转录或幻觉出不流利现象[koenecke2024careless]。标注好的不流利语料库仍然稀缺,尤其是在英语之外的语言中[mujtaba2024inclusive, data_scarcity1, banno2025hesitation],而大规模多语言数据集[he2025emilia, granary] 的标签通常源自同样在异构数据上训练的 ASR 流水线。因此,转录风格成为一个*不受控的潜在变量*:同样的犹豫可能被输出、省略,或以非标准表面形式呈现(um, uuumm, uhmm...),这取决于上下文,使下游分析复杂化。 这种潜在策略模糊性导致了一系列可测量的失败。首先,它产生了*解码不稳定性*:在不流利语音上,波束搜索为同一音频产生截然不同的转录,中位字符级波束发散约为 15%(第 3.2 节 (https://arxiv.org/html/2607.18934#S3.SS2)),因为模型本质上维持着相互竞争的转录策略,而没有选择哪一个的信号。其次,它*混淆了评估*:我们证明标准词错误率 (WER) 将内容错误与风格差异混为一谈,并且对话基准测试中高达 60% 的报告 WER 反映的是风格不匹配而非识别失败(第 3.3 节 (https://arxiv.org/html/2607.18934#S3.SS3))。第三,它使得*时间信息定义不明确*:如果模型不一致地转录单词重复,那么词级时间戳在概念上就是未定义的,而不仅仅是不精确。 我们认为核心挑战是能力*控制*,而非能力*获取*。先前的工作表明,小规模微调[crisperwhisper2024] 和软提示方法[ma2023softprompt, gong2025prompting] 可以在不改变架构的情况下,从预训练 ASR 模型中恢复不流利现象。我们提供直接证据:仅训练模式标签,同时冻结所有编码器和解码器权重,即可将德语不流利事件 F1 从 10% 提升至 79%,这是一个巨大的能力提升,且未对模型学习到的表示进行任何更新。 我们通过三种互补机制激活这一能力。 (1) **通过模式标签实现显式转录策略。** 我们引入离散的解码器前缀标记,将转录策略参数化为逐字输出和意图输出之间的二元选择。在成对监督(同一音频的逐字和意图转录)下进行训练,并根据标注覆盖进行划分,模式标签将*说了什么*与*要输出什么*解耦。仅英语的逐字监督即可零样本控制德语输出,达到 94% 的不流利事件 F1。 (2) **用于词级时间信息的有监督交叉注意力。** 一旦转录策略显式化且输出令牌序列稳定,时间信息就变得定义明确。我们用词边界目标直接监督选定的交叉注意力头,在朗读语音上达到 36 毫秒的平均绝对边界误差,在不流利语音上达到 102 毫秒,这是首次纯粹基于注意力的方法超越强制对齐基线(在不流利输入上退化至 142–200 毫秒)。 (3) **逐字化:转录条件的不流利恢复。** 给定音频和任意意图转录,逐字化通过插入有声学依据的不流利现象来重建规范逐字版本,将稀有词召回率从 6.8% 提升至 96.1%,并实现大规模成本高效的逐字标注。 (4) **语言无关的评估框架。** 我们引入了一种基于对齐的协议,能从逐字转录中自动提取类型化的不流利标签,消歧重复,并将 WER 分解为内容成分和风格成分,从而能够跨语言和转录约定进行一致的评估。 ## 2. 相关工作 表 1 (https://arxiv.org/html/2607.18934#S2.T1) 总结了现有方法在转录风格控制、时间信息生成和多语言支持方面的比较。我们强调了我们的工作所解决的关键差距。 **表 1:与相关工作的能力比较。** VB: 产生带有不流利的逐字转录。 IN: 产生干净的意图转录。 CT: 逐字和意图模式之间的显式切换。 ML: 支持英语以外的语言。 SD: 内联副语言事件标记。 TG: 词级时间戳。 ~ = 部分或不稳定的支持。 | 模型 | VB | IN | CT | ML | SD | TG | | :--- | :--- | :--- | :--- | :--- | :--- | :--- | | Whisper[radford2023robust] | ~ | ✓ | – | ✓ | – | ~ | | WhisperX[whisperx2023] | ~ | ✓ | – | ✓ | – | ✓a | | CrisperWhisper[crisperwhisper2024] | ✓ | – | – | ~ | – | ✓ | | Reverb[reverb2024] | ✓ | ✓ | ✓b | – | – | – | | 软提示[ma2023softprompt, gong2025prompting] | ✓ | – | – | – | – | – | | 不流利系统[mihajlik2024nonlexical, horii2022disfluency, futami2023streaming_joint] | ✓ | – | – | ~ | ~ | – | | 事后检测[amann2024augmenting, zhu2022filler, kouzelis2023weakly] | ~ | – | – | ~ | – | ✓ | | NVSpeech[nvspeech2025] | – | – | – | – | ✓ | – | | 不流利移除[lou2020disfluency, stutterzero2025, liu2024cos2w] | – | ✓ | – | ~ | – | – | | **Ours** | **✓** | **✓** | **✓** | **✓** | **✓** | **✓** | a通过强制对齐 b连续风格参数(仅英语) **转录风格。** 大多数 ASR 系统在单一的隐式策略下生成转录,而针对逐字输出的方法通常单向进行——没有模式间的双向控制。提示和软提示方法[ma2023softprompt, gong2025prompting] 可以引发基础模型中的不流利现象,但没有解决在成对监督下的稳定切换问题。CrisperWhisper[crisperwhisper2024] 在英语逐字数据上微调 Whisper,并对分词器进行了修改,这需要多语言逐字训练数据才能实现有效的跨语言迁移,而此类数据通常不可用。Reverb[reverb2024] 引入了一个连续的逐字性参数,但仅限于英语,并且没有解决时间信息问题。相比之下,我们的模式标签显式参数化了输出策略,并在同一音频的成对意图/逐字目标上进行训练,使风格成为一个显式接口,而不是一个不受控的潜在变量。 **词级时间信息。** 编码器-解码器模型中的交叉注意力头会发展出类似对齐的行为,先前的工作通过动态时间规整从这些无监督模式中提取时间戳[radford2023robust, crisperwhisper2024]。这些涌现对齐的不可靠性促生了外部组件:WhisperX[whisperx2023] 和 Canary[canary2025] 添加了独立的强制对齐器,提高了准确性,但代价是依赖于特定语言的模型。CrisperWhisper[crisperwhisper2024] 通过显式的空格标记(作为词边界检测器)改进了基于注意力的对齐,但这种分词器修改限制了跨语言泛化。一个关键观察推动了我们的方法:时间信息和转录策略是耦合的问题。当模型不一致地转录不流利现象时,这些时间区域的交叉注意力没有稳定目标,使得词级时间戳在概念上定义不明确。我们联合解决这两个问题:模式标签稳定了输出令牌序列,而有监督的交叉注意力将涌现对齐转化为可训练的能力,无需外部组件或修改分词器。 **不流利建模与评估。** 端到端和多任务系统在训练期间整合不流利标签或非词汇声音标签[mihajlik2024nonlexical, horii2022disfluency, futami2023streaming_joint, lian2023udm, mujtaba2024inclusive],并且在诸如 NVSpeech[nvspeech2025] 等语音生成流水线中已经探索了内联语音声音事件标记,通常假设一个固定的标注策略,并且针对的事件库比我们统一集合(类型化重复、中断、填充停顿和副语言事件)要小。事后方法在解码后检测不流利现象:Zhu 等人[zhu2022filler] 利用 ASR/VAD 不匹配来提出带有时间戳的填充候选,Amann 等人[amann2024augmenting] 通过修改后的 CTC 对齐和间隙分类来定位开放集不流利区域,而强制对齐方法则对不流利语音中的转录-音频不匹配进行建模[kouzelis2023weakly, zusag2023careful]。这些方法提供了有用的原语,但依赖于额外的分类组件,并且没有解决基本的逐字与意图歧义问题。在意图方面,不流利移除[lou2020disfluency, stutterzero2025, liu2024cos2w] 是对我们工作的补充。标准 WER 本身就是问题的一部分:同一音频的专业转录显示出显著的风格差异[heuser2024quantification],仅参考选择就能使报告的 WER 改变几个百分点[faria2022oracle, mcnamara2024style]。我们的模式条件方法补充了这些努力:通过标签显式控制输出风格,评估可以使用风格匹配的参考,将真正错误与风格不匹配隔离开来。 ## 3. 转录策略问题 在第 4 节 (https://arxiv.org/html/2607.18934#S4) 介绍我们的方法之前,我们先确认转录策略歧义不仅仅是一个理论问题,而是当前 ASR 系统中一个可测量的不稳定来源、评估错误来源以及时间信息定义不清的来源。 ### 3.1 混合监督下的策略歧义 为了隔离标注不一致的影响,我们将训练数据中逐字与意图标注样本的分数从 0% 变化到 100%,在每种混合上使用和不使用模式标签(图 3 (https://arxiv.org/html/2607.18934#S4.F3))训练 Whisper-medium 一个周期。图 1 (https://arxiv.org/html/2607.18934#S3.F1) 报告了英语(DisfluencySpeech[disfluencyspeech2024])和德语(我们的德语 DisfluencySpeech 评估集;第 5 节 (https://arxiv.org/html/2607.18934#S5))的不流利事件 F1。没有模式标签时,逐字数据分数在 15–85% 之间的“模糊区域”会产生不一致的行为:不流利现象有时被转录,有时被省略,没有面向用户的控制。模型从混合监督中学会了相互竞争的转录策略,输出变得不可预测。使用模式标签后,在所有混合比例下,事件 F1 保持在 80% 左右,包括在逐字数据仅占 10% 时(未加标签的模型仅达到 2%)。尽管训练数据中没有德语数据,德语也表现出相同的模式。 导致转录行为不稳定;使用模式标签时,性能在所有数据混合中保持稳定。德语也呈现相同模式,即使没有德语逐字训练数据。") ### 3.2 解码不稳定性 如果转录策略未解决,歧义应表现为解码不确定性——特别是在含有不流利现象的语音上,因为此时逐字和意图转录分歧最大。我们通过*波束发散*来测量:10 个波束假设(温度 0.7)中最大成对字符错误率 (CER) 的中位数,在样本上取平均。表 2 (https://arxiv.org/html/2607.18934#S3.T2) 证实了这一预测。在来自 AMI 测试集[ami2005] 的不流利语音样本上(包含至少一个语音不流利事件,第 6.2 节 (https://arxiv.org/html/2607.18934#S6.SS2)),Whisper 的波束发散为 15.1% CER,表明模型内化了相互竞争的转录策略。NVIDIA Canary-1B[canary2025](一个 1B 参数的多语言编码器-解码器模型)显示出类似的发散度(14.6%)。我们带有逐字模式标签的模型将发散度降低至 8.1%(降低 46%),即使意图模式条件也将发散度降低至 11.2%,证实显式策略指令在两个方向上都能消除歧义。在清晰语音(LibriSpeech)上,所有基于 Whisper 的模型的发散度接近零;Canary 仍较高,为 5.0%。 **表 2:波束发散度(10 个波束假设中最大成对 CER 的中位数,温度 0.7)。高值表示模型在同一音频的不同解码路径上产生显著不同的转录。** | 模型 | 发散度 (%) ↓ | | :--- | :--- | | | AMI (不流利) | LibriSpeech (清晰) | | Canary-1B[canary2025] | 14.6 | 5.0 | | Whisper[radford2023robust] | 15.1 | 0.0 | | Ours (意图) | 11.2 | 1.0 | | Ours (逐字) | 8.1 | 0.0 | ### 3.3 评估混淆 未定义的转录策略不仅损害模型输出,也损害其评估。当模型预测和参考转录都带有隐式风格选择时,标准 WER 将内容错误与风格差异混为一谈。为了量化这一点,我们将 WER 分解为*内容*分量(由内容损失率 (CLR) 衡量,即意图参考词汇中缺失于预测的比例)和*风格*分量(WER − CLR,捕捉由不流利包含(填充词、重复、口吃、错误起始)引起的差异)。图 2 (https://arxiv.org/html/2607.18934#S3.F2) 展示了 TED-LIUM 和 AMI 这两个来自开放 ASR 排行榜[leaderboard] 的广泛使用的基准测试的分解结果。出现了两个发现。首先,逐字和意图参考转录
相似文章
恰逢其时:基于LLM的同步语音到语音翻译的因果感知框架
本文提出了一种基于LLM的同步语音到语音翻译的因果感知框架,引入了新颖的数据管道和自适应策略,以改善质量-延迟权衡,以较低的延迟实现最先进的成果。
你在说我的语言吗?关于多模态大语言模型中的口语遵循问题
本文解决了多模态大语言模型在ASR中的口语遵循问题,提出了一种软提示方法和新颖的度量标准来量化语言违规。它评估了三种缓解策略——零样本提示、监督微调和思维链推理——在多种语言上的效果,以提高转录保真度。
面向数据高效的代码切换ASR的强化学习
介绍了一种具有可验证奖励的强化学习方案,用于将音频语言模型数据高效地适应到代码切换ASR,在10个语言对上以最少数据实现了显著提升。
基于文本约束声学重评分的无需训练发音转录
本文提出一种无需训练的发音转录流程,通过集成词法资源和声学模型,实现低错误率和高效率,性能优于包括商用多模态LLMs在内的基线方法。
面向大型音频语言模型的连续音频思考
该论文引入了连续音频思考(CoAT)框架,为大型音频语言模型配备了一个连续的潜在工作空间,用于在生成文本响应之前组织声学信息,从而在音频推理、理解和转录任务中提升性能,且不增加额外的解码成本。