是什么来着?自动语音识别的认证鲁棒性

arXiv cs.LG 论文

摘要

本文提出了一种基于认证的自动语音识别机制,采用双门诊断流水线(Two-Sided Atomic Audit 和 Rank-Based Tournament)来提供认证鲁棒性,并在多种架构上实现了词错误率高达55%的相对降低。

arXiv:2606.27698v1 公告类型:新 摘要:自动语音识别系统对对抗性和良性扰动都非常敏感。虽然这一点已经通过参考数据集反复证明,但由于缺乏真实转录的先验知识,在部署系统中检测此类行为极具挑战性。我们证明,采用基于认证的机制可以显著降低词错误率(WER)、提高召回率,并降低置信度与WER之间的斯皮尔曼相关系数。我们通过一个双门诊断流水线实现了这一点:一个Two-Sided Atomic Audit(双面原子审计),它积累统计财富以认证令牌存在和对抗排除;以及一个Rank-Based Tournament(基于排名的锦标赛),用于选择获胜序列。我们在四种不同架构上的评估显示,词错误率相对降低了高达55%,同时提供了细粒度的单词级和句子级认证,以增强声学安全性。
查看原文
查看缓存全文

缓存时间: 2026/06/29 05:25

# 再重复一次?自动语音识别的认证鲁棒性  
来源:https://arxiv.org/html/2606.27698  

Andrew C. Cullen  
墨尔本大学  
[email protected]  

& Neil Marchant  
墨尔本大学  

& Jiani Xie  
墨尔本大学  

Paul Montague  
DST Group,阿德莱德  

& Benjamin I. P. Rubinstein  
墨尔本大学  

###### 摘要  

自动语音识别系统既对对抗性扰动也对其良性扰动异常敏感。尽管这一点已通过参考数据集反复证明,但在部署系统中检测此类行为极具挑战性,因为缺乏真实转录的 oracle 知识。我们证明,采用受认证启发的方法可以显著降低词错误率(WER)、提高召回率,并降低置信度与 WER 之间的 Spearman 相关性。我们通过一个双门诊断流水线实现这一点:一个双侧原子审计(通过累积统计财富来认证 token 的存在和对抗性排除),以及一个基于排名的锦标赛(用于选择获胜序列)。我们在四种不同架构上的评估显示,词错误率相对降低高达 55%,同时提供细粒度的词级和句子级认证以增强声学安全性。

## 1 引言  

尽管神经网络在语音处理领域具有变革性的效用,但它们仍然以对微小输入扰动异常敏感而闻名。这些扰动——被称为*对抗样本*——表明模型的决策边界往往缺乏安全关键部署所需的语义对齐。虽然已经提出了许多方法来减轻这些对抗样本带来的风险,但从概念上讲最有前景的解决方案是一系列提供*认证鲁棒性*的保证(Lecuyer 等人,2019 (https://arxiv.org/html/2606.27698#bib.bib6);Cohen 等人,2019 (https://arxiv.org/html/2606.27698#bib.bib5);Cullen 等人,2022 (https://arxiv.org/html/2606.27698#bib.bib7))。这些鲁棒性机制是严格的框架,用于数学上保证模型的预测对扰动保持不变。对于分类器 \(F\),保证通常是一个半径 \(r\),使得对于所有在 \(\ell_p\) 球 \(B_p(x,r)=\{x': \|x'-x\|_p \leq r\}\) 内的 \(x'\),我们可以保证 \(F(x)=F(x')\)。虽然已经提出了几种方法,但随机平滑(Randomised Smoothing, RS)已被证明特别有效,因为它不会给模型 \(F\) 带来额外的架构或基础设施负担(Cohen 等人,2019 (https://arxiv.org/html/2606.27698#bib.bib5))。  

然而,将认证鲁棒性的保证扩展到非分类、高维序列输出——例如自然语言处理或自动语音识别(ASR)中遇到的输出——会带来组合挑战(Huang 等人,2023 (https://arxiv.org/html/2606.27698#bib.bib62),2024 (https://arxiv.org/html/2606.27698#bib.bib64))。在 ASR 中,如果将句子视为离散类别,那么随着噪声水平的增加,输出空间会爆炸式增长。传统的 RS 工作流程依赖于找到一个代表“多数类”的句子,但在这种条件下会失败,因为任何单一转录的概率质量都会崩溃(Olivier, 2023 (https://arxiv.org/html/2606.27698#bib.bib63))。解决这一限制至关重要,因为审核已部署的声学模型以确保它们在面对不可信输入时产生安全输出是极其困难的。这种失败模式揭示了序列认证的一个基本双层机会:我们不仅需要认证“原子内容”(即信号中存在的特定单词),还需要认证它们的“结构排列”(即这些原子元素的相对顺序和语法连贯性)。  

该领域先前的工作试图通过数值上昂贵的序列对齐来解决这个问题;然而,结果输出通常要么侧重于以结构碎片化为代价提供高置信度的单词包含,要么尝试整体序列认证,但受到问题空间固有的组合规模制约。在这项工作中,我们提出了一种新颖的框架,通过 E 值锦标赛来产生*基于排名的句子认证*(Shafer and Vovk, 2019 (https://arxiv.org/html/2606.27698#bib.bib15);Ramdas 等人,2023 (https://arxiv.org/html/2606.27698#bib.bib16)),以解决这两种形式的认证。我们的方法通过使用一个双门认证流水线来弥合原子保证与结构保证之间的差距,免去了句子对齐的需要,从而在噪声水平较高时也能保持稳定的认证召回率(40.5%–90.3%),而其他基线方法此时会崩溃至 <1%。我们的新方法产生了非平凡的安全半径,并在标准基准上显著改善了 WER,而传统的平滑方法无法提供认证。  

我们的贡献如下:
1. 针对序列到序列任务的严格有效认证:我们展示了如何使用 Ville 不等式和 E 值在采样过程的任何时刻提供有效安全半径。这为降低认证的计算成本提供了一个框架。
2. 双门和双侧对抗认证:我们引入了一个双门流水线,执行双侧审计——同时证明安全 token 的存在和对抗性幻觉的严格排除。该机制允许系统在最终的基于排名的锦标赛之前修剪搜索空间,后者为最终认证补充了一个衡量句子级变化鲁棒性的指标。
3. 动态 ASR 审计:展示了如何在 LibriSpeech 和 Common Voice 上,在极高噪声条件下,利用我们的双阶段认证以词性(Part-of-Speech)框架来审计 ASR 模型的性能。

## 2 相关工作  

#### ASR  

现代自动语音识别(ASR)系统可以根据其架构进行分类。最常用的方法包括基于 CTC 的架构,如 DeepSpeech(Hannun 等人,2014 (https://arxiv.org/html/2606.27698#bib.bib43));自监督 Transformer 模型,如 Wav2Vec 2.0(Baevski 等人,2020a (https://arxiv.org/html/2606.27698#bib.bib44));以及大规模编码器-解码器,如 Whisper(Radford 等人,2023a (https://arxiv.org/html/2606.27698#bib.bib45))。然而,在这些模型中,它们都容易受到对抗性扰动的影响,这些扰动可能会严重降低转录准确性(Carlini and Wagner, 2018 (https://arxiv.org/html/2606.27698#bib.bib46);Qin 等人,2019 (https://arxiv.org/html/2606.27698#bib.bib47);Olivier and Raj, 2022 (https://arxiv.org/html/2606.27698#bib.bib48))。尽管这些扰动存在于针对计算机视觉任务的对抗性操作的悠久、成熟历史中(Goodfellow 等人,2014 (https://arxiv.org/html/2606.27698#bib.bib2);Madry 等人,2018 (https://arxiv.org/html/2606.27698#bib.bib3);Cullen 等人,2024 (https://arxiv.org/html/2606.27698#bib.bib58))——即操纵模型以改变预测——但音频领域提出了独特的挑战。语音是一种随时间变化的物理信号,其中小的波形变化不一定对应感知声音的小变化,并且常用的 \(\ell_p\) 范数距离可能与人类对可听性的判断相关性很差(Qin 等人,2019 (https://arxiv.org/html/2606.27698#bib.bib47);Schönherr 等人,2019 (https://arxiv.org/html/2606.27698#bib.bib49))。即便如此,评估声学系统最常见的指标是信噪比(SNR)和词错误率(WER)。SNR 作为输入扰动的基本度量,通过对数比表示信号幅度与噪声幅度:  
\[
\text{SNR}_{\text{dB}} = 20 \log_{10} \left( \frac{\|x\|_p}{\|\epsilon\|_p} \right) \tag{1}
\]  
其中 \(x\) 是干净音频信号,\(\epsilon\) 是加性扰动,\(p\) 是范数,通常 \(p \in \{2, \infty\}\)。在对抗性场景中,攻击者旨在最小化扰动幅度(最大化 SNR),同时诱导模型输出出现灾难性失败。相反,WER 是转录质量的标准度量,计算为归一化的 Levenshtein 距离:  
\[
\text{WER} = \frac{S + D + I}{N} \tag{2}
\]  
其中 \(S, D,\) 和 \(I\) 分别表示将假设与长度为 \(N\) 的真实值对齐所需的替换、删除和插入次数。尽管它在声学(和文本)环境中无处不在,但必须强调的是,WER 常常会被这些系统中常见的失败模式所扭曲。  

考虑到这些指标固有的问题,替代方法通过心理声学视角考虑声学性能(Szurley and Kolter, 2019 (https://arxiv.org/html/2606.27698#bib.bib53);Sun 等人,2024 (https://arxiv.org/html/2606.27698#bib.bib50)),尽管有人指出,定义一致的不可感知性概念从根本上来说是困难的(Hussain 等人,2021 (https://arxiv.org/html/2606.27698#bib.bib54))。

#### 认证鲁棒性  

虽然最初建立在差分隐私的基础上,但当前 RS 的技术水平应用了 Neyman-Pearson 引理。所有基于 RS 的认证的核心都是将模型 \(f\) 转换为一个经过平滑处理的对应物 \(g\),该对应物服从可证明的 \(\ell_p\) 边界保证。如 Cohen 等人(2019 (https://arxiv.org/html/2606.27698#bib.bib5))所确立的,对于噪声水平 \(\sigma\),半径 \(r\) 是“最可能类别”概率 \(p_A\) 的函数¹。为了实现这一点,这类认证采用独立的两个阶段方法,其中阶段 I 使用初始批次来确定目标类别,而阶段 II 在噪声下重复采样,通过  
\[
p_A = \mathbb{P}_{\epsilon \sim \mathcal{N}(0, \sigma^2 I)}[f(x+\epsilon) = c_A]
\]  
表示在加性高斯噪声下,平滑分类器预测目标类别 \(c_A\) 的概率。这最终产生了认证公式  
\[
r = \sigma \Phi^{-1}(p_A)
\]  
虽然 \(p_A\) 表示噪声分布上的理论期望,但实际上无法计算这个量。尽管可以通过蒙特卡洛采样来实际估计它,但构建保守认证——以控制认证被违反的风险——需要获得一个高概率下界 \(\underline{p_A}\),使得 \(P(p_A < \underline{p_A}) \leq \alpha\)。为此,Cohen 等人(2019 (https://arxiv.org/html/2606.27698#bib.bib5))使用了标准的 Clopper-Pearson 区间来构造 \(\underline{p_A}\),然后将其代入式 (3) 以产生半径 \(r\)。

¹Cohen 等人(2019 (https://arxiv.org/html/2606.27698#bib.bib5))的原始公式是根据两个最可能类别概率 \(p_A\) 和 \(p_B\) 推导的,但几乎所有实现都简化为本文描述的变体。

#### 非类别分类的认证:架构方法与问题  

将 RS 推向序列空间,初始方法转向了基于归纳的分类(Kumar and Goldstein, 2021 (https://arxiv.org/html/2606.27698#bib.bib60))和预定义的句法结构(Schuster et al., 2021 (https://arxiv.org/html/2606.27698#bib.bib61))。然而,这些方法受到其先决条件的严重限制:前者要求类别空间小且密集,而后者需要一个可枚举的“黄金”类别集。这两种条件在 ASR 的开放世界中都无法满足。  

方法上的后续尝试直接操作转录本,通过使用 Neyman-Pearson 引理和大边界构造来证明假设的 Levenshtein 距离的下界(Huang et al., 2023 (https://arxiv.org/html/2606.27698#bib.bib62))。然而,这依赖于句子间的对齐程序,这些程序的计算代价可能很高,并且当噪声水平增加时,认证召回率会灾难性地下降。  

相比之下,我们的方法通过采用完全不同的范式来避免这些失败模式:我们不依赖句子级的一致性,而是通过对系统级输出空间进行分区,在 token 间使用不依赖对齐的 E 值游戏,来认证单词的存在和顺序。这种原子化的方法允许我们保持高认证召回率,在噪声水平高达 30 dB 时达到 90% 以上,同时提供结构信息。

## 3 方法  

我们的框架通过三个模块的系统集成来运作,设计用于在并行硬件上运行,同时保持严格的统计学保证。在本文中,我们使用基于 RS 的架构,通常用于自动语音识别(ASR),该架构在输入 \(x\) 处对加性高斯噪声进行建模范例,以产生平滑的转录 \(g(x) = f(x + \epsilon)\),其中 \(\epsilon \sim \mathcal{N}(0, \sigma^2 I)\)。这里 \(f\) 是基础 ASR 模型,以音频输入并输出文本转录。我们的过程是:  
1. **原子认证:** 我们识别并认证一个“候选词汇表” \(\mathcal{V}\),通过测试对于每个 \(w \in \mathcal{V}\) 是否存在具有统计意义的存在或排除证据。  
2. **结构认证:** 然后,我们在经过认证的候选词汇表上执行一个基于排名的锦标赛,以产生一个句子级半径 \(R_{\text{tourn}}\)。  

为了形式化原子认证,令 \(\mathcal{V}\) 是词量的集合。对于任何词量 \(w \in \mathcal{V}\),我们对累积的 E 值财富应用 Ville 不等式,以产生一个严格的统计保证。这允许我们定义一个集合 \(\mathcal{V}_{\text{cert}}\),其中对于所有 \(w \in \mathcal{V}_{\text{cert}}\),我们对词量的真实包含概率 \(p(w)\) 存在一个一致性估计。我们的非正式原子保证是:  
1. **词量存在认证:** 如果词量 \(w \in \mathcal{V}\) 并且在统计上显著,我们认证 \(p(w) > 0.5\)。相反,如果 \(w \notin \mathcal{V}\) 且不模糊,我们认证 \(p(w) < 0.5\)。  
2. **句子级结构认证:** 在一组候选转录本 \(\mathcal{C} \subset \mathcal{V}^*\) 之间执行顺序锦标赛,这些转录本已经过原子门的过滤,以确保结构和统计有效性。最终系统半径 \(R = \min(R_{\text{atomic}}, R_{\text{tourn}})\) 是违反这些层次保证中任何一个所需的最小半径。

### 3.1 原子认证  

原子门通过两个阶段识别和验证组成 token:发现阶段,即识别候选词汇表 \(\mathcal{V}\);以及审计阶段,即执行认证。

#### 发现阶段  

我们抽取 \(N_1\) 个独立同分布的样本 \(Y_i = f(x + \epsilon_i)\),其中 \(\epsilon_i \sim \mathcal{N}(0, \sigma^2 I)\),通过  
\[
\mathcal{V} = \bigcup_{i=1}^{N_1} \{w: w \in Y_i\}
\]  
识别候选词汇表 \(\mathcal{V} \subset \mathcal{X}\)。这一阶段的目的是将搜索空间修剪为在局部噪声分布中具有非平凡支持度的 token。这些样本随后被丢弃以确保统计独立性。然而,必须注意,任何未出现在前 \(N_1\) 个样本中的词量将无法被验证——即使它本可以表现为高频包含——因此将在所有后续阶段中被过滤掉。

#### 审计阶段  

在发现候选词汇表 \(\mathcal{V}\) 之后,我们使用一个新的 \(N_C\) 样本流来验证每个 token 的存在性。对于任何 token \(w \in \mathcal{V}\),令 \(p_w = \mathbb{P}(w \in f(x + \epsilon))\) 表示其出现的边际概率。我们通过非负鞅 \(E_{\text{pos}}(w)\) 和 \(E_{\text{neg}}(w)\) 积累双侧财富,以检验原假设 \(H_{\text{pos}}: p_w \leq 0.5\) 和 \(H_{\text{neg}}: p_w \geq 0.5\),分别对应存在性和排除性。这些假设将允许我们全面认证 token 是否出现在观测集中。为了实现这一点,对于每个噪声样本 \(t\),令 \(W_{w,t} \in \{0,1\}\) 是指示 token \(w\) 是否出现在转录本中的指标。为了确保数值稳定性并支持高吞吐量 GPU 向量化,我们在对数空间中进行财富复合。对于投注参数 \(\lambda \in (0,2]\),在时间 \(T\) 积累的财富定义为  
\[
\ln E_{\text{pos},T}(w) = \sum_{t=1}^{T} \ln\big(1 + \lambda(W_{w,t} - 0.5)\big), \qquad \ln E_{\text{neg},T}(w) = \sum_{t=1}^{T} \ln\big(1 + \lambda(0.5 - W_{w,t})\big) \tag{8}
\]  
其中 \(E_{i,0} = 1\) 对于 \(i \in \{\text{pos}, \text{neg}\}\)。在原假设 \(p_w = 0.5\) 下,乘数 \(E_t = 1 + \lambda(W_{w,t} - 0.5)\) 的期望恰好为 1,使得 \(E_T\) 成为一个鞅。正如第 2 节所讨论的,根据 Ville 不等式(Ville, 1939 (https://arxiv.org/html/2606.27698#bib.bib11);Doob, 1940 (https://arxiv.org/html/2606.27698#bib.bib10)),财富超过安全阈值的概率有界:\(P(\exists T: E_T \geq 1/\alpha) \leq \alpha\)。因此,我们将“认证词汇表” \(\mathcal{V}_{\text{cert}}\) 和“排除词汇表” \(\mathcal{V}_{\text{excl}}\) 定义为财富超过显著性阈值 \(1/\alpha_{\text{atomic}}\) 的 token 集合。

#### 置信序列与认证  

为了将这些统计财富度量转化为认证半径,我们需要识别与观测证据一致的成功概率 \(p\) 的集合。在置信序列(Ramdas 等人,2023 (https://arxiv.org/html/2606.27698#bib.bib16))的框架下,我们通过反转 E 值过程获得严格有效的时间一致性边界。对于 \(\mathcal{V}_{\text{cert}}\) 或 \(\mathcal{V}_{\text{excl}}\) 中的 token,严格有效边界是与财富一致的极值概率:  
\[
\underline{p}_{w,T} = \inf\{p \geq 0.5: L_T(p) < \alpha_{\text{atomic}}^{-1}\}, \quad \overline{p}_{w,T} = \sup\{p \leq 0.5: L_T(p) < \alpha_{\text{atomic}}^{-1}\} \tag{9}
\]  
其中 \(L_T(p) = \prod_{t=1}^{T} \frac{\text{Bernoulli}(W_{w,t}; p)}{\text{Bernoulli}(W_{w,t}; 0.5)}\) 是似然比

相似文章

证书失效时:嵌入式神经接口模型的统一安全框架

arXiv cs.LG

本文表明,嵌入式神经接口模型的正式鲁棒性证书可能在任务准确率因对抗攻击而崩溃时仍能通过,并提出一个统一的实证审计框架,以解决训练目标与操作用户福利之间的对齐失败问题。

快速停止!早停法实现认证鲁棒性

arXiv cs.LG

本文介绍了一个面向任意时有效认证鲁棒性的元学习框架,该框架使用序列E过程自适应分配计算资源,与传统的随机平滑方法相比,样本复杂度降低了20倍,同时保持了严格的统计保证。

多样化语音的人类与自动语音识别基准测试:初步结果

arXiv cs.CL

本文比较了最先进的ASR系统与人类听者在识别多样化荷兰语语音方面的表现,发现ASR系统在某些情况下与人类表现相当甚至更优,其中Google Telephony表现最佳。文章强调了说话者年龄、地方口音及测试集选择对基准测试结论的影响。