聆听未言之语:针对声学对抗攻击的语言模型先验

arXiv cs.LG 论文

摘要

本文介绍了Semantic Gambit攻击,它利用LLM预测为自动语音识别系统生成实时对抗扰动,相较先前方法实现了三倍的词错误率提升。

arXiv:2606.06833v1 公告类型:新 摘要:自动语音识别(ASR)系统在实时环境中运行必须在严格的时间限制下处理声学输入,转录决策本质上基于不完整信息做出。这种因果约束作为攻击者的信息瓶颈,显著限制了攻击性能。我们提出的新型Semantic Gambit攻击通过实时利用大型语言模型提供的预测上下文来增强攻击者,打破了这一因果限制。我们的实验表明,这种增强形式可以将语料级别的词错误率提升至35.6%——相比当前最先进的方法增加了三倍。最终,这项工作揭示了如何利用常见的低延迟LLM工具来系统性破坏实时ASR流水线。
查看原文
查看缓存全文

缓存时间: 2026/06/08 09:18

# 聆听弦外之音:面向声学对抗攻击的语言模型先验知识

**来源:** https://arxiv.org/html/2606.06833

**谢佳妮** 墨尔本大学 jiani\.xie1@unimelb\.edu\.au  
**Andrew C. Cullen** 墨尔本大学  
**Paul Montague** 国防科技集团  
**Benjamin I. P. Rubinstein** 墨尔本大学  

###### 摘要

运行在实时环境下的自动语音识别(ASR)系统必须在严格的时间约束下处理声学输入,这意味着转录决策必然基于不完整的信息。这种因果约束对攻击者构成了信息瓶颈,大幅限制了攻击性能。我们的新攻击方法 **Semantic Gambit** 通过实时利用大型语言模型(LLM)衍生的预测性上下文来增强攻击者,从而突破了这一因果限制。实验表明,这种增强方式可将语料库层面的词错误率(WER)提升至 35.6%——相比当前最先进水平提高了三倍。最终,本研究揭示了如何利用常见低延迟 LLM 工具来系统性地颠覆实时 ASR 管道。

## 1 引言

现代自动语音识别(ASR)系统易受对抗性扰动的影响,这些扰动叠加在语音上会降低转录质量[6(https://arxiv.org/html/2606.06833#bib.bib26);23(https://arxiv.org/html/2606.06833#bib.bib173);9(https://arxiv.org/html/2606.06833#bib.bib135)]。至关重要的是,攻击性能与攻击者掌握的信息量成正比——攻击者对目标话语了解得越多,就越能精确地定制扰动以破坏它。在离线设置中,这不成问题,因为攻击者可以基于完整话语进行条件分析;然而,实时设置要求攻击与语音同步进行,这极大地限制了可用信息。在这种实时场景下,攻击者面临严格的信息约束:攻击者只能获取攻击部署*之前*的信息[10(https://arxiv.org/html/2606.06833#bib.bib55)]。一旦注入扰动,就会扭曲声学环境,从而阻断进一步的清晰观测,限制可访问的信息量。

我们通过 **Semantic Gambit (SG)** 绕过了这一信息边界,该方法利用辅助信息通道来提升攻击性能。该边界仅适用于声学模态:虽然无法听到未来的语音,但已说出部分的部分转录通常足以让大型语言模型(LLM)预测接下来会说什么。随后,多模态生成器将这一预测的延续与声学前缀融合,实时生成针对特定输入的扰动(图1(https://arxiv.org/html/2606.06833#S1.F1))。据我们所知,这是第一个使用基于 LLM 的预测来引导不同模态下扰动生成的攻击框架。

我们在多种实际运行条件下评估了 Semantic Gambit 对 Wav2Vec 2.0[5(https://arxiv.org/html/2606.06833#bib.bib67)] 的性能。在最强配置下,该系统在 20 dB SNR 的实际约束下将受害模型的词错误率从 2% 提升至超过 35%,大约是当前最佳基线所达到效果的三倍。消融实验证实,语义条件化贡献了高达 20 个百分点的提升(相对于仅使用声学上下文),完整管道生成 3 秒扰动平均仅需 0.6 秒,运行速度约为实时速度的 5 倍,且无需专门优化——足以在有余量的情况下攻击实时语音。这样的结果证明,我们对 ASR 模型所面临风险的理解可能被严重低估了。更广泛地说,这表明防御性 AI 研究必须考虑信息增强的可能性,否则我们可能低估部署在对抗性暴露条件下的模型所面临的风险。

图 1:攻击路径概览。在流式攻击中,生成器利用前缀音频段在攻击窗口内构建攻击。我们的 SG 攻击通过补充音频信息(前缀音频、前缀的 ASR 转录以及 LLM 预测,用红色箭头表示)来增强信息可用性,从而相对于目前此类攻击的最新技术水平(蓝色箭头)产生信息优势。橙色框表示合成攻击的计算延迟。

## 2 背景综述:声学分类法

对 ASR 系统的对抗性攻击可以根据攻击者可用的信息进行分类。在回顾这一领域时,我们注意到,攻击之间的一个关键但未被承认的分类差异与攻击者的知识有关。因此,我们首先通过一个统一框架来形式化现有攻击的分类,在该框架中,每次攻击都由一个*信息过滤算子*来表征,该算子决定了生成器可以观察到目标话语的哪一部分。正如我们将在实验中展示的,存在一个通用的层次结构,其中增加可用信息量以及信息的相关性会产生更强的攻击。

#### 一般形式化

设 \(X\subseteq\mathbb{R}^T\) 表示有效声学波形的空间,\(Y\) 表示标记序列的空间。ASR 模型定义为映射 \(M:X\to Y\),它将转录 \(y=M(x)\) 分配给输入 \(x\in X\)。对抗性攻击旨在寻找扰动 \(\delta\in X\) 以最大化原始转录与扰动结果 \(y'=M(x+\delta)\) 之间的差异,通常通过词错误率(WER)来衡量。为了形式化攻击者知识的边界,我们依赖于滤波的概念——它表示到特定时刻为止过程累积的总信息。

令 \(\mathcal{F}_t=\sigma(x_1,\dots,x_t)\) 表示干净信号的滤波,\(\mathcal{F}_t^W=\sigma(w_1,\dots,w_t)\) 表示时刻 \(t\) 扰动信号 \(w=x+\delta\) 的观测滤波。我们通过信息算子 \(H:X\to Z\) 来刻画攻击者的能力,其中 \(Z\) 表示观测空间。学习到的攻击机制 \(f_\theta:Z\to X\) 生成扰动 \(\delta=f_\theta(H(x))\)。因此,对抗性目标为:
\[
\max_{f_\theta\in F(H)}\; \text{WER}\bigl(M(x),M(x+f_\theta(H(x)))\bigr),
\tag{1}
\]
其中 \(F(H)\) 表示适当的结构约束类别。

#### 完美信息

最宽松的设置允许攻击者完全访问话语,即 \(H(x)=x\)。这代表了投影梯度下降(PGD)类攻击[6(https://arxiv.org/html/2606.06833#bib.bib26)] 以及在完整信号上优化的离线方法[25(https://arxiv.org/html/2606.06833#bib.bib29);9(https://arxiv.org/html/2606.06833#bib.bib135)]。在这里,生成器可以针对受害模型迭代地细化 \(\delta\)。然而,这些攻击本质上具有*追溯性*:当优化终止时,话语已经说出。

#### 隐藏信息

在另一个极端,通用攻击完全舍弃了对输入的依赖,即 \(H(x)=\varnothing\)。单个扰动被离线预计算并应用于每个话语[21(https://arxiv.org/html/2606.06833#bib.bib200);29(https://arxiv.org/html/2606.06833#bib.bib82)]。虽然这规避了时间约束,但迫使扰动针对训练分布的平均退化情况进行优化,从而无法利用针对特定输入的受害者漏洞。

#### 部分信息

现实世界的威胁存在于这两个极端之间,攻击者的知识受到因果和环境因素的限制。例如,在流式设置中,扰动 \(\delta\) 的存在会引发一种有害的自干扰形式。由于假设攻击者的扰动会导致不可逆的物理信道变换,底层干净信号会被以不可恢复的方式掩盖。这迫使信息历史发生偏离,使得 \(\mathcal{F}_t^W\subset\mathcal{F}_t\),因此 \(\delta\neq 0\) 必然导致条件熵的退化,即 \(\mathcal{H}(x_t|\mathcal{F}_t^W)>\mathcal{H}(x_t|\mathcal{F}_t)\)。为了实际模拟这一点,我们定义一个*因果屏障* \(t_p\),其中 \(\delta_{t\leq t_p}=0\)。

###### 命题 1(信息可容许性)

对于因果屏障 \(t_p\),当且仅当算子 \(H(x)\) 是 \(\mathcal{F}_{t_p}\)-可测时,攻击是可容许的。

关键在于,虽然 \(t_p\) 限制了攻击者可以*测量*什么,但并未限制这些测量的*可计算函数*的集合。对于任何 \(\mathcal{F}_{t_p}\)-可测函数 \(\phi\),算子 \(H(x)=[x_p,\phi(x_p)]\) 都是可容许的。

## 3 方法:利用语义先验

首先形式化我们的关键见解:除音频外的辅助信息通道可以使攻击者绕过因果屏障。在此之前,攻击者只能测量音频前缀,其信息算子 \(H(x;t_p)=x\cdot 1_{t>t_p}\)。文本通道 \(\tilde{T}(x)\) 对 \(\delta\) 是不变的,而声学滤波 \(\mathcal{F}_t^W\) 是 \(\delta\) 的函数。这种不变性的价值是我们的方法的核心。声学通道受限于时间要求:攻击者无法听到未被说出的内容,并且在扰动发出后无法可靠地分辨信息。然而,文本通道 \(\tilde{T}(x)\) 纯粹是 \(\mathcal{F}_{t_p}\)-可测的;它不需要进一步的音频,并且不受发射扰动引起的声学退化影响。之前的流式攻击[12(https://arxiv.org/html/2606.06833#bib.bib215);10(https://arxiv.org/html/2606.06833#bib.bib55)] 隐含地将 \(\phi\) 限制为恒等映射,将“可用信息”等同于“观测到的音频”。Semantic Gambit 通过使用纯声学生成器无法访问的预训练语言先验,在这些边界之外运行。它突破信息屏障的方式不是通过听到更多,而是通过知道更多。

### 3.1 实现

现在我们描述第 3 节中引入的增强算子 \(H\) 的具体实现。每个话语 \(x\) 被划分为四个连续段:
- *前缀*信号 \(x_p\),长度为 \(t_p\),在此期间攻击者被动观察;
- *延迟* \(\tau\),模拟实时管道的计算延迟;
- 注入窗口信号 \(x_\star\),固定长度 \(\Delta_\star=3\,\text{s}\),扰动注入到此窗口;
- 后缀,对应剩余的音频。

扰动 \(\delta\) 定义在与 \(x_\star\) 相同的时间窗口上。增强的过滤算子 \(H(x)=[x_p,\tilde{y}_\star]\),其中 \(\tilde{y}_\star\) 是 ASR 转录的前缀与 LLM 预测的延续的拼接,它仅通过前缀 \(x_p\) 依赖 \(x\)。

**算法 1** Semantic Gambit (SG) 训练过程。

1: 受害者 ASR \(M\),语言模型 \(L\),生成器 \(G_\theta\),训练集 \(\mathcal{D}\),目标 SNR \(\mathrm{SNR}_{\text{tgt}}\)
2: 优化的生成器参数 \(\hat{\theta}\)
3: **for** epoch=1,...,E **do**
4:   **for each** utterance \((x, y^\text{gt}) \in \mathcal{D}\) **do**
5:     将 \(x\) 按照固定的时间调度划分为 \(x_p\) 和 \(x_\star\)
6:     \(y_p \leftarrow M(x_p)\); \(y_f \leftarrow L(y_p)\) ▷ 语义扩展
7:     \(\tilde{\delta} \leftarrow G_\theta\bigl(\text{MFCC}(x_p),\;E_{\text{sem}}(y_p\oplus y_f)\bigr)\) ▷ 扰动生成
8:     \(\delta \leftarrow \text{ScaleToSNR}(\tilde{\delta}, x_\star, \mathrm{SNR}_{\text{tgt}})\)† ▷ 约束强制
9:     \(\theta \leftarrow \theta - \eta\,\nabla_\theta\bigl(-\mathcal{L}_\text{CTC}(M(x+\delta), y^\text{gt})\bigr)\) ▷ 优化
10:  **end for**
11: **end for**
12: **return** \(\hat{\theta}\)

† `ScaleToSNR` 算子应用统一的标量缩放以匹配规定的扰动预算;它不向生成器输入目标窗口信息。参见附录 A,§*扰动缩放*。

#### 攻击管道

生成器是作用在前缀上的三个映射的组合。受害者 ASR \(M\) 产生部分转录 \(y_p\);语言模型 \(L\) 将其扩展为即将到来的语言内容的预测 \(y_f\),因此 \(y_p\oplus y_f\) 提供了文本通道;多模态生成器 \(G_\theta\) 将通过 `MFCC(·)` 从前缀音频中提取的声学特征与通过 \(E_{\text{sem}}(·)\) 从拼接的标记序列中产生的语义嵌入融合,生成支持在目标区间上的原始扰动 \(\tilde{\delta}\),即扰动注入的时间窗口。相对于 \(x_\star\) 进行目标 SNR 约束下的重新缩放后,产生最终的 \(\delta\)。端到端训练最大化连接主义时间分类(CTC)损失[13(https://arxiv.org/html/2606.06833#bib.bib64)] 相对于真实转录 \(y^\text{gt}\) 的值。

#### 生成器架构

\(G_\theta\) 有两个阶段。阶段 1 对音频帧和文本标记进行多模态自注意力联合处理,使网络能够学习语言预测的哪些方面最能影响扰动。阶段 2 是 Perceiver[16(https://arxiv.org/html/2606.06833#bib.bib211)],它将这种融合表示压缩为固定维度的潜在集,并从该潜在集解码出扰动波形。两个通道上的联合注意力使得扰动能够同时被过去的 (\(y_p\)) 和预测的 (\(y_f\)) 语音所塑造。将此设计与三种替代融合策略进行比较的消融实验见附录 E。

#### 代码

[待补充]

## 4 实验

我们从两个维度评估 Semantic Gambit。首先,*不同信息体制下的攻击效能*:我们将 SG 与第 2 节中各体制的代表性方法进行基准比较——隐藏信息通用扰动和作为下限的白噪声控制、具有完美信息访问的离线 PGD 攻击作为上限,以及共享流约束但使用不同信息算子 \(H\) 的部分信息方法。这一设计测试语言预测能否在不违反因果律的情况下缩小与完美信息性能的差距,将任何增益分解为声学、架构和语义组件,并通过端到端延迟验证实时可行性。其次,*数据集可迁移性*:在一个语料库上训练的生成器是否能保持对保留分布的效能?这可以将可泛化的对抗结构与特定语料库的过拟合分离开来,并界定攻击在训练分布之外的实际影响范围。

### 4.1 实验设置

我们的主要实验在 LibriSpeech 语料库[24(https://arxiv.org/html/2606.06833#bib.bib128)] 上进行训练和评估。

相似文章

面向自然语言理解任务的混合对抗防御框架

arXiv cs.CL

来自南安普顿大学和曼彻斯特大学的研究人员提出了一种面向大语言模型的混合对抗防御框架,该框架将基于熵、基于不确定性和基于几何的模型相结合,旨在同时应对自然语言理解任务中的幻觉问题和对抗性攻击漏洞,最终实现了高达 64.92% 的对抗鲁棒性提升和 62.27% 的攻击成功率降低。

与大型语言模型无关的语义表示攻击

arXiv cs.CL

本文介绍了语义表示攻击(SRA),这是一种新颖的与大型语言模型无关的方法,它针对恶意语义表示而非确切文本进行优化,在多个开源模型中实现了高攻击成功率。

语音AI系统易受隐藏音频攻击

Hacker News Top

新研究表明,不易察觉的音频信号能以79-96%的成功率劫持大型音频语言模型(LALMs),迫使其执行未经授权的命令,如网络搜索或发送电子邮件。这种被称为AudioHijack的技术针对生成式模型,无论用户输入如何都能生效,对语音AI系统构成严重安全风险。