StreamAlign: 流式文本对齐语音分词
摘要
StreamAlign 是一个流式文本对齐语音分词框架,能够实现语音-文本联合建模的实时处理,降低延迟,并在语音识别和口语建模任务上达到最先进的性能。
arXiv:2609.09719v1 公告类型:新
摘要:文本对齐的语音分词方法已经出现,以更好地将语音令牌与 LLM 令牌空间对齐,从而更有效地利用预训练的 LLM。然而,它们依赖于离线自动语音识别(ASR),导致两个关键限制:(i)分词前需要完整的语音,无法实现实时流式处理;(ii)ASR 与 LLM 之间的词汇不匹配,这降低了从子词到词级别的声学粒度。我们引入了 StreamAlign,一个文本对齐的语音分词框架,能够实现流式分词,用于实时语音-文本联合建模。StreamAlign 通过结合字符级 RNN-Transducer 对齐与词级 ASR 引导,执行在线语音-文本对齐,在保持识别准确性的同时缓解 ASR-LLM 的词汇不匹配问题。一个主动的词边界分类器在分块边界预测词的完成,将分词延迟从 560 毫秒降低到 270 毫秒。在 LibriSpeech 上,StreamAlign 在评估的分词器中取得了最低的词错误率(WER)和最高的 UTMOS 分数。此外,StreamAlign-SLM,一个基于 StreamAlign 单元训练的口语模型,在语音续写任务上优于其他端到端口语模型,同时在 SALMon 和口语 StoryCloze 上实现了最强的整体一致性。
查看缓存全文
缓存时间: 2026/09/10 08:14
# StreamAlign:流式文本对齐语音令牌化 来源:https://arxiv.org/html/2609.09719 作者:Kang-wook Kim††贡献相等†。单位:首尔国立大学 / 单位:加州大学伯克利分校 邮箱:[email protected] Jinyoung Park¹¹同上脚注¹ Jinsoo Kim 单位:首尔国立大学 / 单位:KRAFTON Sehun Lee 单位:首尔国立大学 / 单位:KRAFTON Sang Hoon Woo 单位:首尔国立大学 / 单位:佐治亚理工学院 Gunhee Kim 邮箱:[email protected] 项目页面:ishlove77.github.io/StreamAlign/ 单位:首尔国立大学 --- ## 摘要 文本对齐语音令牌化方法已被提出,旨在更好地将语音令牌与大语言模型的词空间对齐,从而更有效地利用预训练的大语言模型。然而,这些方法依赖于离线自动语音识别,导致两个关键局限:(i) 令牌化前需要完整的话语,无法实现实时流式处理;(ii) 自动语音识别与大语言模型之间的词汇不匹配,使得声学粒度从子词级降低到词级。 我们提出**StreamAlign**,一个支持流式令牌化的文本对齐语音语音框架,用于实时语音-文本联合建模。**StreamAlign**通过结合字符级RNN转录器对齐与词级自动语音识别指导,实现了在线语音-文本对齐,在保持识别准确度的同时缓解了自动语音识别与大语言模型的词汇不匹配问题。一个主动词边界分类器在块边界预测词语完成,将延迟从560毫秒降至270毫秒。在LibriSpeech数据集上,**StreamAlign**在评估的令牌化器中达到了最低的词错误率和最高的UTMOS分数。此外,基于**StreamAlign**单元训练的口语语言模型**StreamAlign-SLM**在语音续写任务上优于其他端到端口语模型,并在SALMon和口语StoryCloze任务上达到了最强的整体一致性。 ## 1 引言 口语语言模型(SLMs)是一种新兴的基于语音的AI范式,它对语音进行端到端建模,并保留了级联管道所丢弃的韵律和副语言线索(Kharitonov et al., 2022;Nguyen et al., 2023)。早期的口语语言模型仅在纯语音数据上训练(Lakhotia et al., 2021),在语义能力上落后于文本大语言模型(Hassid et al., 2023),而该领域已转向为预训练文本大语言模型增强语音模态(Maimon et al., 2025a;Nguyen et al., 2025;Xu et al., 2025),继承大规模文本语料库积累的语言能力。然而,整合这两种模态并非易事:语音与文本之间的模态鸿沟体现在时间分辨率、单元边界和副语言内容上的差异(Wang et al., 2026)。因此,大语言模型所消费的语音表示是关键设计选择,而令牌化是生成该表示的主要机制。 为联合语音-文本建模开发了几种语音令牌化方法。令牌交错方法在单个自回归流中混合语音和文本令牌(Nguyen et al., 2025;Zeng et al., 2024),而多流设计以语音帧率运行并行的语音和文本令牌流(Défossez et al., 2024);这两种方法都显著增加了联合序列长度。近期的研究方向——文本对齐语音令牌化(Tseng et al., 2026;Hsu et al., 2025)将语音令牌序列约束为与文本令牌序列一一对应,使得联合序列长度等于仅文本输入的长度。 先前的文本对齐语音令牌化方法(如图1概述)等待完整话语后才进行离线自动语音识别,在自动语音识别令牌级别(例如“\_fine”、“t”、“un”、“ing”)提取声学表示,在词级进行合并,并在不匹配的大语言模型子词令牌(例如“\_fin”、“et”、“uning”)上进行复制。这(i)引入了高延迟,并且(ii)丢失了细粒度的子词级声学信息。相比之下,**StreamAlign**增量处理流式语音块,并使用词级自动语音识别作为字符级RNN转录器对齐的指导,实现了低延迟的语音-字符-子词令牌化。 然而,现有的文本对齐令牌化框架(Tseng et al., 2026;Hsu et al., 2025)存在两个关键局限(图1)。首先,延迟限制了它们在实时交互中的应用:其离线自动语音识别管道在话语结束前会阻塞令牌化,而简单的流式适应仍面临显著延迟。具体来说,流式自动语音识别模型倾向于为获取更多音频上下文而延迟输出,贡献了约410毫秒的延迟。此外,大语言模型的子词令牌是按词确定的,因此在下一个词开始之前无法确定,又增加了约300毫秒。其次,它们存在自动语音识别与大语言模型的词汇不匹配;自动语音识别系统的子词词汇与大语言模型的不匹配,因此先前的工作将声学特征对齐到词级单元,并将每个词级表示复制到大语言模型的子词令牌上,丢弃了细粒度的子词级声学和副语言细节。 为了克服这两个局限,我们提出了**StreamAlign**,一个支持流式令牌化和重建的文本对齐语音令牌化框架,用于实时语音-文本联合建模。**StreamAlign**在流式块上对齐语音与文本,同时通过字符级对齐与大语言模型子词聚合来解决自动语音识别与大语言模型的词汇不匹配问题。我们还引入了主动词边界检测以进一步降低延迟。我们证明了**StreamAlign**在下游口语建模任务上的有效性。我们的贡献如下: - 我们提出了**StreamAlign**,一个支持流式令牌化和重建的文本对齐语音令牌化框架。采用主动词边界检测将延迟降低到270毫秒,使其能够在实时延迟约束内运行。 - 我们提出了一种在线语音-文本对齐策略,通过在训练和推理期间结合字符级RNN转录器对齐与词级自动语音识别指导。它减少了自动语音识别与大语言模型的词汇不匹配,并提高了重建的可懂度,相对于先前工作的词级聚合,实现了20%的相对词错误率降低。 - 我们在语音重建任务上对**StreamAlign**进行了实证验证,它在评估的最先进令牌化器中获得了最低的词错误率和最高的UTMOS。 - 我们推出了**StreamAlign-SLM**,一个基于**StreamAlign**单元训练的口语语言模型,它在整体似然和语音续写方面超越了近期的口语模型(人类评估得分4.00 vs. 次优3.47)。 ## 2 相关工作 ### 口语语言建模 口语语言模型自回归地预测语音令牌,其范围包括仅在语音上训练的系统(Lakhotia et al., 2021;Nguyen et al., 2023)到联合建模语音和文本的系统(Zhang et al., 2023)。然而,纯语音变体在语言理解基准测试上持续落后于文本大语言模型(Hassid et al., 2023;Wang et al., 2026),这反映了文本和语音预训练数据的非对称可用性。 ### 联合语音-文本建模 一系列工作在预训练文本大语言模型上构建口语语言模型以继承其语义能力:TWIST(Hassid et al., 2023)从文本大语言模型初始化,并在语音令牌上继续训练,而SpiRit-LM(Nguyen et al., 2025)在单个自回归流中交错语音和文本令牌。然而,生成的语音令牌序列比文本长得多,这增加了大规模联合训练和推理的复杂性。 ### 文本对齐语音令牌化 为了解决序列长度不匹配问题,近期的文本对齐语音令牌化工作将语音压缩为与文本令牌边界对齐的令牌序列(Tseng et al., 2026;Hsu et al., 2025;Ku et al., 2026)。这种方法能够以符合标准大语言模型预训练的方式进行高效的联合语音-文本建模,实现了最先进的语义性能(Hassid et al., 2023;Tseng et al., 2026)。与这些具有词级声学粒度的离线方法相反,**StreamAlign**通过对流式语音块进行增量处理并利用字符级对齐实现子词级声学粒度,执行文本对齐令牌化。同期工作TASTE-Streaming(Tseng and Lee, 2026)也针对可流式的文本对齐令牌化。然而,他们的方法在长音频块(至少10秒)上运行,导致延迟远高于实时交互应用的要求。由于没有开源实现,我们将其排除在实验比较之外。 ### 图2:StreamAlign概述 (a)块级语音令牌化 (b)词边界检测 原始语音通过编码器处理以提取逐帧的语义和声学特征 $\mathbf{x}_{i}^{s}, \mathbf{x}_{i}^{a}$。通过RNN转录器格点的维特比解码获得字符级对齐,并将对齐段与大语言模型子词匹配。然后在段上聚合声学特征并通过RVQ进行离散化,生成StreamAlign单元 $(w_{m}, \mathbf{q}_{m}, d_{m})$(§3.1.1)。为清晰起见,省略了块索引 $i$;$c_{1}$ 和 $\mathbf{x}_{1}^{s}$ 在正文中分别对应 $c_{i,1}$ 和 $\mathbf{x}_{i,1}^{s}$。基于这些单元,通过两阶段解码重建语音(§3.1.2)。附录A中的图3展示了包括重建过程在内的StreamAlign完整视图。 (b)词边界分类器解析块边缘歧义以降低延迟(§3.1.1)。 ## 3 方法:StreamAlign StreamAlign包含两部分。单元转换管道(§3.1)将语音块令牌化为大语言模型子词对齐的StreamAlign单元,并将其解码回波形音频,其中主动词边界检测支持实时块级流式处理。然后我们介绍StreamAlign-SLM(§3.2),一个基于StreamAlign单元构建的口语语言模型,它提供了一个最小示范,证明这些单元可以在预训练文本大语言模型上驱动联合语音-文本建模。 ### 3.1 StreamAlign单元转换 #### 3.1.1 块级语音令牌化 StreamAlign通过首先将声学帧对齐到转录字符,然后将对齐的帧聚合为大语言模型子词嵌入,来令牌化每个传入的语音块。由于字符是词汇无关的,这种设计桥接了自动语音识别与大语言模型的词汇鸿沟,与下游令牌化器的选择无关,同时自然支持无需访问未来音频的块级流式处理。 **语音编码**:语音编码器将每个传入的音频块映射为帧级特征,同时关注固定数量的过去块作为上下文。对于当前块 $\mathbf{x}_{i}$,我们将其固定的过去上下文表示为 $\mathbf{p}_{i} = (\mathbf{x}_{i-1}, \dots, \mathbf{x}_{i-k})$,其中 $k$ 表示上下文窗口大小。给定 $\mathbf{x}_{i}$ 和 $\mathbf{p}_{i}$,编码器产生两个长度为 $T$ 的帧级特征序列:从最终编码器层提取的语义特征 $\mathbf{x}_{i}^{s} = (x_{i,1}^{s}, \dots, x_{i,T}^{s})$,以及通过拼接较低编码器层的隐藏表示形成的声学特征 $\mathbf{x}_{i}^{a} = (x_{i,1}^{a}, \dots, x_{i,T}^{a})$: $$ \mathbf{x}_{i}^{s}, \mathbf{x}_{i}^{a} = \textsc{SpeechEncoder}(\mathbf{x}_{i}, \mathbf{p}_{i}). \tag{1} $$ 我们使用预训练的Conformer(Gulati et al., 2020)作为编码器,限制其自注意力和卷积都在固定大小的窗口内(Noroozi et al., 2024),使其能够在固定大小的块上运行。 **词引导的字符对齐**:我们使用字符级RNN转录器(RNN-T)(Graves, 2012)将 $\mathbf{x}_{i}^{s}$ 对齐到字符。目标字符序列 $\mathbf{c}_{i} = (c_{i,1}, \dots, c_{i,L_{i}})$,长度为 $L_{i}$,来自一个冻结的、预训练的流式词级自动语音识别:我们将其词假设分解为字符。我们称之为*词引导*方法:它继承了词级自动语音识别的识别准确度,同时在字符粒度上进行对齐。我们在消融研究(§4.5)中验证了这一设计选择与字符级自动语音识别替代方案的对比。给定 $\mathbf{x}_{i}^{s}$ 和 $\mathbf{c}_{i}$,对齐器产生一个单调对齐 $\pi_{i}^{*}$,将每个帧 $t$ 映射到字符索引 $\pi_{i,t}^{*}$。在推理时,$\pi_{i}^{*}$ 是维特比解码下RNN转录器格点中的最佳路径。完整的对齐算法见附录A。 **大语言模型子词级聚合**:基于帧-字符对齐,StreamAlign将声学帧分割为每个子词的块。大语言模型分词器将块的转录拆分为子词 $w_{1}, \dots, w_{M}$,每个 $w_{m}$ 对应一个连续的 $d_{m}$ 个声学帧的块。一个Transformer编码器块通过基于注意力的池化将此块聚合为一个子词声学嵌入 $z_{m} \in \mathbb{R}^{D}$。每个嵌入 $z_{m}$ 通过具有 $R$ 个码本层的RVQ进行离散化,产生声学码索引 $\mathbf{q}_{m}$ 和量化嵌入 $\hat{z}_{m}$。因此,每个StreamAlign单元表示为一个元组 $(w_{m}, \mathbf{q}_{m}, d_{m})$,其中 $w_{m} = (w_{m,1}, \dots, w_{m,\ell_{m}})$ 表示一个具有 $\ell_{m}$ 个字符的子词。
相似文章
Simulstream:用于评估和演示流式语音到文本翻译系统的开源工具包
Simulstream 是一个开源框架,用于评估和演示流式语音到文本翻译系统,支持长语音的增量解码和重新翻译解码,并具备细粒度日志记录和交互式 Web 界面。
基于SpeechLLM的流式语音转文本翻译
提出了一种用于流式语音转文本翻译的SpeechLLM架构,该架构根据音频自适应决定何时输出令牌,实现了1-2秒的延迟,且质量接近非流式基线。
easyaligner: 支持GPU加速和灵活文本归一化的强制对齐工具(兼容HF Hub上的所有w2v2模型)[P]
easyaligner是一个开源强制对齐库,具有GPU加速和灵活的文本归一化功能,适配Hugging Face Hub上的所有wav2vec2模型。它针对实际工作流进行了优化,可以处理部分转录、无关语音段落和长音频(无需分块),同时保留原始文本格式。
对齐就是一切:面向通用音频-语言模型的无指令训练
本文介绍了一种无指令的纯对齐方法,用于构建大型音频-语言模型,该方法通过冻结LLM和音频编码器,仅在自生成数据上训练一个轻量级投影器,实现了与传统多阶段流程相比更少数据下的竞争性性能。
Montreal Forced Aligner与2026年语音转文字对齐的现状
本文记录了Montreal Forced Aligner 3.0,一款广泛使用的开源强制对齐工具,在英语、日语和韩语上实现了最先进的性能,平均边界误差低于15毫秒。