用于词级时间戳的相对时间区间表示与掩码训练

arXiv cs.AI 论文

摘要

本文介绍了一种在SpeechLLMs中进行词级时间戳标注的方法,该方法利用相对时间区间和掩码训练,以提高预测准确性和对噪声真实世界标注的鲁棒性。

arXiv:2608.24041v1 Announce Type: new 摘要:尽管SpeechLLMs在语音理解和生成方面表现出色,但其对细粒度、时间对齐输出的能力仍待深入研究。我们的工作通过使SpeechLLMs联合建模语音内容和时间结构来填补这一空白,有效地将它们从“内容理解机器”转变为“时间感知内容理解机器”。具体而言,我们用相对时间戳替代传统绝对时间戳,实现了更紧凑的词汇表和更强的泛化能力。为了高效地将时间戳预测能力注入预训练大语言模型,我们引入了一种混合微调策略:对时间戳增强的嵌入层和语言模型头进行全参数微调,并结合解码器层的LoRA微调。此外,我们设计了一个掩码时间戳训练目标,防止模型过度依赖真实时间戳,从而增强对噪声真实世界标注的鲁棒性。大量实验表明,我们的方法在时间戳预测准确性方面取得了显著提升,同时保持了强大的语音转录性能。
查看原文
查看缓存全文

缓存时间: 2026/08/26 09:20

# 面向词级时间戳的掩码训练相对时间间隔表示
来源:https://arxiv.org/html/2608.24041
Zhiyu Tang, Xu Li, Dong Zhang††感谢:†通讯作者。[[email protected]](mailto:[email protected]), Shoushan Li, Guodong Zhou

###### 摘要

尽管语音大语言模型(SpeechLLMs)在语音理解和生成方面表现出色,但其在细粒度、时间对齐输出方面的能力仍待探索。本工作旨在填补这一空白,使SpeechLLMs能够联合建模语音内容和时间结构,有效地将其从"内容理解机器"转变为"时间感知内容理解机器"。具体而言,我们用相对时间戳替代传统的绝对时间戳,以实现更紧凑的词表和更强的泛化能力。为了有效地将时间戳预测能力注入预训练的大语言模型,我们引入了一种混合微调策略:对时间戳增强的嵌入层和语言模型头部进行全参数微调,同时结合解码器层的LoRA微调。此外,我们设计了一个掩码时间戳训练目标,防止模型过度依赖真实时间戳,从而增强对现实世界嘈杂标注的鲁棒性。大量实验表明,我们的方法在保持强大语音转录性能的同时,显著提高了时间戳预测的准确性。111https://github.com/tangquanwei/Timestamp-Aware-Speech-LLM

###### 索引术语:

时间戳,语音LLM,绝对时间戳,相对时间戳,掩码训练

††地址:1苏州大学 2昆士兰大学 3AISpeech Ltd 4江苏语言计算重点实验室

## 1 引言

参见标题 图1:传统方法依赖固定参考的绝对时间戳,常常难以应对累积误差或精确同步。我们的方法利用基于动态区间的相对时间戳,它内在地建模了时间关系,并提供了改进的鲁棒性和准确性。近期研究探索了将大语言模型(LLMs)与语音处理相结合[17 (https://arxiv.org/html/2608.24041#bib.bib8),14 (https://arxiv.org/html/2608.24041#bib.bib25)]。然而,生成细粒度的、带有词级时间戳的转录尚未得到充分探索[13 (https://arxiv.org/html/2608.24041#bib.bib7),18 (https://arxiv.org/html/2608.24041#bib.bib6)]。这项任务不仅要求准确的语音理解,还要求语言单元与其声学实现之间精确的时间对齐[11 (https://arxiv.org/html/2608.24041#bib.bib10),7 (https://arxiv.org/html/2608.24041#bib.bib9)]。一个核心挑战在于如何在LLMs受限的词表和顺序解码范式内高效地表示和预测时间结构[23 (https://arxiv.org/html/2608.24041#bib.bib5),24 (https://arxiv.org/html/2608.24041#bib.bib4),19 (https://arxiv.org/html/2608.24041#bib.bib14),20 (https://arxiv.org/html/2608.24041#bib.bib16)]。现有方法如Qwen2 Audio[4 (https://arxiv.org/html/2608.24041#bib.bib20)]通常采用绝对时间戳进行建模。例如,`<|0.45|>Okay<|1.10|>let's<|2.50|>go<|5.70|>...`表示单词"Okay"开始于0.45秒,结束于1.10秒。尽管这种表示直观且便于评估,但它对绝对时间参考的依赖限制了其在长音频片段上的可扩展性和泛化能力。

如图1 (https://arxiv.org/html/2608.24041#S1.F1)所示,预测绝对时间戳容易导致累积误差传播。绝对时间戳是单调递增的,这导致LLMs学习到一种累积模式:通过将估计的片段时长加到先前的时间戳上来生成更大的数值。此外,这种方法对未见过的时域范围泛化能力较差。例如,当仅在不超过30秒的话语上训练时,它无法预测超出训练时长(例如60秒处)的时间戳。一个主要的实际限制是实现高时间精度所需的词表过大:要在300秒的音频片段上实现0.01秒的精度,需要30,000个不同的时间戳标记。词表的这种爆炸式增长显著增加了训练复杂性和计算开销,使得该方法无法扩展到长语音处理。

图2:基于绝对时间戳的模型(左)与我们提出的基于相对时间戳的模型(右)的架构比较。传统方法将时间戳建模为独立的绝对值,在表示时间戳方面存在困难。相反,我们的方法利用了一个紧凑的相对时间戳词表。通过对解码器进行LoRA微调,我们的模型能够高效地学习联合生成文本和时间标记。为确保准确性和鲁棒性,我们的训练结合了组合损失函数和时间戳正则化(标记掩码),迫使模型学习更具弹性的信息时间表示。为了解决这些限制,我们提出了一种相对时间戳表示,定义为连续单词之间的时间间隔(例如,对于在`<|0.45|>`和`<|1.10|>`对齐的单词,间隔为`<|0.65|>`)。这种方法只需要估计当前片段的持续时间,从而最大限度地减少了误差敏感性。只需学习有限的时间间隔(如0.01秒到5秒),通过累积这些间隔,可以表示任意长度的音频。与绝对时间戳相比,词表仅需包含有限的时间间隔标记。人类语音感知自然关注相对时序:我们直观地处理下一个词在上一个词之后多久发生,而不是它在时间上的绝对位置。这种相对间隔建模自然地与语言模型的自回归生成范式相一致。绝对时间戳迫使模型学习一个与先前生成内容完全无关的新绝对值,这违背了其自然的生成模式。

我们做出以下三个关键贡献:

1.  **一种用于词级时间戳的新型相对时间间隔表示**:我们引入了一种相对时间戳表示,建模词间间隔而非绝对位置。这种方法缓解了词表爆炸和时间漂移,能够对任意长度的音频进行准确的时间戳预测,且不会因长度依赖而导致性能下降。
2.  **高级正则化与对齐策略**:我们提出了一种正则化技术——时间戳掩码,以缓解对完美对齐的过拟合,以及一种动态加权的联合时间对齐损失,该损失在训练过程中自适应地平衡转录准确性和时间戳保真度。
3.  **混合参数高效微调**:我们仅对时间戳特定模块(嵌入层和LM头部)进行全参数微调,同时通过LoRA适配预训练的解码器层。这种角色感知策略通过最少的参数更新保留了语言知识,并使适应粒度与每个模块的功能角色保持一致。

## 2 方法论

### 2.1 相对时间戳表示

与依赖庞大绝对时间戳词表的传统方法不同,我们的方法采用**相对时间戳**来表示时间信息。每个时间戳标记表示从前一个单词结束到当前单词的时间间隔。这种方法的核心优势在于其优越的泛化能力和紧凑的词表。通过学习一组受约束的时间间隔,模型可以累积地表示任意长度音频的时间信息,无需为每个可能的绝对时间点定义唯一的标记。

### 2.2 基于LLM的架构与微调

我们的模型架构建立在预训练的大型语音模型之上,该模型包含用于提取语音特征的编码器和用于序列生成的解码器。

如图2 (https://arxiv.org/html/2608.24041#S1.F2)(右)所示,为了有效地使我们的模型适应时间对齐这一新任务,我们采用了一种混合微调策略,结合了对新组件的全参数更新和对骨干模块的参数高效微调。

我们对新引入的时间戳嵌入和语言模型(LM)头部应用全参数微调。这些模块直接负责将新的时间戳标记映射到连续向量空间,以及在输出序列中生成它们。由于它们的初始权重是随机的,因此需要全面更新所有参数,以便它们能够从头开始有效地学习和表示新的时间增强词表。

对于骨干模型,特别是解码器层的架构,我们利用LoRA(低秩适配)[6 (https://arxiv.org/html/2608.24041#bib.bib22)]。这一战略选择既考虑了计算效率,也考虑了针对性适配的需要。LoRA不是更新所有参数,而是冻结原始权重并注入小型的、可训练的低秩矩阵。这种方法大幅减少了可训练参数的数量,从而显著节省了计算资源。此外,通过使用LoRA微调解码器,模型可以高效地学习在生成特定文本内容时插入相应的时间标记,而不会干扰强大的、预训练的语音特征理解能力。这种混合方法在确保计算效率的同时,实现了对模型生成行为的精确控制,以实现鲁棒且准确的时间对齐。

### 2.3 时间对齐训练策略

为了确保我们的模型生成准确且鲁棒的时间戳,我们设计了两个关键训练策略:

#### 2.3.1 联合时间对齐损失

我们的训练目标是最小化由两部分组成的联合损失函数,该函数平衡文本转录和时间戳生成之间的权重:

Ltotal = Ltext + λLtimestamp
其中 Ltext 是标准交叉熵损失,衡量模型生成的文本标记与真实标记之间的差异。类似地,Ltimestamp 是评估离散时间戳标记预测准确性的交叉熵损失。

超参数 λ 作为两个损失组件之间的权重因子。我们采用动态权重策略:在训练早期阶段,我们设置较小的权重(λ=1),让模型优先学习语音到文本的映射。随着训练的进行,我们逐渐增加 λ 的值,以鼓励更精确的时间对齐。具体来说,对于每个训练周期,我们将 λ 的值增加1。

表1:不同模型在时间戳预测上的性能比较。精确率和召回率以百分比表示,平均时间戳差异以毫秒为单位。'-'表示该模型不支持中文语音。

#### 2.3.2 用于正则化的时间戳掩码

为了缓解训练过程中对真实值的过拟合,我们提出了一种时间戳掩码技术。核心思想是随机将一部分时间戳标记替换为 [MASK] 标记。在训练过程中,当先前的时间戳标记被掩码时,模型无法参考其真实值,而必须根据语音内容和历史标记来推断当前时间戳,从而增强对不准确标注的鲁棒性。类似于BERT的掩码语言建模,这种随机掩码鼓励模型在不同迭代中利用不同的输入组件,防止对特定时间戳的过度依赖。

## 3 实验

### 3.1 实验设置

**数据集**。我们在五个基准数据集上进行实验:AISHELL-1:一个包含约178小时语音、400名说话者的普通话语料库[3 (https://arxiv.org/html/2608.24041#bib.bib11)]。AISHELL-2:一个更大的普通话语音数据集,包含约1,000小时、来自1,991名说话者在不同声学环境下的语音[5 (https://arxiv.org/html/2608.24041#bib.bib12)]。Wenet Meeting:一个多领域普通话语料库,包含10000多小时的高质量标注语音[25 (https://arxiv.org/html/2608.24041#bib.bib24)]。LibriSpeech:一个英语朗读语音语料库,包含约1,000小时的有声读物,广泛用于ASR评估[12 (https://arxiv.org/html/2608.24041#bib.bib13)]。Common Voice(英语子集):一个众包语料库,包含不同口音和录制条件[2 (https://arxiv.org/html/2608.24041#bib.bib17)]。

**基线模型**。我们将我们提出的方法与几个最先进的模型进行比较。Qwen2-Audio:一个具有集成音频理解能力的大语言模型,使用大量多样化数据和多种训练方法进行训练[4 (https://arxiv.org/html/2608.24041#bib.bib20)]。WhisperTimestamped:该模型利用Whisper-large-v3,一个强大的、多语言的ASR模型,在约68万小时的弱监督音频数据上训练[15 (https://arxiv.org/html/2608.24041#bib.bib18)]。SenseVoice-Small:一个轻量级高效的ASR系统,在超过40万小时的数据上训练,支持超过50种语言[1 (https://arxiv.org/html/2608.24041#bib.bib19)]。Canary:采用数据驱动方法实现词级时间戳预测,并支持除中文外的多种语言[8 (https://arxiv.org/html/2608.24041#bib.bib23)]。

**评估指标**。对于时间戳预测,我们引入了时间容差的概念。由于语音边界固有的模糊性,如果预测的时间戳与真实时间戳的差异在预定义的容差范围内,则认为该预测是正确的[16 (https://arxiv.org/html/2608.24041#bib.bib2),10 (https://arxiv.org/html/2608.24041#bib.bib3),9 (https://arxiv.org/html/2608.24041#bib.bib15)]。我们使用精确率和召回率来评估这些时间戳的准确性:精确率衡量所有预测的时间戳中正确预测的时间戳比例。召回率衡量所有真实时间戳中正确预测的时间戳比例。此外,我们使用平均时间差异来量化时间精度,定义为:

Avg. Diff = (∑_{i=1}^{N} |timestamp_{gt}^{i} - timestamp_{pred}^{i}|) / N
对于ASR分析,我们使用词错误率(WER)作为主要指标[21 (https://arxiv.org/html/2608.24041#bib.bib1)]。

表2:在不同模型配置下,240 ms容差下时间戳预测性能的消融研究(WER % 和 精确率/召回率)。

**实现细节**。我们的训练方法扩展了FireRedASR-LLM[22 (https://arxiv.org/html/2608.24041#bib.bib21)]的架构以支持时间戳输出。该模型基于conformer音频编码器和Qwen2-7B-Instruct骨干LLM构建。关键是,原生模型无法生成时间戳。

该模型在24个Ascend 910B (64G) NPU集群上训练了7000步,每个NPU处理500秒的批量数据。设置λ初始值为1,每个周期增加1,并且根据经验从第二个周期开始设置掩码概率为10%。训练使用AdamW优化器,学习率设为5×10^{-6},并使用WarmupCosineLR调度器以确保稳定收敛。整个过程采用bf16混合精度训练以提高效率。为了启用时间

相似文章

揭秘数据受限语言模型预训练中的训练时数据增强

Hugging Face Daily Papers

本文研究了在数据受限、算力充足的场景下,为缓解自回归语言模型预训练中的过拟合而采用训练时数据增强技术,发现结合词元级噪声、序列排列和目标偏移预测可以改善验证损失。

GigaChat Audio: 时间感知的大型音频语言模型

Hugging Face Daily Papers

本文介绍了 GigaChat Audio,一个时间感知的大型音频语言模型,能够对长达120分钟的音频回答问题并给出明确的时间戳,使用交错周期性时间标记和合成监督。该模型在基准测试中实现了强时间定位准确性,作者已发布模型权重和数据集。

掩码语言模型中Glauber Dynamics的混合时间

arXiv cs.LG

本文分析了使用Glauber dynamics的掩码语言模型中迭代掩码标记重采样所引发的全局分布行为。引入了一种用于不相容性的矩形检验,建立了混合时间界限,并通过实验展示了相变和亚稳态语义盆地。