分词器移植:缓解边缘高效孟加拉语ASR中的自回归崩溃

arXiv cs.CL 论文

摘要

本文提出了一种适用于Moonshine等轻量级ASR模型的分词器移植流程,以解决孟加拉语中的自回归崩溃问题。通过将以英语为中心的分词器替换为BanglaBERT的WordPiece词汇表,词元繁殖度从9.16降至1.30,序列长度减少85.8%,在Lipi-Ghor数据集上实现了21.54%的词错误率(WER)。

arXiv:2607.09598v1 公告类型:新 摘要:轻量级语音识别模型对于边缘部署至关重要,但像Moonshine这样高度优化的架构在面对孟加拉语等形态丰富、非拉丁语言时常常失败。本研究将这一失败的根源归因于模型以英语为中心的字节级分词器,该分词器将孟加拉语单词分割成高繁殖度的字节链,并在推理过程中触发灾难性的自回归崩溃。为解决此问题,提出了一种新颖的词汇表移植流程,将解码器词汇表替换为原生文字的BanglaBERT WordPiece词汇表,并调整相应的词嵌入矩阵大小。实验结果表明,词元繁殖度从9.16降至1.30。通过将自回归序列长度减少85.8%,解码不稳定性完全得到缓解。在882小时的Lipi-Ghor数据集上评估时,修改后的架构实现了具有竞争力的21.54%词错误率(WER)和0.0053的实时因子(RTF)。最终,本研究为紧凑型ASR模型的跨文字适配提供了一个可扩展、可复现的蓝图,无需进行资源密集型的预训练。
查看原文
查看缓存全文

缓存时间: 2026/07/13 07:59

# 分词器移植:缓解孟加拉语边缘高效自动语音识别中的自回归崩溃
来源:https://arxiv.org/html/2607.09598
###### 摘要

轻量级语音识别模型对于边缘部署至关重要,然而像 Moonshine 这样高度优化的架构在处理孟加拉语等形态丰富的非拉丁语言时常常失败。本研究将这种失败的根本原因归结为模型以英语为中心的字节级分词器,该分词器将孟加拉语单词分割成高分裂度的字节链,并在推理过程中触发灾难性的自回归崩溃。为了解决这个问题,我们提出了一种新颖的词汇表移植流程,用原生文字的 BanglaBERT WordPiece 词汇表替换解码器词汇表,并调整相应的词嵌入矩阵。实验结果表明,分词密度从 9.16 降低到 1.30。通过将自回归序列长度减少 85.8%,解码不稳定性完全得到缓解。在 882 小时的 Lipi-Ghor 数据集上评估时,修改后的架构实现了具有竞争力的 21.54% 词错误率 (WER) 和 0.0053 的实时因子 (RTF)。最终,本研究提供了一个可扩展、可复现的蓝图,用于在无需资源密集型预训练的情况下,对紧凑型 ASR 模型进行跨文字适应。

ASR, Bengali, Tokenizer Fertility, Cross-Script, Adaptation

spacing=nonfrench

## 1 引言

自动语音识别 (ASR) 的最新进展通过大规模自监督学习取得了显著性能。然而,这些模型通常依赖于为高资源语言设计的广覆盖分词器,这在处理孟加拉语等形态丰富的语言时表现欠佳。这种不匹配导致分词密度高,进而造成序列长度增加以及推理过程中的自回归崩溃。

在本文中,我们通过提出一个**分词器移植**流程来解决这个瓶颈。我们并非从头开始训练,而是通过用原生文字的 BanglaBERT 分词器替换其词汇表,对轻量级基础架构(例如 Moonshine)进行精准适应。我们证明,通过将声学表示学习与语言建模解耦,我们可以稳定解码器,并在 882 小时的 Lipi-Ghor 数据集上显著提升性能。我们的方法为将高效、预训练的架构适应到低资源语言提供了一个可扩展的蓝图,确保 ASR 的好处能够惠及语言多样化的社区。我们框架的完整实现细节可在我们的仓库中找到。¹¹¹https://github.com/Sanjidh090/moonshine-base-bn

## 2 相关工作

### 2.1 语音表示学习

当前的 ASR 格局由 Baevski 等人 (2020) (https://arxiv.org/html/2607.09598#bib.bib3) 和 Babu 等人 (2022) (https://arxiv.org/html/2607.09598#bib.bib2) 等框架主导,它们利用自监督学习进行稳健的特征提取。虽然像 Radford 等人 (2023) (https://arxiv.org/html/2607.09598#bib.bib15) 这样的模型通过大规模监督推动了准确率的边界,但其计算规模对边缘设备来说仍然过高。因此,像 Moonshine (Useful Sensors, 2024 (https://arxiv.org/html/2607.09598#bib.bib19); King & Sabra, 2025 (https://arxiv.org/html/2607.09598#bib.bib11)) 这样的轻量级架构对于本地、资源受限的部署变得至关重要。

### 2.2 词汇表适应

分词质量是模型性能的主要决定因素 (Rust 等人, 2021 (https://arxiv.org/html/2607.09598#bib.bib16))。先前的努力,如 WECHSEL (Minixhofer 等人, 2022 (https://arxiv.org/html/2607.09598#bib.bib14)) 和 FOCUS (Dobler & de Melo, 2023 (https://arxiv.org/html/2607.09598#bib.bib8)),提出了初始化跨语言迁移子词嵌入的创新方法。然而,这些方法主要针对基于文本的大型语言模型 (LLM)。我们的工作将这些原则扩展到 ASR,将“分词器移植”确定为防止形态丰富文字中自回归漂移的关键要求。

### 2.3 孟加拉语 ASR

孟加拉语 ASR 的发展得益于 Alam 等人 (2022) (https://arxiv.org/html/2607.09598#bib.bib1) 和 Faisal 等人 (2023) (https://arxiv.org/html/2607.09598#bib.bib9) 等数据集。虽然最近的工作 (Tabib 等人, 2026 (https://arxiv.org/html/2607.09598#bib.bib18)) 探索了长语音 ASR 和说话人日志 (Bredin 等人, 2020 (https://arxiv.org/html/2607.09598#bib.bib5)),但在将最先进的解码器适应这些语言方面仍存在差距。通过集成 TokAlign (Liu 等人, 2025 (https://arxiv.org/html/2607.09598#bib.bib13)) 和 Trans-Tokenization (Delobelle 等人, 2024 (https://arxiv.org/html/2607.09598#bib.bib7)) 等技术,我们为特定语言的词汇表适应提供了一种稳健、可复现的方法。

## 3 分词器密度与解码不稳定性

原始的 Moonshine 分词器主要针对英语文本进行了优化。因此,孟加拉语单词在分词过程中会经历激进的字节级分解。分词器密度定义为生成的标记数与总单词数的比率:

Φ = 总标记数 / 总单词数  (1)

其中较低的值表示更紧凑的分词。基准分词器产生 Φ_baseline = 9.16。相比之下,移植后的孟加拉语分词器实现了 Φ_transplant = 1.30。

分词密度差距显著影响自回归解码。长标记链增加了推理时错误累积的概率 (Sennrich 等人, 2016 (https://arxiv.org/html/2607.09598#bib.bib17))。尽管教师强制优化保持稳定,但自回归生成变得越来越脆弱,这解释了观察到的训练损失与推理质量之间的差异。

阶段 1:声学适应与手术          阶段 2:两阶段移植恢复        阶段 3:验证流程
1. 初始声学微调               2. 分词器移植               3. 阶段 1:高学习率恢复
• 模型:Moonshine-Base (61.5M)   • 基础:21 轮微调编码器     • 基础:移植后架构
• 优化器:AdamW (η=2×10⁻⁵)      • 交换:BanglaBERT 词汇表移植  • 优化器:ScheduleFree AdamW (η=2×10⁻⁴)
• 结果:21 轮适应编码器         • 对齐:映射 ⟨CLS⟩→BOS, ⟨SEP⟩→EOS  • 结果:7 轮检查点
                               4. 阶段 2:稳定化            5. 自回归评估
                               • 基础:7 轮移植检查点       • 生成:束搜索 (宽度=4, 惩罚=1.2)
                               • 优化器:降低学习率 (η=2×10⁻⁵)  • 指标:贪心 WER (随机 64 子集)
                               • 更新:启用动态掩码        • 目标:基于最佳 WER 保存 (耐心=4)
提取 21 轮编码器 → 移植模型 → 7 轮检查点 → 逐轮评估

图 1:分词器移植方法论概览。

## 4 方法论

为了解决由高分词器密度引起的灾难性解码漂移,我们提出了一种新颖的三阶段适应流程。该方法不是从头开始训练模型,也不是在微调前替换词汇表(这通常会导致灾难性遗忘),而是明确地将声学表示学习与自回归语言建模解耦。在本节中,详细介绍了框架的顺序步骤:基础模型的初始声学适应、原生文字词汇表的手术式移植,以及旨在稳定新初始化解码器嵌入的专门恢复优化计划。

### 4.1 阶段 1:初始声学微调

我们的流程并非在任何训练之前就替换分词器(这通常会破坏预训练的对齐并 destabilize 网络),而是首先在孟加拉语数据集上对普通的 Moonshine-Base 模型进行 21 轮的微调。这使得编码器能够将其声学表示适应孟加拉语的语音。然而,尽管训练损失收敛了,但由于原始英语优化分词器产生的极端序列长度,解码器无法生成连贯的文本。

### 4.2 阶段 2:分词器移植

为了解决解码瓶颈,同时保留新学到的声学权重,我们对 21 轮微调模型执行分词器移植。原始解码器分词器被替换为 BUET BanglaBERT WordPiece 分词器 (Bhattacharjee 等人, 2022 (https://arxiv.org/html/2607.09598#bib.bib4))。解码器嵌入从原始词汇表大小 (V_old) 数学调整到孟加拉语目标词汇表 (V_new)。

特殊标记被明确重新映射以保持解码器兼容性(例如,将 BanglaBERT 的 ⟨CLS⟩ → BOS 和 ⟨SEP⟩ → EOS)。61.5M 参数的编码器架构保持不变,从而保留了阶段 1 学到的孟加拉语适应声学表示。

### 4.3 阶段 3:两阶段恢复优化

由于新的解码器嵌入是随机初始化的,而声学编码器已经微调,标准的优化会导致移植排斥和灾难性遗忘。为了稳定解码器适应,我们采用了如图 1 (https://arxiv.org/html/2607.09598#S3.F1) 所示的两阶段恢复微调方法:

阶段 1 (高学习率恢复):使用 ScheduleFree AdamW 优化器 (Defazio 等人, 2024 (https://arxiv.org/html/2607.09598#bib.bib6)) 应用激进的高初始学习率 (η=2×10⁻⁴)。这可以在 7 个轮次内迅速将新的文本嵌入与声学潜在空间对齐,而不会降低稳健的编码器权重。

阶段 2 (稳定化):从 7 轮检查点恢复训练,使用大幅衰减的学习率 (η=2×10⁻⁵) 来微调模型的语法和语音准确性。

为了最大化内存效率,在两个阶段都应用了 BF16 自动混合精度 (AMP)、梯度检查点和梯度累积 (步长 8),以实现有效批次大小为 32。

## 5 实验设置

所有模型适应和恢复微调计划均使用 PyTorch 实现,利用本地 NVIDIA GeForce RTX 4070 硬件加速器(12.9 GB VRAM)通过自动混合精度 (AMP) 和梯度检查点支持内存高效执行。转录评估、词错误率 (WER) 指标验证计算和实时因子 (RTF) 速度基准分析使用云托管的 Kaggle 环境执行。

### 5.1 数据集

实验使用 Lipi-Ghor-882 数据集 (Hasan 等人, 2026 (https://arxiv.org/html/2607.09598#bib.bib10)),这是一个 882 小时的多说话人孟加拉语语料库,来源于多样化的开源媒体。音频被归一化为 16kHz 单声道。使用 Pyannote (Bredin 等人, 2020 (https://arxiv.org/html/2607.09598#bib.bib5)) 通过语音活动检测 (VAD) 积极过滤静音段和非语音伪影。这建立在基础孟加拉语语音语料库(如 OOD-Speech (Faisal 等人, 2023 (https://arxiv.org/html/2607.09598#bib.bib9)) 和 Bengali Common Voice (Alam 等人, 2022 (https://arxiv.org/html/2607.09598#bib.bib1)))之上,提供了长语音、高度多样化的多说话人数据。

### 5.2 评估指标

转录质量使用词错误率 (WER) 和字符错误率 (CER) 评估,而推理效率使用实时因子 (RTF) 衡量。在训练期间,在每个轮次结束时,使用束搜索(宽度 = 4,重复惩罚 = 1.2)在随机化的 64 样本验证子集上监控贪心 WER。基于最佳 WER 触发早停,耐心值为 4 个轮次。

## 6 结果

### 6.1 缓解自回归崩溃

分词器移植显著减少了孟加拉语序列的分裂(表 1 (https://arxiv.org/html/2607.09598#S6.T1))。通过压缩标记表示,自回归解码变得显著更稳定,完全防止了基准中观察到的灾难性漂移。

表 1:分词器密度比较
| 分词器 | 密度 (Φ) |
| --- | --- |
| 原始 Moonshine (英语) | 9.16 |
| 移植的 BanglaBERT (孟加拉语) | 1.30 |

### 6.2 端到端 ASR 性能

为了评估分词器移植流程在现实世界中的有效性,我们将提出的模型与一系列零样本和微调基线在 5% 保留的 Lipi-Ghor 测试集(包含 5,931 个话语)上进行了比较。

如表 2 (https://arxiv.org/html/2607.09598#S6.T2) 所示,移植后的 Moonshine-Base 架构实现了极具竞争力的 21.54% 词错误率 (WER),显著优于零样本 Meta MMS 1B 和微调 Conformer 基线。

最值得注意的是,所提出的模型实现了 10.79% 的字符错误率 (CER),是所有测试架构中最低的。这表明,原生文字词汇表使解码器能够以比 Whisper 使用的字节回退方法更高的子词准确性构建形态复杂的孟加拉语单词。此外,这种准确性是在参数减少一个数量级的情况下实现的,以约 61.5M 的参数匹配了约 769M 参数的 Faster Whisper Medium 模型的性能。

表 2:在 Lipi-Ghor 测试集上的全局 ASR 性能比较。所提出的移植 Moonshine 模型实现了具有竞争力的 WER 和最低的 CER,同时使用的参数远少于 Whisper 和 Conformer 基线。
| 预训练策略 | 模型架构 | 参数 | WER (%) | CER (%) |
| --- | --- | --- | --- | --- |
| 零样本 | Seamless M4T-v2 | ~2.3B | 66.71 | 45.54 |
| 零样本 | OpenAI Whisper large-v3 | ~1.55B | 84.53 | 72.92 |
| 零样本 | Meta MMS 1B | ~1B | 43.06 | 21.16 |
| 零样本 | Hishab TITU Conformer Large | ~120M | 30.51 | 18.23 |
| 微调 | Conformer Baseline (fast-conformer) | ~120M | 24.67 | 15.56 |
| 微调 | Faster Whisper Medium (Tustugi) | ~769M | 21.28 | 11.18 |
| 提出的模型 | Moonshine Base (移植分词器) | ~61.5M | 21.54 | 10.79 |

### 6.3 推理效率与边缘可行性

见图注
图 2:效率前沿。所提出的模型(青色)在性能和效率之间取得了有利的权衡。

为了将所提出架构的计算效率置于背景中,我们将推理速度与在 DL Sprint 4.0 孟加拉语 ASR 竞赛 (Hasan 等人, 2026 (https://arxiv.org/html/2607.09598#bib.bib10)) 中评估的性能最佳基线进行了比较。基准测试基于竞赛中使用的 22 小时隐藏测试集。

如表 3 (https://arxiv.org/html/2607.09598#S6.T3) 所示,虽然标准架构如 Whisper-Medium 需要重度工程化的并行 CTranslate2 管道 (Klein 等人, 2017 (https://arxiv.org/html/2607.09598#bib.bib12)) 才能实现约 0.019 的实时因子 (RTF),但所提出的移植了 BanglaBERT 分词器的 Moonshine-Base 原生实现了 0.0053 的 RTF。

虽然原始的 vanilla Moonshine 模型处理 22 小时集花费的时间略少 (RTF ~0.0038),但它产生了接近 100% 的灾难性 WER (Hasan 等人, 2026 (https://arxiv.org/html/2607.09598#bib.bib10))。分词器移植略微增加了序列处理时间,这是由于准确的自回归生成,但成功挽救了模型的准确性,同时比高度优化的 Whisper 部署快 3.5 倍,比 Conformer 架构快 2.2 倍。

表 3:推理

相似文章

月光之味:面向边缘设备的小型专用ASR模型

Papers with Code Trending

本文介绍了“月光之味”(Flavors of Moonshine),一套面向边缘设备的小型专用ASR模型。作者证明,在人类标注、伪标注和合成数据的平衡混合上训练的单一语言模型,优于Whisper等更大的多语言模型,在小型模型中实现了最先进的错误率,并实现了对低资源语言的设备端ASR。

跨语言同形词的标记化

arXiv cs.CL

本文研究了多语言分词器如何处理跨语言同形词(不同语言中拼写相同但含义不同的词),并提出了一种轻量级的语言线索干预方法,通过引入语言特定字符来减少分词共享。实验表明,在机器翻译中,特别是在BPE分词下,该方法带来了适度的改进。