大型语言模型能否可靠地纠正低资源ASR中的错误?一项关于西弗里斯兰语的污染感知案例研究

arXiv cs.CL 论文

摘要

本文研究了基于LLM的生成式错误修正(GER)在低资源西弗里斯兰语ASR中的应用,采用污染感知评估方法,使用私有数据集表明GPT-5.1将错误降低至低于oracle水平。

arXiv:2605.19711v1 公告类型:新 摘要:自动语音识别(ASR)近年来取得了显著进步,但在低资源语言上的性能仍然有限。大型语言模型(LLM)通过生成式错误修正(GER)在改进ASR方面展现出潜力,但其在低资源环境中的有效性尚未得到充分探索。此外,数据污染在多大程度上影响基于LLM的GER所报告的性能提升仍不清楚。本研究探讨了基于LLM的GER在低资源弗里斯兰语中的应用。除了公开语料库外,我们还构建并使用了一个包含非公开文本的弗里斯兰语离线数据集进行评估,以控制潜在的数据污染。结果表明,GER在大多数设置下提升了ASR性能,最佳GPT-5.1结果甚至超过了oracle WER。离线数据集上的类似增益表明这些改进反映了真实的纠正能力。我们还提供了详细的错误分析,揭示了模型修正的模式。
查看原文
查看缓存全文

缓存时间: 2026/05/20 08:26

# 大语言模型能否可靠纠正低资源语音识别的错误?——一项针对西弗里斯兰语的污染感知案例研究

来源:https://arxiv.org/html/2605.19711  
Hao Amooie de Vries van Noord Wieling

###### 摘要

近年来,自动语音识别(ASR)取得了显著进步,但低资源语言的性能仍然有限。大语言模型(LLM)通过生成式错误纠正(GER)展现出改善ASR的潜力,但其在低资源场景下的有效性仍有待探索。此外,数据污染在多大程度上影响了基于LLM的GER所报告的性能提升,目前尚不清楚。

本研究针对低资源弗里斯兰语,探究基于LLM的GER方法。除了一个公开语料库,我们还构建并使用了包含非公开文本的弗里斯兰语离线数据集进行评测,以控制潜在的数据污染。结果表明,在大多数设置下,GER都能提升ASR性能,其中GPT-5.1的最佳结果甚至超过了Oracle词错误率(WER)。在离线数据集上观察到的类似性能提升表明,改进反映了真实的纠错能力。我们还提供了详细的错误分析,揭示了模型的纠正模式。

###### 关键词:

自动语音识别,低资源语言,大语言模型,生成式错误纠正,数据污染

## 1 引言

近年来,自动语音识别(ASR)取得了显著进展,在识别准确率和鲁棒性方面都有大幅提升。多语言自监督和弱监督语音模型,包括XLS-R [babu22_interspeech] 和 Whisper [radford2023robust],在改善ASR性能(尤其是低资源语言)方面发挥了核心作用。尽管取得了这些进展,但对于转录语音数据非常稀缺或说话人数量较少的语言,识别准确率仍然有限 [bartelds2023making, yong25_interspeech]。

传统方法通常通过将声学模型与语言模型(LM)结合来改善ASR性能,无论是在解码过程中,还是通过对N-best ASR假设进行重打分。最近,随着大语言模型(LLM)的快速发展,研究人员开始探索生成式错误纠正(GER)作为ASR输出的一种更好的后处理策略。GER不是从现有假设中选择,而是根据ASR输出直接生成修正后的转录,因此能够做出超越原始解码空间约束的修正。这种方法在高资源语言(尤其是英语)中已展现出显著效果 [ma2023can, yang2023generative, chen2023hyporadise, yamashita25_interspeech]。然而,基于LLM的GER的效果能否推广到低资源语言,目前仍不清楚。GER的成功很大程度上依赖于LLM中编码的语言特定知识,包括词汇覆盖率和句法建模能力。这些知识在不同语言间可能无法均匀迁移,尤其是在预训练数据稀缺的情况下。

将LLM应用于ASR错误纠正时的另一个重要问题是数据污染。评测数据可能与LLM预训练期间见过的文本重叠,从而导致对性能的高估。这个问题对于低资源语言尤为突出,因为公开可用的文本有限,且通常集中在少数广泛使用的来源中。因此,在公开数据集上观察到的性能提升可能部分反映了记忆化,而非真正的错误纠正能力。这就需要对低资源ASR中基于LLM的GER进行精心的污染感知评估。

受这些挑战的驱动,本研究探讨了在低资源ASR中使用LLM进行GER的可能性,重点关注西弗里斯兰语——一种在荷兰北部约40万说话人使用的语言。除了开源Common Voice数据集 [ardila2020common],我们还专门构建了一个包含非公开文本的新语音数据集进行评估,以考虑数据污染的影响。具体而言,我们旨在回答以下研究问题:¹¹我们方法的整体流程见图1(https://arxiv.org/html/2605.19711#S2.F1)。

-   • RQ1:在低资源语言环境下,大语言模型在多大程度上能够通过生成式错误纠正改善ASR性能?
-   • RQ2:基于LLM的生成式错误纠正的有效性在公开基准测试和不涉及数据污染的非公开数据集上是否存在差异?

## 2 相关工作

### 2.1 基于LLM的生成式错误纠正

Ma等人 [ma2023can] 首次证明,生成式LLM(如ChatGPT)能够通过零样本和少样本提示,以N-best假设作为输入,有效纠正ASR输出。Chen等人 [chen2023hyporadise] 提出了HyPoradise,这是一个开放基准测试,提供大规模N-best假设及其对应的参考转录,以促进基于LLM的英语GER的系统评估。Yang等人 [yang2023generative] 证明,通过基于指令和任务激活的提示,LLM在重打分方面可以匹敌领域调优的语言模型,甚至在结合微调时还能超过N-best Oracle。Naderi等人 [naderi24_interspeech] 提出了一系列置信度过滤方法,以减轻GER中的过度纠正问题。

虽然早期研究主要关注英语和其他高资源语言,但近期工作已开始将基于LLM的错误纠正扩展到多语言和低资源场景。Li等人 [li2024investigating] 研究了跨20种语言的多语言单最佳假设纠正,Yang等人 [yang2025covoger] 提出了CoVoGER,这是一个涵盖15种语言的多语言多任务基准,用于语音到文本的生成式错误纠正。Xu等人 [xu25g_interspeech] 探索了使用LLM纠正低资源对话式儿童语音的ASR错误。然而,现有研究很少探讨低资源语言中基于LLM的GER中的数据污染问题。与先前工作不同,我们通过构建一个使用非公开文本资源的数据集,明确研究了数据污染的潜在影响。此外,我们还提供了不同错误类型下纠正行为的详细分析,以更好地理解基于LLM的GER如何改善低资源ASR输出。

### 2.2 大语言模型中的数据污染

数据污染指的是语言模型在训练期间已接触到评测基准的情况,这可能导致对性能的高估,不能反映LLM的真实泛化能力 [sainz-etal-2023-nlp]。这已成为LLM评估中的一个核心问题,尤其是对于广泛使用的NLP基准 [li2024open, deng2024investigating, chen2025benchmarking]。在语音处理领域,Ma等人 [ma2025asr] 通过数据污染测验检查了GPT-3.5和GPT-4,并发现基于LibriSpeech和TED-LIUM3的GPT-4中存在可测量的污染迹象。然而,正如Balloccu等人 [balloccu2024leak] 所指出的,对于GPT-4这类闭源模型,直接进行污染检测可能并不可靠,因为这些系统采用了防止逐字复现训练数据的机制,从而掩盖了潜在的记忆化效应。此外,数据污染的可能性受到公开可用文本的分布和重复使用的影响。对于低资源语言,文本资源通常稀缺,且来自一组有限的、广泛重复使用的来源,这增加了数据污染的概率。

Xu等人 [xu2024benchmark] 对基准数据污染进行了系统性调查,并概述了缓解策略,强调在预训练数据透明度不可用时,策划新的评估数据集是一种实用的解决方案。为了更有效地控制潜在的数据污染,我们构建了一个包含非公开文本内容的新语音数据集。这使得我们能够更可靠地评估基于LLM的GER在低资源语言中的泛化能力。

请参见图注图 1:基于LLM的生成式错误纠正系统流程。请注意,本文中使用N=5。

## 3 方法

### 3.1 数据集

Common Voice 17.0Common Voice语料库 [ardila2020common] 是一个大规模多语言的转录语音集合,用于语音技术研究和开发。Common Voice中的文本主要来源于公开可用的来源,特别是维基百科文章,并由社区提交的句子补充,这些句子经过志愿者验证。我们采用Common Voice发布中提供的官方数据划分。弗里斯兰语训练集包含来自195位说话人的3,921条语音(5.5小时),验证集包含来自271位说话人的3,170条语音(4.6小时),测试集包含来自904位说话人的3,171条语音(4.7小时)。

弗里斯兰语离线数据集为了实现污染感知评估,我们基于非公开文本提示构建了一个新的语音数据集。²²数据收集方案已得到我们研究所研究伦理委员会的审查和批准。文本材料由两部分组成。第一部分来自一本弗里斯兰语故事书的103个句子,我们验证了该书的电子版在网上不可获取。第二部分是由一位母语为弗里斯兰语的说话人专门为本研究编写的100个原创句子。语音录音在我们大学的一个隔音语音实验室中使用头戴式麦克风进行。音频以44.1 kHz采样率、16位分辨率进行单声道录制。四位男性母语弗里斯兰语说话人参与了录音。最终数据集包含811条语音,总计1.5小时的语音。

### 3.2 ASR模型

我们采用XLS-R 1B模型 [babu22_interspeech] 作为ASR骨干网络。³³在初步实验中,我们比较了包括Whisper和MMS在内的几种预训练语音模型,发现XLS-R在弗里斯兰语上表现最佳。XLS-R是一个基于wav2vec 2.0 [baevski2020wav2vec] 的大规模跨语言自监督语音模型,在约436,000小时的覆盖128种语言的语音数据上进行了预训练。我们使用连接主义时间分类(CTC)目标,在Common Voice弗里斯兰语训练集上对XLS-R进行了2,000步的微调。在微调过程中,我们冻结了特征提取器,并更新了Transformer编码器层。模型训练的有效批次大小为64,学习率为5e-5,权重衰减为5e-5。

### 3.3 大语言模型

我们通过API访问,使用GPT-4o-mini和GPT-5.1(不启用推理)作为闭源商业模型。我们还使用了开源模型Qwen3-8B(不启用推理),包括其原始预训练形式以及在Common Voice弗里斯兰语训练集上进行微调的形式。⁴⁴在初步实验中,我们还评估了其他开源LLM,包括Qwen2.5-7B-Instruct和Meta-Llama-3-8B-Instruct。在开源LLM中,Qwen3-8B取得了最佳性能,因此被选用于后续实验。对于微调,我们使用XLS-R模型为每条训练语音生成五个最佳假设。模型输入由零样本提示和这些假设组成,参考转录作为训练目标。我们对注意力和前馈投影层应用了低秩适应(LoRA),秩r=16,α=32,dropout=0.05。我们训练了3个epoch,有效批次大小为16。

### 3.4 基于LLM的生成式错误纠正

对于每条语音,我们使用波束搜索解码(波束宽度=50)从微调后的XLS-R模型中提取五最佳列表。这些假设被提供给LLM,LLM被指示作为弗里斯兰语专家,并提供最终的纠正转录(见图2 (https://arxiv.org/html/2605.19711#S3.F2))。在k-shot(k=1,3,5,10)设置中,我们还额外从Common Voice验证集中添加k个纠正示例,以引导模型的行为。我们还纳入了一种基于选择的方法作为比较,即提示模型从ASR的五最佳列表中选择最佳候选并输出相应的索引。

请参见图注图 2:用于生成式错误纠正系统的提示模板。

我们使用词错误率(WER)评估性能,以XLS-R的单最佳预测作为ASR基线。我们还报告了五最佳Oracle WER,定义为从五最佳列表中选择最接近参考的假设所能达到的最小WER。此外,我们使用在Common Voice弗里斯兰语训练集上训练的三元语言模型纳入解码过程,作为传统的LM基线。表1 (https://arxiv.org/html/2605.19711#S3.T1) 展示了不同方法进行ASR错误纠正的一个例句。它表明LLM不受N-best列表的限制,可以自由纠正最佳示例中未出现的错误。

表 1:来自Common Voice测试数据集的一个例句。与参考不同的词元用红色标出,正确纠正的词元用绿色标出。符号(*)表示基于选择的GPT-5.1方法选择的假设。

| | 参考译文 | 信息说明会上大约只有二十个人。 |
|---|---|---|
| | N-best 1 (*) | dewinematsa'n tweintich minsken op deynformaasjejûn |
| | N-best 2 | dewinemoatsa'n tweintich minsken op deynformaasjejûn |
| | N-best 3 | dewienematsa'n tweintich minsken op deynformaasjejûn |
| | N-best 4 | dewienemoatsa'n tweintich minsken op deynformaasjejûn |
| | N-best 5 | dewinehatsa'n tweintich minsken op deynformaasjejûn |
| | 三元语言模型 | dewienemoatsa'n tweintich minsken op deynformaasjejûn |
| | GPT-5.1 | derwienemarsa'n tweintich minsken op deynformaasjejûn |

表 2:Common Voice弗里斯兰语测试集上的生成式和基于选择的错误纠正WER (%) 结果。零样本到10样本的WER基于生成式方法。红色数字表示性能低于XLS-R基线,绿色数字表示性能超过基于XLS-R的五最佳Oracle,黑色数字表示相对于基线有改进但未超过Oracle。

| | 基线WER (%) | | | | | |
|---|---|---|---|---|---|---|
| | XLS-R | 13.5 | | | | |
| | - oracle | 9.6 | | | | |
| | - trigram | 12.1 | | | | |
| LLM | 选择方法 | 0-shot | 1-shot | 3-shot | 5-shot | 10-shot |
| Qwen3 | 14.7 | 14.4 | 14.1 | 13.8 | 13.9 | 13.9 |
| Qwen3-FT | 13.5 | 13.5 | 13.5 | 13.4 | 13.5 | 13.4 |
| GPT-4o-mini | 12.8 | 12.5 | 12.4 | 12.2 | 12.5 | 12.4 |
| GPT-5.1 | 12.1 | 10.1 | 9.5 | 8.9 | 8.9 | 9.0 |

## 4 结果与讨论

Common Voice测试数据集表2 (https://arxiv.org/html/2605.19711#S3.T2) 展示了Common Voice测试数据集的WER结果。我们观察到,除了原始(未微调)的Qwen3模型之外,所有LLM都优于基线XLS-R系统。即使在LoRA微调和提供示例之后,Qwen3-FT也只取得了微小的改进(13.4%),表明其纠正能力有限。毫不意外,GPT-5.1在所有模型中取得了最佳结果。在生成式设置下,它显著优于三元基线模型和五最佳Oracle,在3-shot提示下达到了最低WER 8.9%。值得注意的是,基于选择的方法仅达到12.1%的WER,远低于Oracle WER。这证明了从固定的五最佳列表中选择的固有限制,而GER能够超越假设空间,生成原始波束输出中不存在的改进转录。关于少样本。

相似文章

LLMs中特征特定错误纠正的证据

arXiv cs.LG

本文为大型语言模型中的特征特定错误纠正提供了首个实证证据,表明残差流激活对小扰动具有鲁棒性,但在候选特征方向上鲁棒性较弱,支持了叠加计算理论。

大语言模型在低资源语言人文学科研究中的机遇与挑战

arXiv cs.CL

本文系统评估了大语言模型在低资源语言研究中的应用,分析了在语言变异、历史文献、文化表达和文学分析等方面的机遇与挑战。研究强调了跨学科合作和定制化模型开发,以保护语言和文化遗产,同时解决数据可获取性、模型适应性和文化敏感性问题。

语言再生:信息局部性对重建影响的探究

arXiv cs.CL

本文研究了在不可能语言(信息局部性被破坏)上预训练的GPT-2模型如何恢复自然英语,显示出对更短依赖长度的偏好以及结构恢复与表层恢复之间的分离。

大型语言模型有多像人类?一个关注语域的语言评估框架

arXiv cs.CL

本文提出了一种关注语域的语言评估框架,通过使用最大均值差异(MMD)比较人类与LLM生成文本中67个词汇语法特征的分布,来评估大型语言模型(LLM)的人类相似度。在七个经过指令微调的开源模型和五个语域上的实验表明,没有模型能完美匹配人类基线,且与人类语言的接近程度因语域而异,而非模型规模。