翻译作为计算高效的桥梁:英语BERT用于低资源语言的可行性

arXiv cs.CL 论文

摘要

本文探讨了基于翻译的微调作为低资源语言本地语言BERT模型的资源高效替代方案的可行性,发现在六项NLP任务中,53.3%的情况下其性能相当或更优。

arXiv:2607.12612v1 Announce Type: new Abstract: BERT模型通过处理跨多个领域的非结构化文本,彻底改变了自然语言处理(NLP)。然而,由于标注数据有限且计算需求高,为非英语语言开发高质量的BERT模型仍然具有挑战性。将非英语数据翻译成英语并对现有英语BERT模型进行微调提供了一种资源高效的替代方案,但很少有研究系统地比较基于翻译的微调与本地语言BERT在不同任务和语言上的性能。本研究提供了这样的比较,评估了基于翻译的微调在六项NLP任务中的可行性:情感分析、仇恨言论检测、问答、命名实体识别、词性标注和自然语言推理,使用从保加利亚语、中文、荷兰语、意大利语和俄语翻译而来的数据集。在所有设置中,基于翻译的方法在53.3%的情况下表现相当或更优。在问答、词性标注和自然语言推理任务中性能提升最为常见,而在命名实体识别和仇恨言论检测中性能下降较为普遍。结果表明,基于翻译的微调对于依赖句法或结构模式的任务以及类型学上接近英语的语言(如荷兰语)最为有效,但对于词元级或文化细微差别的任务(尤其是中文)效果较差。总体而言,本研究表明,基于翻译的微调提供了一条可扩展、资源高效且经过实证验证的路径,可将NLP扩展到低资源语言,同时促进人工智能中的语言包容性和可持续性。
查看原文
查看缓存全文

缓存时间: 2026/07/15 04:22

### 翻译作为计算高效的桥梁:英语BERT用于低资源语言的可行性  
来源:https://arxiv.org/html/2607.12612  

\[type=editor, auid=000,bioid=1, orcid=0009\-0002\-3593\-7824\]\\cormark\[1\]\\credit{概念化、方法论、项目管理与监督、资源、初稿撰写、审阅与编辑}
1\]organization=莱顿大学医学中心公共卫生与初级保健系, addressline=Albinusdreef 2, city=莱顿, postcode=2333ZA, country=荷兰
\[type=editor, auid=000,bioid=1\]\\credit{数据整理、方法论、软件、实验、结果验证、可视化、审阅与编辑}
2\]organization=莱顿大学LIACS, addressline=P.O. Box 9512, city=莱顿, postcode=2300RA, country=荷兰
\[type=editor, auid=000,bioid=1, orcid=0000\-0002\-9237\-221X\]\\credit{概念化、项目管理与监督、资源、审阅与编辑}
\[type=editor, auid=000,bioid=1, orcid=0000\-0003\-2581\-8370\]\\credit{概念化、方法论、项目管理与监督、资源、审阅与编辑}
Giulia Rivetti  
[email protected]  
\[Marco Spruit  
[email protected]  
Marcel Haas  
[email protected]  

###### 摘要  
BERT模型凭借其处理跨领域非结构化文本的能力,彻底革新了自然语言处理(NLP)。然而,为非英语语言开发高质量的BERT模型仍然充满挑战,原因在于标注数据有限且计算需求高昂。将非英语数据翻译成英语,并微调已有的英语BERT模型,提供了一种资源高效的替代方案,但很少有研究系统地比较基于翻译的微调与原生语言BERT在不同任务和语言上的表现。本研究提供了这样的比较,评估了基于翻译的微调在六项NLP任务中的可行性:情感分析、仇恨言论检测、问答、命名实体识别、词性标注和自然语言推理,使用了从保加利亚语、中文、荷兰语、意大利语和俄语翻译而来的数据集。在所有设置中,基于翻译的方法在53.3%的案例中表现相当或更优。在问答、词性标注和自然语言推理任务中,性能提升最为常见,而在命名实体识别和仇恨言论检测中,性能下降较为普遍。结果表明,基于翻译的微调最适用于依赖句法或结构模式的任务,以及对于在类型上接近英语的语言(如荷兰语)最为有效,但对于词元级或文化细微任务(尤其是中文)效果较差。总体而言,本研究证明了基于翻译的微调为将NLP扩展到低资源语言提供了一条可扩展、资源高效且经实证验证的路径,同时推动了人工智能中的语言包容性和可持续性。  

###### 关键词:机器翻译 \\sep 多语言NLP \\sep 低资源语言 \\sep BERT \\sep 翻译-训练  

## 1 引言  

近年来,自然语言处理(NLP)的进步彻底改变了机器处理、理解和生成人类语言的方式。这一进展主要由基于Transformer的架构推动,始于如BERT(来自Transformer的双向编码器表示)\[bert\]等模型,这些模型在广泛的NLP任务中树立了新标准。后续模型,包括RoBERTa\[roberta\]、XLM-R\[xlmr\]以及更近期的大型语言模型(LLM)\[cit\_llmsurvey, cit\_gptsurvey, cit\_gpt4\],进一步推动了前沿发展。然而,这些进展在不同语言之间仍然分布不均。英语及少数其他高资源语言受益于丰富的标注数据和大型语料库,而许多语言在NLP研究和工具中仍然代表性不足。这种不平衡给多语言NLP带来了实际挑战:研究者和从业者必须决定是开发或微调特定语言模型、依赖多语言编码器、通过提示使用生成式LLM,还是将数据翻译成高资源语言并应用成熟的英语模型。每种策略都涉及权衡。特定语言模型可能提供强性能,但需要合适的语料库、标注数据和计算资源\[joshi, ct144, cit\_energy\]。多语言编码器如mBERT、XLM-R和mDeBERTa提供了更广的覆盖范围,但可能对特定语言、领域或任务表现不佳\[ct144, ct47, litschko\]。生成式LLM日益支持多语言的零样本和少样本推理,包括跨语言迁移到多种任务和语言\[lin2022fewshot, asai2024buffet\]。然而,其使用也引发了与实际成本、访问限制、可重复性、提示敏感性和结构化输出可靠性相关的实践和方法论问题,尤其是在命名实体识别等词元级任务中\[bommasani2021foundation, ji2023vicunaner, polo2024prompteval, sivarajkumar2024prompting, shorten2024structuredrag, lu2024tokenlevelner\]。因此,基于翻译的微调仍然是一种相关且资源高效的替代方案,但其在不同语言和NLP任务中的可靠性仍未被充分刻画。  

低资源NLP中的一个核心障碍是缺乏用于监督学习的标注数据集。Joshi等人指出,许多语言几乎没有或根本没有数字存在,这使得构建稳健的NLP系统极具挑战性\[joshi\]。问题不仅限于罕见语言:即使像西班牙语和俄语这样使用广泛的语言,在特定领域(包括生物医学NLP和社交媒体情感分析)也存在缺口\[ct17, ct14, ct16, ct65\]。形态丰富且结构复杂的语言,包括土耳其语\[ct109\]、泰语\[ct67, ct56\]和阿姆哈拉语\[ct149\],进一步使跨语言迁移和预训练复杂化,因为现有模型难以捕捉其语言特征。这些挑战在不同语系之间也有所不同,因为与英语的类型学距离通常会降低迁移效果。诸如mBERT等多语言模型已被提出以缓解这些限制,但其性能对于真正代表性不足的语言往往次优。Wu和Dredze表明,mBERT在训练数据极少的语言上性能急剧下降\[ct144\]。即使是为这些语言构建的单语模型,在没有广泛预训练或领域特定语料库的情况下,也常常无法达到有竞争力的准确率\[ct72\]。在意图检测和槽填充等任务中,情况进一步复杂化,因为数据标注仍然昂贵且不一致\[ct112\]。更近期的多语言编码器和指令微调LLM改善了跨语言能力,但并未消除对何时更简单的基于编码器的翻译流程仍具竞争力的理解需求,尤其是在本地执行、可重复性和有限计算资源是关键约束的场景中。  

从头开始训练特定语言的BERT模型是一种解决方案,但这非常消耗资源,需要大量的计算能力、专用硬件和用于预训练的非常大的原始文本语料库\[cit\_costnlp, cit\_energy, cit\_extremebert\]。为了应对这些挑战,越来越多的研究探索了使用机器翻译的潜力。通过将低资源语言的文本翻译成英语,研究者可以利用如BERT等成熟的英语模型。这种方法在多项NLP任务中显示出令人鼓舞的结果,表明它可能作为开发特定语言模型的实用替代方案。对于情感分析,Balahur等人表明,机器翻译语料库的准确率在原生语言模型的8%以内,显示了这种方法的可行性\[ct10\]。Refaee和Rieser进一步表明,使用英语情感工具分析翻译后的阿拉伯语推文可以超越原生基线,说明英语资源可以扩展以支持代表性不足的语言\[ct106\]。类似地,Muizelaar等人证明,将荷兰语临床文本翻译成英语并微调预训练的英语临床BERT模型,在生活方式相关文本分类任务上表现与荷兰语临床BERT相当或更优\[muiz\]。  

同时,翻译可能引入影响下游性能的错误。生成性和词汇对齐任务尤其容易受到翻译错误的影响。例如,Meng等人观察到,从机器翻译中推导出的双语情感词典常常受到覆盖范围有限和歧义性的困扰\[ct77\]。在生物医学NLP中,Dorendahl等人发现,将MetaMap等英语工具应用于机器翻译后的德语文本会产生次优结果\[ct30\]。即使是基于翻译的数据集增强也可能失败:Demirtas等人表明,翻译引起的不准确性阻止了情感分类中的性能提升\[ct26\]。近期关于基于LLM的机器翻译的工作进一步表明,翻译质量可能强烈依赖于推理设置、提示策略和语言方向\[ctpeng, ctzhang, ctfarinhas\]。这些发现强调,翻译不应被视为一个中性的预处理步骤:翻译伪影、幻觉、偏离目标的输出、遗漏和对齐损失都会影响下游NLP性能。  

尽管生成式LLM为多语言NLP提供了强大的替代方案,但它们与本研究所评估的实验场景不同。本研究聚焦于多语言NLP中的一个常见用例:将监督式编码器模型应用于非英语和低资源语言的大文本体。在此设置中,训练数据、标签、分词和评估指标可以在不同语言和任务之间保持一致,从而能够对基于翻译的微调与特定语言BERT模型进行受控比较。相比之下,LLM提示引入了额外的变异源,包括提示设计、解码参数、模型访问、模型版本、输出格式控制,以及每词元或基于API的推理成本,这些成本在处理大量文本时可能变得相当可观。这些问题对于结构化任务尤其相关,在这些任务中,预测必须与词元或跨度级别的标注对齐,而非自由形式的文本。因此,我们将基于LLM的提示视为一种互补策略,而非本研究的直接比较对象。相反,我们要问的是,在什么条件下,一个开源的翻译-训练流程可以提供一个可行的替代方案。通过评估一个透明、可本地执行且可重复的基于编码器的策略,本研究旨在解决需要处理大量文本或标注数据、计算资源以及访问商业或非常大模型受限的场景。  

尽管以往的研究提供了有价值的信息,但大多数集中于狭窄的用例或单语言评估,留下了关于基于翻译的微调在不同语系和NLP任务类型中表现如何的未解问题。特别是,句子级任务(如情感分析、仇恨言论检测和自然语言推理)可能受翻译影响较小,而词元级任务(如命名实体识别和词性标注)中,翻译后词元边界和标签对齐可能发生变化,影响较大。类似地,类型学上更接近英语的语言可能比结构上遥远的语言从翻译中获益更多,尽管数据集质量和任务设计也可能影响性能。我们研究是否将来自多个语系的数据集翻译成英语并微调预训练的英语BERT模型,可以为保加利亚语、中文、荷兰语、意大利语和俄语提供与特定语言BERT模型相当或更好的性能。选择这些语言是为了代表不同的语系和类型学特征:斯拉夫语(保加利亚语、俄语)、日耳曼语(荷兰语)、罗曼语(意大利语)和汉藏语系(中文)。为了捕捉广泛的NLP挑战,我们评估了六项任务:情感分析(SA)、仇恨言论检测(HSD)、自然语言推理(NLI)、问答(QA)、命名实体识别(NER)和词性标注(POS)。由于词元级任务对翻译引起的对齐损失特别敏感,我们将POS和NER结果与句子级分类和推理任务分开解释,并明确讨论由自动重新标注或对齐程序引入的局限性。  

本研究的贡献有三方面。第一,我们提供了一个使用OPUS-MT和英语BERT的开源翻译-训练流程的多任务、多语言基准。第二,我们分析了该流程的成功如何随任务类型变化,区分了相对稳健于翻译的句子级任务和更易受对齐损失影响的词元级任务。第三,我们考察了五种类型学多样语言的跨语言模式,展示了基于翻译的性能如何依赖于语言邻近性、数据集特征、任务敏感性和翻译保真度之间的相互作用。  

## 2 方法  

### 2.1 数据  

在本节中,我们概述所使用的数据集,并概述手头任务所需的预处理步骤。  

#### 2.1.1 数据集选择  

数据集的选择对于确保跨任务和语言的公平且具有代表性的评估至关重要。在本研究中,我们根据数据集的大小、结构以及关于其创建和预期用途的详细文档可得性来选择数据集。尽可能依赖已有的广泛使用的资源,以促进与先前工作的可比性并确保可重复性。对于词性标注和命名实体识别,我们使用来自XTREME(多语言编码器的跨语言迁移评估)基准的数据集\[ct47\]。XTREME是评估多语言NLP模型最广泛采用的资源之一,覆盖多种任务和语言。其POS和NER数据集特别适合我们的研究,因为它们适用于所有五种考虑的语言(保加利亚语、中文、荷兰语、意大利语和俄语),并且已经过预处理和标准化以便跨语言比较。使用XTREME确保我们的评估既跨语言一致,又与之前的跨语言研究直接可比。对于其余任务:SA、HSD、QA和NLI,我们为每种语言单独选择数据集,优先考虑可用性、在文献中的先前使用以及是否适合微调Transformer模型。所有选定数据集的概览见表1(https://arxiv.org/html/2607.12612#S2.T1),该表报告了每项任务和语言的行数。其他细节,包括分类任务的标签分布,见附录A。  

| 任务 | 荷兰语 | 意大利语 | 保加利亚语 | 俄语 | 中文 |
|------|--------|----------|------------|------|------|
| POS  | Alpino \[D1\] (208,747) | PoSTWITA-UD \[I1\] (129,668) | UD Bulgarian-BTB \[B1\] (156,149) | Taiga \[R1\] (197,001) | UD Chinese-GSD \[C1\] (123,291) |
| NER  |

相似文章

低资源Tangkhul-英语神经机器翻译

arXiv cs.CL

介绍了一个针对严重资源匮乏的Tangkhul-英语语言对的神经机器翻译系统,通过微调ByT5-large和mT5-small模型,在BLEU、chrF++、BERTScore和COMET评分上取得了优异成绩。

翻译作为数据增强:翻译数据对难度评估的影响

arXiv cs.CL

本文提出了一种跨语言数据增强策略,利用机器翻译将专家标注的难度标签从高资源语言迁移到低资源语言。基于BERT的回归模型实验表明,用翻译语料库增强稀缺的本土数据显著提高了文本难度评估的准确性。

基于循环一致性机器翻译的多语言共指消解

arXiv cs.CL

本文提出了一种新的多语言共指消解流水线,利用从英语到低资源语言的循环一致性机器翻译生成训练数据,并通过反向翻译和BERT相似性进行验证。在四种低资源语言上的实验表明,该方法带来了显著的性能提升,使得在没有现有语料库的语言中也能实现准确的共指消解。

利用双语微调与语言识别改进低资源ASR:一项跨语言评估

arXiv cs.CL

本研究评估了使用语言识别令牌进行双语微调以改进低资源语言ASR的方法,涉及九个多样化的语言对。结果发现,高语言识别准确率是有益的,而在语言识别准确率低的情况下,在推理时提供语言识别令牌可以提升性能。