提升科学论述:科学领域的机器翻译

arXiv cs.CL 论文

摘要

本文介绍了针对西班牙语-英语、法语-英语和葡萄牙语-英语的科学机器翻译平行语料库和单语语料库的开发,涉及四个领域:癌症研究、能源研究、神经科学和交通运输。这些语料库用于微调神经机器翻译系统,以解决科学文本中专业词汇和句法带来的挑战。

arXiv:2605.20912v1 公告类型:新提交 摘要:科学研究数量的不断增长需要有效的跨语言交流。机器翻译(MT)为访问国际出版物提供了一种有前景的解决方案。然而,科学领域因其专业词汇和复杂句式而面临独特挑战。本文介绍了面向科学领域的一系列平行语料库和单语语料库的开发。这些语料库针对西班牙语-英语、法语-英语和葡萄牙语-英语语言对。对于每个语言对,我们创建了一个大型通用科学语料库以及四个专注于以下领域的较小语料库:癌症研究、能源研究、神经科学和交通运输研究。为了评估这些语料库的质量,我们利用它们对通用神经机器翻译(NMT)系统进行微调。我们提供了关于语料库创建过程、微调策略的细节,并以评估结果作为结论。
查看原文
查看缓存全文

缓存时间: 2026/05/21 06:36

# 提升科学话语:面向科学领域的机器翻译

来源:https://arxiv.org/html/2605.20912  
Dimitris Roussis, Sokratis Sofianopoulos, Stelios Piperidis  

语言与语音处理研究所,雅典 RC 研究中心,Artemidos 6 & Epidavrou,希腊,雅典  
\{dimitris\.roussis, s\_sofian, spip\}@athenarc\.gr  

###### 摘要

科学研究数量的日益增长,迫切需要有效的沟通来跨越语言障碍。机器翻译(MT)为获取国际出版物提供了一种有前景的解决方案。然而,科学领域因其专业词汇和复杂句式而面临独特挑战。本文介绍了一套面向科学领域的平行语料库和单语语料库的开发。这些语料库针对西班牙语-英语、法语-英语和葡萄牙语-英语语言对。针对每个语言对,我们创建了一个大型通用科学语料库,以及四个专注于以下领域的小型语料库:癌症研究、能源研究、神经科学和交通研究。为了评估这些语料库的质量,我们利用它们对通用神经机器翻译(NMT)系统进行微调。我们详细介绍了语料库的创建过程、所采用的微调策略,并最后给出了评估结果。

## 1 引言

跨学科科学研究的增长,加剧了对高效沟通和跨越语言障碍的国际合作的需求。尽管英语是科学出版物的主导语言[1 (https://arxiv.org/html/2605.20912#bib.bib17)],但仍有大量有价值的学术工作以其他语言产出。根据 2019 年的一项研究[21 (https://arxiv.org/html/2605.20912#bib.bib27)],近 40% 的非英语母语研究人员的文章是以英语以外的语言提交的[1 (https://arxiv.org/html/2605.20912#bib.bib17)]。机器翻译(MT)提供了一个引人注目的解决方案,能够获取大量国际研究成果,并促进全球研究人员之间的无缝协作。

神经机器翻译的进步显著提高了多个领域的翻译质量,这在很大程度上得益于 Transformer 架构的应用[25 (https://arxiv.org/html/2605.20912#bib.bib15)]。Transformer 通过实现整个序列的高效并行处理,彻底改变了 NMT,从而在翻译质量和流畅度上取得了显著提升。然而,当翻译专业领域时,由于特定术语和句式的存在,NMT 模型的表现常常受到影响。科学文本的翻译面临着与通用语言翻译不同的独特挑战[5 (https://arxiv.org/html/2605.20912#bib.bib18)]。科学领域的特点是:

- **专业词汇**:这些领域使用了丰富的技术术语和缩略语,而这些通常不在通用语言语料库中出现。
- **句法复杂性**:科学写作经常使用复杂的句子结构来表达精确的关系和微妙的含义。
- **领域特定话语**:每个科学领域都有其独特的话语模式和惯例,准确理解这些对于进行正确的翻译至关重要。
- **不确定性**:科学领域细分为众多子学科,以及跨学科工作的存在,使得定义科学领域所涵盖的内容更加复杂。

这些因素会严重损害通用 NMT 模型的性能,导致误译或科学意义的丢失。

为了应对这些挑战,本文介绍了针对科学研究的领域特定语料库的开发,并将其应用于为四个学术领域创建 NMT 模型。我们旨在使用表现最佳的开源通用 NMT 模型作为基础模型,并在此基础上使用这些领域特定语料库进行微调,以实现不仅流畅,而且准确且忠实于科学内容的翻译。我们专注于西班牙语-英语(ES–EN)、法语-英语(FR–EN)和葡萄牙语-英语(PT–EN)的翻译方向,为每个方向创建了平行语料库,以及相应语言(即英语、西班牙语、法语和葡萄牙语)的单语语料库。我们的语料库包括一个大型通用科学语料库和专门针对以下研究领域的小型子语料库:

- 癌症研究
- 能源研究
- 神经科学
- 交通研究

我们首先介绍数据集创建过程,该过程利用了来自学士和硕士论文、博士论文以及其他科学出版物(如已出版书籍和文章)的丰富平行标题和摘要。接着,我们概述了使用上述数据集微调预训练 NMT 模型的方法。最后,我们通过将生成模型与原始通用 NMT 模型以及 Google 翻译的输出进行对比,评估了最终模型的性能。

## 2 相关工作

尽管在不断增长的 OPUS 语料库集合[23 (https://arxiv.org/html/2605.20912#bib.bib9)]中存在大量的平行语料库,但相对于科学翻译的重要性和挑战,针对科学和学术领域平行数据获取的语料库仍然不足。

在 OPUS 中,有两个值得注意的平行数据集,即 CAPES[20 (https://arxiv.org/html/2605.20912#bib.bib4)] 和 SciELO[19 (https://arxiv.org/html/2605.20912#bib.bib5)]。CAPES 源自学位论文目录(TDC)数据库,包含约 120 万对 EN–PT 语言对的句子对[20 (https://arxiv.org/html/2605.20912#bib.bib4)],这些句子对是从巴西各大学研究生项目学生的论文和学位论文摘要中挖掘出来的。类似地,SciELO 平行语料库是通过使用 SciELO 数据库提取的,该数据库包含广泛的开放获取科学文章。SciELO 包含大约 330 万句平行句子及其元数据,涉及英语、西班牙语和葡萄牙语,其中一些是三语对齐的(即 EN–ES–PT)[19 (https://arxiv.org/html/2605.20912#bib.bib5)]。这两个语料库都经过手动评估以及通过训练和评估 MT 系统进行的自动评估。

为了解决欧洲代表性不足的语言中科学文本的平行数据缺口,SciPar 语料库[17 (https://arxiv.org/html/2605.20912#bib.bib6)]被创建,并通过 ELRC-SHARE 仓库公开提供¹¹¹https://elrc-share.eu/。SciPar 包含 917 万个句子对,涵盖 31 个语言对,其构建来源包括学士和硕士论文、博士论文以及其他科学出版物的标题和摘要。它是通过收集、解析和处理来自 86 个机构知识库、大学数字图书馆和国家档案馆的元数据构建而成的。

“翻译与开放科学”项目专注于为三个试点领域构建 EN–FR NMT 系统:(a) 气候学与气候变化,(b) 神经科学,以及 (c) 人类流动、环境与空间。Fiorini 等人[7 (https://arxiv.org/html/2605.20912#bib.bib3)]为这三个领域收集了 316,701 个平行片段和 1,112 个双语术语,从头训练了一个通用 NMT 模型,然后使用收集的数据集对其进行微调。该论文描述了为确定领域特定翻译质量而进行的手动和自动评估与比较,同时也表明添加 SciPar 的数据能带来进一步的改进。

表 1:每个语言对和领域的平行语料库大小
## 3 数据集创建

在本节中,我们概述了用于从论文和学位论文的标题和摘要中挖掘高质量平行和单语语料库的端到端流程。首先,我们详细介绍了处理来自 62 个学术知识库的大约 930 万条记录以提取 11,700,912 个句子对的策略。知识库的详细列表见附录 A 的表 4。然后,我们展示了应用各种过滤方法后得到的平行和单语语料库的大小,最后,我们简要说明了用于创建基准开发集和测试集的过程。

表 2:每个语言对和领域的单语语料库大小### 3.1 知识库处理

我们的策略旨在对学术记录进行结构化元数据提取和处理,以挖掘领域特定的单语和平行句子,同时适应不同知识库之间的差异。它构成了一个统一的框架,该框架建立在 SciPar[17 (https://arxiv.org/html/2605.20912#bib.bib6)] 中使用的方法之上并对其进行了扩展。我们的知识库处理流程中使用的各个步骤如下:

- **获取学术记录**:首先,我们使用 GNU Wget²²²https://www.gnu.org/software/wget/ 包自动下载来自 62 个知识库的所有记录(HTML 文件格式)。
- **自定义知识库配置**:为了从存储信息方式不同的知识库中提取结构化元数据,我们为每个知识库创建了一个配置文件(示例见附录 B)。这需要手动检查每个知识库的几个 HTML 文件,并配置自定义的正则表达式模式和规则。此外,我们为摘要和标题的提取定义了最小字符长度,以确保提取数据的有效性。
- **解析与元数据提取**:我们利用 Beautiful Soup³³³https://www.crummy.com/software/BeautifulSoup/ 包和正则表达式模式处理来解析记录并提取结构化元数据。此步骤使用了每个知识库的自定义配置文件,并为每条记录构建了一个 JSON 文件,以组织用于进一步处理的数据(示例见附录 C)。
- **领域分类**:利用基于简单关键词的分类方法,每条记录被归类为四个独特领域之一:癌症研究、交通研究、能源研究和神经科学。不属于这些类别中任何一个的记录被归类为“通用学术”领域。
- **文本提取**:从每个 JSON 文件的标题和摘要中,提取了单语和平行文档。此过程保留了每条记录已识别出的领域和语言信息。当存在两个或更多标题和/或摘要时,创建候选平行文档。使用 NLTK 库⁴⁴⁴https://www.nltk.org/ 将摘要分割成句子。
- **平行句子挖掘**:利用 LASER 和基于边界的评分[2 (https://arxiv.org/html/2605.20912#bib.bib2),3 (https://arxiv.org/html/2605.20912#bib.bib1)],我们从候选平行文档中提取平行句子。我们为此过程使用了 2 块 NVIDIA 2080 Ti GPU。

### 3.2 领域特定平行语料库

为了为我们针对的所有语言对构建领域特定的平行语料库,我们将之前从每个知识库中提取的平行句子按领域和语言对合并到特定文件中。

此外,我们应用了 LASER 对齐分数阈值 0.98,虽然这个阈值低于其他以全局方式挖掘平行句子的工作中使用的阈值,但它确保了源自标题的平行数据不会被丢弃[17 (https://arxiv.org/html/2605.20912#bib.bib6)]。

最后,我们对所有平行语料库进行了去重,并通过移除以下句子对进行过滤:(a) 源句子和目标句子相同,(b) 任一侧句子为空,(c) 任一句子超过 250 个词,(d) 仅由数字组成,(e) 被识别为属于错误语言,或 (f) 主要由 URL 和电子邮件组成[10 (https://arxiv.org/html/2605.20912#bib.bib7)]。

表 1 中得到的领域特定平行语料库总计 11,700,912 个句子对。我们可以看到,“通用科学”领域在语料库大小上显著超过所有其他领域的总和,且在所有语言对中均如此。此外,EN–PT 和 EN–ES 语言对的语料库大小通常超过 EN–FR 语言对,这表明有大量学术知识库源自拉丁美洲国家。在四个重点领域中,“能源”和“癌症研究”领域的数据代表性更高。不同领域语料库大小的差异反映了每个领域的范围广度以及领域分类固有的挑战。

在表 2 中,我们列出了针对四种目标语言中每一种的领域特定单语语料库的大小。这些结果不包括平行数据中的单语句子,并且是从没有平行标题和/或摘要的学术记录中提取的。可以观察到,我们关注的不同领域之间存在许多差异;“通用科学”领域显著大于我们关注的所有其他领域。然而,更明显的差异涉及每种语言的数据可用性,例如,英语单语语料库比法语单语语料库大两个数量级。尽管在本工作中我们没有直接使用单语数据,但它们可以通过反向翻译[18 (https://arxiv.org/html/2605.20912#bib.bib13),6 (https://arxiv.org/html/2605.20912#bib.bib14)]来潜在地增强 NMT 模型的性能,并且可以构成大型语言模型(LLM)预训练数据集的高质量部分。

### 3.3 基准测试创建

基准测试创建过程旨在满足评估我们微调模型在四个科学领域上的特定需求。我们的目标是创建:

- **开发集**:可用于监控训练过程并选择最优超参数。
- **测试集**:可用于评估我们模型的泛化能力,并用于与基础 OPUS-MT 模型和 Google 翻译进行比较。

对于四个目标领域中的每一个,分配了 1000/1000 个句子对用于开发/测试,而“通用科学”集则分配了 3000/3000 个句子对。为了构建领域特定的开发集和测试集,我们遵循了一个结构化的多阶段过程。我们从每个领域和语言对的过滤后平行语料库开始,应用大于 1.08 的 LASER 阈值来识别具有实质性语义对齐的句子。此外,我们使用了更严格的 token 比率过滤器(1.66),并移除了任一句子长度少于 3 个词的句子对。

之后,对于每个领域特定数据集,我们抽取 2000 条独特记录;对于“通用科学”数据集,则抽取 6000 条。从这些记录中,随机选择一对句子包含到组合的开发/测试集中。换句话说,这些集合中的每个平语句子对都源自随机选择的论文/摘要池中的单一论文/摘要。

对于开发集和测试集的构建,我们将句子对平均分成两部分,结果每个领域特定的开发集和测试集各有 1000 个平行句子,“通用科学”开发集和测试集各有 3000 个平行句子。

## 4 面向 NMT 的领域自适应

通过使用领域自适应,我们可以增强

相似文章

MultiSynt/MT:跨越36种语言的万亿标记多平行预训练数据

arXiv cs.CL

本文介绍了MultiSynt/MT,这是一个通过将英语预训练数据翻译成36种语言而创建的万亿标记多语言平行语料库。实验表明,在此翻译数据上训练的大语言模型在更少的标记下实现了与原生数据相当的性能,但仍存在一些评估盲点和文化差距。

论使用LLM处理专业术语:语料库的良好替代方案?

arXiv cs.AI

本研究评估了四款专有LLM(GPT-4o、GPT-5.2、Claude Sonnet 4.5、DeepSeek)在两个领域英译法的专业术语翻译,并比较了提示策略。结果显示Claude Sonnet 4.5表现最佳,但LLM目前尚无法取代专业语料库。

ForMaT:视觉引导的多语言PDF翻译数据集

arXiv cs.CL

本文介绍了ForMaT,一个包含15个语言对、3,956个PDF文件的平行语料库,专为视觉引导的多语言翻译而设计,保留了布局元数据,用于对布局感知的机器翻译系统进行基准测试。