评估多语言句子嵌入用于翻译错误检测:一项英语-希腊语对比研究

arXiv cs.CL 论文

摘要

本研究评估了多语言句子嵌入在区分正确英希翻译与错误翻译方面的表现,发现这些嵌入提供了有用的语义信号,但更适合集成到更广泛的翻译评估框架中。

arXiv:2608.28776v1 公告类型:新 摘要:多语言句子嵌入越来越多地用于估计跨语言的语义相似性,但其对细微翻译错误的敏感性仍不充分理解。本研究调查通用多语言嵌入模型能否区分正确的英希翻译与轻微修改的错误替代。对比数据集基于FLORES+句子对齐参考翻译开发,并由两位翻译专家审查。它包含1,850个示例,覆盖十个核心和五个探索性错误类别,涉及事实、词汇语义、语法、关系、指称和语篇层面现象。 五个多语言句子嵌入模型(BGE-M3、Multilingual E5、Multilingual MPNet、LaBSE和Jina Embeddings v3)通过每个英语源句与其正确和错误希腊翻译之间的余弦相似度进行评估。一个无参考的COMETKiwi模型也作为机器翻译质量估计基线进行评估。性能通过对比准确率和针对类别特定敏感性的分数边距进行评估。BGE-M3在嵌入模型中达到最高准确率89.30%,而COMETKiwi达到94.49%。嵌入模型在检测显式事实和词汇变化方面比时态体和代词共指错误更可靠。COMETKiwi在几个困难类别上提高了性能,包括时态和体、代词和共指以及语义角色错误,但对日期和时间错误的敏感性较低,并且在数字方面表现不如嵌入模型。结果显示互补的错误敏感性特征:多语言句子嵌入提供了有用的语义充分性信号,但更适合作为更广泛翻译评估框架的组成部分,而非独立指标。
查看原文
查看缓存全文

缓存时间: 2026/09/01 12:03

# 评估多语言句子嵌入用于翻译错误检测:英希对比研究
来源:https://arxiv.org/html/2608.28776
Eleftherios Kalogeroshttps://orcid.org/0000-0001-8080-6343单位:爱奥尼亚大学信息科学系数字图书馆与电子出版实验室,伊奥安努·西奥托基72号,49100科孚岛,希腊 kalogero@ionio\.gr, at\.ntalakas@gmail\.com, manolis@ionio\.grAthanasios Ntalakashttps://orcid.org/0009-0001-7098-6296单位:爱奥尼亚大学信息科学系数字图书馆与电子出版实验室,伊奥安努·西奥托基72号,49100科孚岛,希腊 kalogero@ionio\.gr, at\.ntalakas@gmail\.com, manolis@ionio\.grManolis Gergatsoulishttps://orcid.org/0000-0001-9744-5839单位:爱奥尼亚大学信息科学系数字图书馆与电子出版实验室,伊奥安努·西奥托基72号,49100科孚岛,希腊 kalogero@ionio\.gr, at\.ntalakas@gmail\.com, manolis@ionio\.grPaschalis Nikolaouhttps://orcid.org/0000-0001-6839-4999单位:爱奥尼亚大学外语、翻译与口译系文学翻译与图书政策中心,齐里戈提广场,49100科孚岛,希腊 nikolaou@ionio\.gr, lito\_alexaki@ionio\.grSotiria\-Lito Alexakihttps://orcid.org/0009-0007-6331-4102单位:爱奥尼亚大学外语、翻译与口译系文学翻译与图书政策中心,齐里戈提广场,49100科孚岛,希腊 nikolaou@ionio\.gr, lito\_alexaki@ionio\.gr

###### 摘要

*多语言句子嵌入*正日益被用于估计跨语言的语义相似度,但其对细微翻译错误的敏感性仍未被充分理解。本研究探讨通用多语言嵌入模型能否区分正确的英希翻译与经过最小改动的错误翻译变体。我们基于FLORES+句子对齐的参考翻译构建了一个对比数据集,并由两位翻译专家双重审核。该数据集包含1,850个示例,分布在十个核心错误类别和五个探索性错误类别中,涵盖了事实性、词汇语义、语法、关系、指代和篇章层面的现象。

我们评估了五个多语言句子嵌入模型——BGE-M3、多语言E5、多语言MPNet、LaBSE和Jina Embeddings v3——通过计算每个英语源句与其正确和错误希腊语翻译之间的*余弦相似度*来进行评估。此外,还评估了一个无参考的COMETKiwi质量估计模型作为专门的机器翻译基线。性能评估主要通过*对比准确率*进行,并利用模型内部的分数差值来分析*特定类别的敏感性*。BGE-M3在嵌入模型中取得了最高的对比准确率,为89.30%,而COMETKiwi则达到了94.49%。在所有五个嵌入模型中,明确的事实性和词汇变化比时态语态和代词指代错误检测得更可靠。COMETKiwi在几个这类困难类别上显著提升了性能,包括时态语态、代词指代和语义角色错误,但对日期时间错误的敏感性明显较低,并且在数字方面的表现也逊于嵌入模型。这些发现表明,通用多语言嵌入和专门针对机器翻译的质量估计展现出互补的错误敏感性特征。因此,多语言句子嵌入提供了有用的语义充分性信号,但作为独立评估指标,它们更适合作为更广泛翻译评估框架的组成部分。

关键词:多语言句子嵌入;机器翻译评估;翻译错误检测;对比评估;质量估计;英希翻译。

## 1 引言

自动评估在机器翻译系统的开发和比较中起着核心作用。传统的*词汇度量*,如BLEU,衡量候选翻译与一个或多个参考翻译之间的表面重叠程度[11 (https://arxiv.org/html/2608.28776#bib.bib11)],但此类度量可能对与参考译文在词汇上不同但有效的翻译给出低分。因此,更近期的评估方法结合了上下文和跨语言预训练表示,以便在更语义的层面评估翻译质量[12 (https://arxiv.org/html/2608.28776#bib.bib12)]。

与此同时,通用的*多语言句子嵌入模型*已被开发用于跨语言检索、语义搜索、句子对齐和相似度估计等应用[4 (https://arxiv.org/html/2608.28776#bib.bib4)]。这些模型旨在将不同语言中语义相关的句子映射到一个共享的嵌入空间,使其在翻译评估中可能有用。

尽管它们在广泛的语义相似性和检索任务上表现强劲,但多语言句子嵌入是否对细微翻译错误足够敏感尚不清楚。一个正确的翻译和一个包含单个关键错误的翻译可能共享大部分词汇内容,仅在一个数字、否定标记、代词、时间表达式或两个参与者的语义角色上有所不同。因此,即使意义并不等同,这些句子在嵌入空间中的位置也可能非常接近。仅靠高余弦相似度因此可能会掩盖那些实质性改变句子事实、语法、指代或篇章层面解释的翻译错误。

本研究调查多语言句子嵌入在多大程度上能够区分正确的英希翻译与经过最小改动的错误翻译变体。英语-希腊语为这种分析提供了有用的场景,因为希腊语具有丰富的形态、语法性、显性一致关系、灵活的词序和依赖篇章的指代。

我们从句子对齐的FLORES+参考翻译构建了一个对比的英希数据集。该数据集包含1,850个示例,其中每个英语源句都配有一个正确的希腊语翻译和一个经过最小改动的错误变体。数据集覆盖了15个翻译错误类别,跨越事实性、词汇语义、语法、关系、指代和篇章层面的现象。

我们评估了五个公开可用的多语言句子嵌入模型:BGE-M3[4 (https://arxiv.org/html/2608.28776#bib.bib4)]、多语言E5[17 (https://arxiv.org/html/2608.28776#bib.bib17)]、多语言MPNet[14 (https://arxiv.org/html/2608.28776#bib.bib14)]、LaBSE[5 (https://arxiv.org/html/2608.28776#bib.bib5)]和Jina Embeddings v3[16 (https://arxiv.org/html/2608.28776#bib.bib16)]。为了将其性能置于翻译专用评估方法的背景下进行比较,我们还评估了一个无参考的COMETKiwi质量估计模型。模型性能使用对比准确率以及正确翻译与错误翻译之间的分数差值进行评估,并通过类别分析来识别共同的和方法特定的优势和劣势。

本研究旨在解决以下研究问题:
RQ1:多语言句子嵌入模型在多大程度上能够对正确的英希翻译赋予比包含受控错误的翻译更高的余弦相似度?
RQ2:错误检测的敏感性在事实性、词汇语义、语法、关系、指代和篇章层面翻译错误类别中如何变化?
RQ3:BGE-M3、多语言E5、多语言MPNet、LaBSE和Jina Embeddings v3在对比准确率以及正确与错误翻译之间的模型内部相似度差值模式上有何不同?
RQ4:哪些翻译错误类别构成了通用多语言句子嵌入的共同或模型特定的盲点?
RQ5:多语言句子嵌入能否作为独立的翻译评估指标,还是它们更适合作为更广泛评估框架中的语义组件?

本工作的主要贡献是对多语言句子嵌入用于英希翻译评估的基于类别的实证分析。研究并未仅报告聚合的模型性能,而是考察了五个具有不同训练目标的模型的嵌入空间中保留或丢失的具体语义区分。此外,本研究还贡献了一个人工审核的对比挑战集,涵盖了广泛的事实性、词汇、语法、指代、关系和篇章层面错误。结果提供了关于句子嵌入作为翻译评估信号的实际有用性的证据,同时也识别了需要额外的词汇、句法、指代、基于推理或篇章感知建模的语言现象。

本文的其余部分组织如下。第2节 (https://arxiv.org/html/2608.28776#S2) 介绍本研究评估的多语言句子嵌入模型,第3节 (https://arxiv.org/html/2608.28776#S3) 综述基于翻译错误分析和对比评估的相关工作。第4节 (https://arxiv.org/html/2608.28776#S4) 阐述对比评估方法,而第5节 (https://arxiv.org/html/2608.28776#S5) 描述模型配置和COMETKiwi基线。第6节 (https://arxiv.org/html/2608.28776#S6) 详述英希对比数据集的构建。第7节 (https://arxiv.org/html/2608.28776#S7) 报告整体和类别级别的实验结果,这些结果在第8节 (https://arxiv.org/html/2608.28776#S8) 进行了讨论。最后,第9节 (https://arxiv.org/html/2608.28776#S9) 总结了主要发现并概述了未来的工作方向。

## 2 基础知识:多语言句子嵌入模型

*句子嵌入*将句子表示为语义空间中的稠密数值向量,预期语义相似的句子在空间中彼此邻近。它们的相似度通常使用*余弦相似度*来衡量。*多语言句子嵌入模型*通过将语义等同的句子映射到一个共享向量空间,将这一思想扩展到跨语言场景。

本研究考察了五个多语言句子嵌入模型:*BGE-M3*、*多语言E5*、*多语言MPNet*、*LaBSE* 和 *Jina Embeddings v3*(表1 (https://arxiv.org/html/2608.28776#S5.T1))。相应的检查点可通过Hugging Face模型仓库111https://huggingface.co/models公开获取,并可在本地执行。

*BGE-M3* [4 (https://arxiv.org/html/2608.28776#bib.bib4)] 是一个支持稠密、稀疏和多向量表示的多语言、多功能、多粒度嵌入模型。它主要为多语言和跨语言检索开发,支持超过100种语言。

*多语言E5* [17 (https://arxiv.org/html/2608.28776#bib.bib17)] 是一系列通过大规模对比学习训练的多语言嵌入模型。它旨在用于包括语义检索、分类、聚类和跨语言文本匹配在内的通用应用。

*多语言MPNet* [14 (https://arxiv.org/html/2608.28776#bib.bib14)] 是一个在平行语料和释义数据上训练的多语言句子转换器模型。它生成768维的句子表示,专为跨50多种语言的语义相似度、聚类和语义搜索设计。

*LaBSE* [5 (https://arxiv.org/html/2608.28776#bib.bib5)] 专门开发用于与语言无关的句子表示和跨语言句子匹配。其训练目标旨在使翻译的句子对在共享的多语言嵌入空间中占据邻近区域。

*Jina Embeddings v3* [16 (https://arxiv.org/html/2608.28776#bib.bib16)] 是一个基于Jina-XLM-RoBERTa架构的多语言多任务嵌入模型。它引入了旋转位置嵌入以支持长达8,192个令牌的序列,并使用任务特定的低秩适配器用于检索、分类、聚类和文本匹配等应用。该模型还支持套娃表示,默认嵌入维度为1,024。

这五个模型代表了互补的多语言嵌入方法:BGE-M3和多语言E5主要面向检索,多语言MPNet面向释义,LaBSE提供了一个成熟的跨语言句子对齐基线,而Jina Embeddings v3引入了一种基于适配器的多任务嵌入架构。它们不同的训练目标和表示策略使其适合用于比较对受控翻译错误的敏感性。

## 3 相关工作

与本研究相关的先前工作涵盖了翻译错误分类法、用于度量评估的对比挑战集、对特定翻译现象的分析以及多语言评估资源。

Sharou 和 Specia [15 (https://arxiv.org/html/2608.28776#bib.bib15)] 研究了关键翻译错误,包括不正确的日期、时间、数值、货币、命名实体以及其他可能对用户造成严重后果的错误。他们的工作表明,翻译错误的严重性不同,评估应同时考虑其语言形式和实际影响。Hayakawa 和 Arase [8 (https://arxiv.org/html/2608.28776#bib.bib8)] 采用了细粒度的错误分析视角来研究英译日的神经机器翻译在医疗领域的应用,涵盖了添加、省略、误译、语法错误和术语等现象。这些研究促使人们使用具有语言学意义的错误类别,但其主要重点是机器翻译输出的分析或标注,而非通用句子嵌入的敏感性。

本研究的方法论与对比挑战集评估更为相关。Amrhein 等人提出的 ACES [1 (https://arxiv.org/html/2608.28776#bib.bib1)] 包含涵盖68种语言和语义现象的受控正确-错误翻译对。当一个度量为正确翻译赋予更高分数时,该度量即成功,即使整体相关性看似很强,也能识别出特定类别的弱点。Avramidis 和 Macketanz [2 (https://arxiv.org/html/2608.28776#bib.bib2)] 同样使用语言学驱动的挑战集进行德英和英德度量评估,并表明强大的度量在处理命名实体、术语、计量单位、日期、惯用表达和语法结构时仍可能遇到困难。本研究采用了相同的对比原则,但直接评估通用的多语言句子编码器,而非完整的机器翻译度量指标。

专门的神经机器翻译评估度量为通用句子嵌入提供了重要的比较基准。COMET [12 (https://arxiv.org/html/2608.28776#bib.bib12)] 使用预训练的跨语言表示从源句、候选翻译和参考信息中预测翻译质量。COMET系列中的无参考变体通常被称为COMETKiwi [13 (https://arxiv.org/html/2608.28776#bib.bib13)],它直接从源句和候选翻译估计翻译质量,而无需目标语言参考。在本研究中,COMETKiwi被用作机器翻译专用的质量估计基线。

相似文章

利用多语言LLM嵌入发现词汇空缺

arXiv cs.CL

本文提出了一种数据驱动的框架,利用多语言LLM的嵌入来检测语言间的词汇空缺,在韩语-英语对中实现了高准确率。

跨语言同形词的标记化

arXiv cs.CL

本文研究了多语言分词器如何处理跨语言同形词(不同语言中拼写相同但含义不同的词),并提出了一种轻量级的语言线索干预方法,通过引入语言特定字符来减少分词共享。实验表明,在机器翻译中,特别是在BPE分词下,该方法带来了适度的改进。

评估本地LLM机器翻译中的提示范围与示例相似性

arXiv cs.CL

本文评估了提示范围(单目标 vs. 家族范围)和示例相似性(随机、词汇、嵌入)对本地LLM在英语到罗曼语系和英语到日耳曼语系翻译质量的影响,发现专用机器翻译系统仍然表现更好,且嵌入检索带来适度的提升。