基于ROC分析的翻译质量评估系统性能评价

arXiv cs.CL 论文

摘要

本文提出使用接收者操作特征(ROC)分析来评估翻译质量评估(QE)系统,表明该方法能为商业决策提供可操作的性能见解,并与现有方法一致。

arXiv:2605.24721v1 Announce Type: new 摘要:随着自动化翻译质量评估(QE)系统的广泛应用,需要实用且面向决策的方法来评估其性能。本文提出接收者操作特征(ROC)分析是达成此目的的有效方法。我们的研究表明,ROC分析不仅能产生与当前主流方法一致的结果,还具备若干重要优势,包括为商业决策提供可操作的性能见解。
查看原文
查看缓存全文

缓存时间: 2026/05/26 09:06

# 用于评估翻译质量估计系统的ROC分析  
来源:https://arxiv.org/html/2605.24721  
Evelyn Y. Garland¹ 和 Carola F. Berger²  
¹Acta-Transphere,²CFB Scientific Translations LLC  
通讯作者:[email protected] (https://arxiv.org/html/2605.24721v1/mailto:[email protected])  

###### 摘要  
随着自动化翻译质量估计(QE)系统的日益普及,迫切需要对它们的性能进行实用的、面向决策的评估方法。我们提出,接收者操作特征(ROC)分析是实现此目的的有用方法。我们的研究表明,ROC分析不仅产生与当前主流方法一致的结果,而且还提供了几个重要优势,包括可支持业务决策的可操作性能洞察。  

# 用于评估翻译质量估计系统的ROC分析  
Evelyn Y. Garland¹ 和 Carola F. Berger²  
¹Acta-Transphere,²CFB Scientific Translations LLC  
通讯作者:[email protected] (https://arxiv.org/html/2605.24721v1/mailto:[email protected])  

## 1 引言  
随着自动化翻译的普及,旨在不依赖参考译文评估翻译质量的系统数量也大幅增加。这些无参考系统有不同的名称。在此,我们称它们为质量估计(QE)系统。QE系统用于支持涉及大量数据的决策,例如翻译工作流的分诊、模型训练数据的预处理、以及提示工程和模型评估。这些以及其他影响深远的用例随之提出了一个重要问题:特定的QE系统对于相应的用例有多合适?换句话说,如何评估QE系统自身的性能?  
在WMT机器翻译指标与质量估计共享任务的框架内,已经开展了评估QE系统性能的研究,最近的研究包括:Lavie等人 (2025 (https://arxiv.org/html/2605.24721#bib.bib11));Freitag等人 (2024 (https://arxiv.org/html/2605.24721#bib.bib6));Zerva等人 (2024 (https://arxiv.org/html/2605.24721#bib.bib20));Freitag等人 (2023 (https://arxiv.org/html/2605.24721#bib.bib7));Blain等人 (2023 (https://arxiv.org/html/2605.24721#bib.bib1))。然而,接收者操作特征(ROC)分析在WMT研究中并未得到广泛使用,这些研究通常偏重其他指标。在WMT会议系列之外,当QE被构建为二元检测、分类或分诊问题时,ROC曲线已被使用或考虑过(Lo and Simard 2019 (https://arxiv.org/html/2605.24721#bib.bib12);Blatz等人 2004 (https://arxiv.org/html/2605.24721#bib.bib2)),但程度有限。  
QE系统可能输出质量分数、错误位置(错误跨度)、译后编辑工作量估计、错误类型分类、错误严重程度评级,或这些信息的组合。许多QE系统至少能够产生质量分数,以指示翻译在质量方面的相对排名。在本文中,我们关注这类系统。本文试图就如何使用ROC曲线评估QE系统的性能并支持与业务相关的决策提供一般性指导,以推广更好的评估实践。  

## 2 接收者操作特征分析  
ROC分析由电气工程师在20世纪40年代开发,但此后在许多领域得到了广泛应用,包括临床研究和机器学习。然而,完整的ROC分析方法似乎尚未被广泛应用于评估翻译QE系统的性能。在解释如何构建ROC曲线和表格之前,我们将回顾一些定义,以明确本文使用的符号。我们假设文本被划分为片段,这是翻译和自然语言处理中的标准做法。  

### 2.1 定义及对相关翻译QE指标的回顾  
在自然语言处理中,QE系统可用于(除其他用途外)将翻译片段分为两类:无错误片段和含错误片段。在本文中,我们关注的是定位包含错误的片段,因此定义如下:  
错误 = 正例,无错误 = 负例。  
设 *P* 表示含错误片段的数量(正例),*N* 表示无错误片段的数量(负例)。因此,片段总数为 *P* + *N*。这种分类构成了“金标准”。在此,我们不区分含错误片段中包含一个错误还是多个错误;它仍然被归类为正例,即至少包含一个错误。  
如果我们随后在翻译片段上运行一个分类器(一个QE系统),该分类器可用于预测每个片段是否包含错误。在第2.2节 (https://arxiv.org/html/2605.24721#S2.SS2) 和3.2节 (https://arxiv.org/html/2605.24721#S3.SS2) 中,我们展示了如何将QE系统分数用于此分类。因此,我们有四种可能的结果:  
- • **TP**(真正例):正确分类的含错误片段。  
- • **FN**(假负例):被错误分类为无错误的含错误片段。  
- • **TN**(真负例):正确分类的无错误片段。  
- • **FP**(假正例):被错误分类为含错误的无错误片段。  
根据这些,我们可以构建一个2×2的混淆矩阵,这在文献中是众所周知的做法。从混淆矩阵中,我们可以计算出两个指标,定义如下:  

TPR = TP / P = TP / (TP + FN) (1)  
FPR = FP / N = FP / (FP + TN) (2)  

即,真正率(TPR)是真正例数量与正例总数之比,在我们的案例中,是QE系统正确识别的含错误片段数量除以含错误片段总数。同样地,假正率(FPR)是假正例数量与负例总数之比,或者说是被错误识别为至少包含一个错误的无错误片段与无错误片段总数的比值。  

其他常用指标包括:  
精确率 = TP / (TP + FP) (3)  
召回率 = TP / (TP + FN) = TPR (4)  

换句话说,真正率也称为召回率,因为它衡量分类器“召回”或识别所有正例的完整性。TPR或召回率的另一个术语是灵敏度。精确率,顾名思义,衡量QE系统正确分类含错误片段的精度。FPR与另一个指标——特异度相关,关系为:FPR = 1 - 特异度。  

### 2.2 QE系统分数的ROC曲线  
现在我们已经明确了符号,让我们简要总结ROC分析。关于ROC分析的深入回顾,我们请读者参考Fawcett (2006 (https://arxiv.org/html/2605.24721#bib.bib5))。ROC图是二维图,纵轴绘制TPR,横轴绘制FPR,对应分类器的不同阈值。这种二维图说明了收益(真正例)与成本(假正例)之间的相对权衡。在我们的案例中,收益是被正确分类的含错误片段,因为这些片段随后可以由人工或可能的自动化系统进行纠正,或者在模型训练的数据预处理步骤中被正确排除。假正例会带来额外成本,因为这些片段即使实际上没有错误,也必须在翻译工作流中进一步处理,或者被不必要地从清洗后的数据集中排除,而它们实际上是可以使用的。  

图1:两个样本分类器的理想化ROC曲线,其中分类器1的性能相对优于分类器2。  

图1 (https://arxiv.org/html/2605.24721#S2.F1) 显示了连续分类器在ROC空间中的理想化曲线。实际上,我们有一个有限的数据点集或分类后的片段集合,我们的ROC曲线将是阶跃函数或分段线性函数,具体取决于数据和分类器。在该图中,虚线对角线(TPR = FPR)表示随机分类器的行为,该分类器一半时间猜对,另一半时间猜错。经过ROC空间中点(0,1)的橙色线表示每次都正确的完美分类器。曲线越接近这条理想曲线,分类器越好。因此,在图1 (https://arxiv.org/html/2605.24721#S2.F1) 中,对于这个特定数据集,黑色实线曲线通常是比蓝色虚线曲线更好的分类器。  

现在让我们解释如何获得我们案例中的ROC曲线。我们有一个翻译片段的样本数据集,这些片段已经过人工以某种方式注释或译后编辑。在本文中,这构成了我们的“金标准”。一般来说,金标准是在合理条件下可获得的最佳基准。借助这个金标准,我们可以将片段分为两类:无错误(负例)或包含一个或多个错误(正例)。这种分为正例和负例的分类构成了“金标准”。在第3.2节 (https://arxiv.org/html/2605.24721#S3.SS2) 中,我们将展示如何从MQM及MQM相关分数中获得这个金标准。  

我们还拥有由QE系统为每个片段生成的分数。通常,这些分数要么是离散的,要么是准连续的,例如0到100之间的整数,或者固定小数精度的0.0到1.0之间的小数,但也可能是无界的。这些分数构成了我们扫描以生成ROC曲线的分类器阈值。标准的ROC应用和软件实现假设**较高的分类器分数**表示**更正面的实例**。然而,一些QE系统为更“负面”(更“无错误”,即翻译质量更好)的片段输出更高的分数,这与算法预期的输入完全相反。对于这些分数,如果对分数取反,则标准算法仍然适用。  

遵循这一标准算法(例如,见Fawcett (2006 (https://arxiv.org/html/2605.24721#bib.bib5)) 的算法1),我们获得一条ROC曲线,它通常是一个二维阶跃函数。对于两个或更多具有相同QE分数的数据点,ROC曲线将不是阶跃函数,而是分段线性曲线,因为我们采用了Fawcett (2006 (https://arxiv.org/html/2605.24721#bib.bib5)) 的**期望性能**方法。原则上,不同翻译的片段应该产生不同的QE系统分数。然而,对于离散分类器,或者由于浮点数舍入,可能不同片段产生相同的分类器分数,从而在同一个分数阈值下产生两个或多个不同的数据点。对于这些并列的阈值,我们将所有真正例和假正例相加,为每个唯一的QE分数阈值分别生成一个TPR值和FPR值。这会将阶跃函数修改为分段线性曲线。我们将在下面的结果中看到示例。  

### 2.3 曲线下面积  
从ROC曲线中可以计算出的另一个指标是曲线下面积(AUC,在其他地方也称为AUROC),它将ROC曲线中包含的二维信息浓缩为单个值。它衡量分类器在所有可能阈值下区分正例和负例(错误和无错误)的能力。AUC的范围是0到1,其中0.5表示不比随机猜测好。我们请读者参考Fawcett (2006 (https://arxiv.org/html/2605.24721#bib.bib5)),了解如何通过曲线下的梯形面积计算AUC值。请注意,不同形状的ROC曲线如果相互交叉,可能具有相同的AUC值。原因是AUC值将二维ROC信息压缩为单个有损值。  

### 2.4 使用Bootstrap重采样评估统计显著性  
判断统计显著性对于评估单个QE系统性能的不确定性以及比较两个或多个QE系统非常有用。可视化这种不确定性的一种方法是通过ROC曲线的置信带。为了评估ROC曲线的置信带,我们使用**非参数分层bootstrap重采样**(例如,见Efron (1979 (https://arxiv.org/html/2605.24721#bib.bib4))),这是许多统计软件中实现的标准算法。我们选择这种方法是因为潜在分布是未知的,特别是对于评估基于LLM的机器翻译系统的基于LLM的QE系统。AUC值的置信区间以类似方式获得。该算法在附录D (https://arxiv.org/html/2605.24721#A4) 中更详细地解释。需要注意的是,这些置信带和区间没有考虑各种偏差,例如由于注释者间不一致而导致的金标准变异性。  

## 3 研究方法  
### 3.1 数据选择  
我们希望研究具有既定金标准评级和已发表分析的公共数据集,以便进行验证。因此,我们选择了过去机器翻译会议(WMT)的数据,这些数据可在公共GitHub仓库 https://github.com/googleresearch/mt-metrics-eval 中获得,采用Apache v2.0许可。具体来说,我们选择了WMT23(Kocmi等人 2023 (https://arxiv.org/html/2605.24721#bib.bib10)),即第八届机器翻译会议的数据,因为这是最完整的、具有完整MQM注释的可用数据集。¹对于中文到英语,共有1,177个片段附有人工金标准注释,对于英语到德语,共有460个片段(参见Freitag等人 (2023 (https://arxiv.org/html/2605.24721#bib.bib7)) 的表3)。  

我们为每个语言方向选择了三种不同的机器翻译(MT)系统和四种不同的QE系统。我们希望研究ROC分析能否在多种MT系统上复现已发表的WMT23指标共享任务中无参考系统的排名。因此,我们选择了Kocmi等人 (2023 (https://arxiv.org/html/2605.24721#bib.bib10)) 表6中针对我们两个语言方向列出的第一个和最后一个系统,以及一个中间位置的系统。对于中文到英语,三个选定的系统是:Lan-BridgeMT、ONLINE-A和ANVITA。对于英语到德语,我们选择了:GPT4-5shot、Lan-BridgeMT和AIRC。有关这些系统的详细信息,请参考Kocmi等人 (2023 (https://arxiv.org/html/2605.24721#bib.bib10))。  

对于QE系统的选择,我们希望选择两个相对性能更好和两个相对性能更差的系统,依据WMT23指标共享任务的结果。  

(注:原文在此处截断,后续内容未给出)  

¹ 由于专有原因,仓库中的WMT24数据与已发表文章相比不完整。WMT25数据没有包含足够数量的每个语言对的注释片段以供我们分析。  
我们选择了来自MT指标评估子任务(Freitag等人 2023 (https://arxiv.org/html/2605.24721#bib.bib7))的数据,该子任务也包含QE系统组件,语言对为中文到英语和英语到德语。对于中文到英语,共有1,177个片段附有人工金标准注释,对于英语到德语,共有460个片段(参见Freitag等人 (2023 (https://arxiv.org/html/2605.24721#bib.bib7)) 的表3)。  

我们为每个语言方向选择了三种不同的机器翻译(MT)系统和四种不同的QE系统。我们希望研究ROC分析能否在多种MT系统上复现已发表的WMT23指标共享任务中无参考系统的排名。因此,我们选择了Kocmi等人 (2023 (https://arxiv.org/html/2605.24721#bib.bib10)) 表6中针对我们两个语言方向列出的第一个和最后一个系统,以及一个中间位置的系统。对于中文到英语,三个选定的系统是:Lan-BridgeMT、ONLINE-A和ANVITA。对于英语到德语,我们选择了:GPT4-5shot、Lan-BridgeMT和AIRC。有关这些系统的详细信息,请参考Kocmi等人 (2023 (https://arxiv.org/html/2605.24721#bib.bib10))。  

对于QE系统的选择,我们希望选择两个相对性能更好和两个相对性能更差的系统,依据WMT23指标共享任务的结果。

相似文章

ReportQA: 基于问答的放射学报告评估

arXiv cs.CL

本文提出了ReportQA,一种基于问答的放射学报告评估框架,利用大语言模型回答临床相关问题,相较于现有指标,与放射科医生判断的一致性更好。

一种针对长语音同声传译的实用评估方法

arXiv cs.CL

本文提出了一种针对长语音同声传译的实用评估方法,该方法利用自动语音识别(ASR)、强制对齐和句子嵌入对齐来计算连续语音的延迟和质量指标,克服了先前方法的局限性。

Translate-R1:基于强化学习的成本感知翻译工具使用

arXiv cs.CL

Translate-R1引入了一种基于强化学习的方法,用于大语言模型中的成本感知翻译工具使用。该模型根据自身的理解能力和一个成本敏感性参数,学会决定何时翻译输入,从而在多种语言之间实现帕累托最优权衡。