CompactQE: 通过小型开放权重LLMs实现可解释的翻译质量评估

arXiv cs.CL 论文

摘要

本文证明,小型开放权重LLMs(参数小于30B)能够实现具有竞争力的可解释翻译质量评估,包括MQM错误标注和修正,与更大的专有模型相媲美,同时保护数据隐私。

arXiv:2605.15763v1 Announce Type: new 摘要:当前机器翻译中最先进的质量估计(QE)依赖于大规模专有LLMs,引发了数据隐私担忧。我们证明,较小的开源LLMs(参数少于300亿)是一种可行、经济且保护隐私的替代方案。通过单次提示策略,我们的模型同时生成质量分数、MQM错误标注、建议的错误修正以及完整的后编辑。我们的分析表明,这些模型实现了与人工判断高度竞争的系统级相关性,超越了传统神经指标、微调模型和人工标注者间的一致性,有效逼近了更大的专有LLMs的能力。
查看原文
查看缓存全文

缓存时间: 2026/05/18 06:34

# 基于小型开放权重大语言模型的可解释翻译质量评估

来源:https://arxiv.org/html/2605.15763

Kamil Guttmann¹,², Zofia Fraś¹, Artur Nowakowski¹,², Krzysztof Jassem¹,²  
¹Laniqo,波兰波兹南  
²亚当·密茨凯维奇大学数学与计算机科学学院,波兰波兹南  
\{名字\}\{姓氏\}@laniqo.com

###### 摘要

当前机器翻译中最先进的质量评估(QE)依赖于大型专有LLM,引发了数据隐私担忧。我们证明,更小、开源的LLM(<30B参数)是一种可行、经济高效且保护隐私的替代方案。通过单次提示策略,我们的模型同时生成质量分数、MQM错误标注、建议的错误修正以及完整的译后编辑。分析表明,这些模型与人类判断实现了极具竞争力的系统级相关性,超越了传统神经指标、微调模型以及人类标注者间一致性,有效逼近了规模大得多的专有LLM的能力。

## 1 引言

质量评估(QE)仍然是专业机器翻译工作流中的关键组成部分,能够在没有参考译文的情况下评估翻译可靠性。虽然基于神经回归的指标(如COMET[19 (https://arxiv.org/html/2605.15763#bib.bib12)])与人类判断具有较高的相关性,但它们通常只生成单一标量分数。这种聚合方式对具体翻译错误或其严重程度提供甚少洞察,限制了此类指标在需要详细反馈和可解释性的下游任务中的实用性。因此,对于能够提供细粒度错误诊断以及质量分数的评估方法的需求日益增长。

大型语言模型(LLM)的出现引入了一种新的评估范式,通常称为“LLM-as-a-judge”。诸如GEMBA[12 (https://arxiv.org/html/2605.15763#bib.bib30)]和AutoMQM[4 (https://arxiv.org/html/2605.15763#bib.bib14)]等方法利用LLM的生成能力来模拟人类评估框架,如多维质量指标(MQM)[15 (https://arxiv.org/html/2605.15763#bib.bib15)]或错误跨度标注(ESA)[13 (https://arxiv.org/html/2605.15763#bib.bib16)]。通过采用零样本或少样本提示策略,这些方法能够识别和分类错误跨度,提供了以往使用标准神经指标难以达到的可解释性水平。

然而,这些生成式指标的最新性能目前严重依赖于GPT-5或Gemini等大规模专有模型。这种依赖性给专业部署带来了重大挑战,尤其是在数据隐私方面。对于数据安全要求严格的企业来说,将敏感内容发送到外部API进行评估通常是不可行的。此外,闭源模型的训练数据和架构缺乏透明度,引发了关于可复现性以及评估标准随时间稳定性的担忧。

我们假设,无需依赖非常大的专有模型即可实现高质量、可解释的QE。在这项工作中,我们证明了使用明显更小、开源的多语言模型开发有效的MQM风格指标的可行性。通过转向开放权重,我们满足了对保护隐私的评估流程的关键需求,该流程可以部署在本地安全环境中。我们表明,通过适当的提示和输出处理,这些较小的模型可以作为更大、闭源模型的高效替代方案。

为了在这些资源受限的架构上实现具有竞争力的性能,我们引入了一种集成质量估计和译后编辑的简化方法。基于GEMBA-MQM V2[9 (https://arxiv.org/html/2605.15763#bib.bib10)]的结构化提示策略,我们的方法在单次推理步骤中同时进行翻译译后编辑和错误检测。这与最近如MQM-APE[16 (https://arxiv.org/html/2605.15763#bib.bib22)]等多阶段方法形成对比,后者需要多次模型调用来验证错误。随后,我们应用启发式错误过滤来优化输出,在保持专业质量检查所需粒度的同时减少了计算开销。

## 2 相关工作

COMET-Kiwi[20 (https://arxiv.org/html/2605.15763#bib.bib18)]指标族和最近如MetricX-25-QE[10 (https://arxiv.org/html/2605.15763#bib.bib33)]等模型代表了明确针对无参考翻译质量估计进行微调的最先进的神经回归基线。这些模型利用预训练的多语言编码器来预测单个质量分数。虽然标量分数可以很好地指示翻译质量,但它不易解释。

xCOMET[7 (https://arxiv.org/html/2605.15763#bib.bib19)]通过将两个任务整合到一个单一的已学习指标中,弥合了基于回归的评分与细粒度错误检测之间的差距。它在预测句子级分数的同时识别错误跨度并为其分配严重性标签(次要、主要、严重),实现了与人类评分的高度相关性。虽然这是对标量指标的巨大飞跃,但它仍然缺乏以人类错误标注(如MQM)中发现的细粒度错误分类。

生成式的、基于LLM的方法,例如错误分析提示(EAPrompt)[17 (https://arxiv.org/html/2605.15763#bib.bib20)],试图通过将思维链(CoT)推理与结构化错误分析相结合来模拟人类MQM框架。EAPrompt明确指示模型在计算最终分数之前,先在其推理步骤中识别主要和次要错误。虽然内部的CoT过程标识了具体错误,但主要的输出焦点仍然是聚合后的分数或错误计数,而不是向用户返回一个结构化的错误跨度列表。此外,EAPrompt采用多轮提示,将错误识别与错误计数分开,这通过需要对每个评估片段进行多次模型调用而增加了计算成本。

AutoMQM代表了使用大型语言模型完全自动化对翻译进行MQM风格错误标注的初步努力之一。通过利用像PaLM-2这样的大型模型,AutoMQM证明了LLM在提供从人类标注中采样的少样本示例时,能够有效地识别和分类错误。这种方法将焦点从分配标量分数转移到生成结构化的错误标注。

GEMBA指标族通过使用GPT模型的零样本和少样本提示,确立了基于LLM评估的最新水平。GEMBA-MQM[11 (https://arxiv.org/html/2605.15763#bib.bib13)]特别提示GPT-4输出结构化错误标注,将严重性映射到最终的质量分数。最新的迭代版本GEMBA-MQM V2通过聚合十次不同推理运行的结果来解决LLM输出的随机性问题。虽然这种聚合策略显著提高了可靠性和与人类判断的相关性,但它增加了计算需求,需要大型专有模型以及每个片段显著更高的推理时间和成本。

MQM-APE通过集成自动译后编辑(APE)步骤来验证检测到的错误的影响,从而构建在生成式评估范式之上。它通过检查修复错误是否根据成对验证器实际提高了翻译质量,来过滤掉没有影响的错误。值得注意的是,MQM-APE证明了使用如Llama-3[6 (https://arxiv.org/html/2605.15763#bib.bib24)]和Mixtral[8 (https://arxiv.org/html/2605.15763#bib.bib25)]等开源模型完成此任务的可行性。然而,其架构依赖于三个不同模块的顺序流程:评估器、译后编辑器、和验证器。由于所有这些模块都由LLM操作,导致了高昂的推理成本。

我们的工作直接建立在GEMBA-MQM V2的结构化提示策略之上,但针对资源受限的环境进行了调整。我们扩展了框架,在单次推理步骤中同时进行译后编辑和ESA评分,并提供更详细的错误描述。与利用完整文档上下文的GEMBA-MQM V2不同,我们省略了文档级信息,以适应部署在消费级GPU(最高32GB VRAM)上的较小开源模型的上下文窗口限制。这种权衡使我们能够在确保数据隐私和降低计算开销的同时,保持高水平的可解释性和准确性。

## 3 方法

### 3.1 数据

对于所有实验,我们使用WMT25指标共享任务组织者提供的官方数据和人工标注。数据集包含提交给WMT25通用MT任务的各种系统生成的段落级翻译。每个系统输出最初由任务组织者或参与者使用多种自动指标进行评估,包括COMET22、COMETKiwi22、MetricX-25-QE、GEMBA-v2和Gemini2.5-Pro,这些指标作为我们提出方法的基线。随后,组织者选择了一组得分最高的系统进行人工评估。

人工评估遵循ESA协议,该协议在过去两届WMT中已被确立为标准评估框架。根据ESA指南,人工评估员通过两步过程评估翻译质量。首先,标注者在翻译文本中识别并高亮显示特定错误跨度,按严重程度分类。其次,在完成跨度标注后,评估员给翻译分配一个0到100的整体质量分数。每个片段由两名标注者评估。我们取两个分数的平均值,并将其作为黄金标准。

从完整的WMT25数据集中,我们选择三个语言对来评估我们方法在不同语言场景下的表现:捷克语-德语(代表非英语为中心的翻译方向)、英语-意大利语(代表高资源语言对)、以及英语-乌克兰语(代表使用非拉丁文字的低资源目标语言)。为了确保人工判断与自动指标之间公平且一致的比较,我们严格将实验限制在具有完整人工ESA标注和分数的片段上。每个语言对的系统数量和每个系统的片段数量见表1 (https://arxiv.org/html/2605.15763#S3.T1)。

表 1:每个语言对的系统和片段数量详情。每个片段由多个句子组成,因此评估是段落级别的。

### 3.2 提示

为了查询模型进行QE,我们将初始提示结构基于GEMBA-MQM V2。该方法在WMT25指标任务中属于表现最佳的指标之一,并提供了一个有效的基线框架,用于提取结构化的错误跨度标注,输入和输出均格式化为JSON。

在其原始形式中,GEMBA-MQM V2提示包含整个文档的上下文来给单个片段打分。虽然专有模型通常能毫无问题地处理大量输入,但许多小型开源模型具有有限的上下文窗口。此外,扩展活跃上下文长度会显著增加VRAM消耗。由于相关的基础设施成本增加和推理速度降低,这对于依赖消费级硬件的本地部署通常是不切实际的。因此,我们在方法中省略了文档级上下文,将每个段落隔离开来评估,以适应这些硬件限制。

为了校准模型的灵敏度并鼓励正确的JSON输出格式,我们在提示中提供了上下文学习示例。通过提供包含高、中、零错误计数的片段的少样本示例,我们旨在缓解常见问题,如过度标注(幻觉出不存在的错误)和标注不足(遗漏明显的错误)。这些示例特意从多个语言对(英语-德语、波兰语-西班牙语、法语-意大利语)的翻译中选择,以防止模型专注于特定语言对的特征。这产生了一个与语言对无关的提示,可以应用于任何翻译对,而无需为后续实验修改或替换示例。

我们修改了提示,明确要求提取源语言和目标语言的错误短语。捕获确切的目标短语可以对翻译文本进行错误跨度标注。同时,提取对应的源语言短语对于识别遗漏错误是必要的,即源语言中存在的特定短语在翻译中完全缺失。

除了错误跨度标注,提示还指示模型为每个识别出的错误生成一个建议的修正。提供有针对性的修正方案在专业翻译工作流中具有实际效用。它可以加速人工译后编辑过程,使译员能够直接在其计算机辅助翻译(CAT)工具中审查并接受特定的建议。

最后,我们在同一个提示中要求模型输出目标片段的完整译后编辑版本。通过将QE、错误跨度标注和自动译后编辑整合到单个提示中,我们旨在显著降低延迟和计算开销。

我们在附录A (https://arxiv.org/html/2605.15763#A1)、代码清单1 (https://arxiv.org/html/2605.15763#LST1)和代码清单2 (https://arxiv.org/html/2605.15763#LST2)中提供了用于所有实验的系统提示和用户提示模板。

### 3.3 模型

我们使用三个开源模型评估我们的方法:gemma-3-27b-it¹¹¹https://huggingface.co/google/gemma-3-27b-it[21 (https://arxiv.org/html/2605.15763#bib.bib26)]、EuroLLM-9B-Instruct²²²https://huggingface.co/utter-project/EuroLLM-9B-Instruct[18 (https://arxiv.org/html/2605.15763#bib.bib27)]、和Qwen3-VL-30B-A3B-Instruct³³³https://huggingface.co/Qwen/Qwen3-VL-30B-A3B-Instruct[2 (https://arxiv.org/html/2605.15763#bib.bib28)]。我们选择这些特定模型是因为它们低于300亿参数的阈值,从而能够在较小的消费级GPU上进行本地部署。此外,它们基于非限制性的开源许可证提供,并且具有强大的多语言能力。虽然Qwen3-VL-30B-A3B-Instruct本质上是一个视觉语言(VL)模型,但我们在本任务中仅使用其文本处理模态,因为据报道它在纯文本基准测试中相比其非VL对应版本取得了更优的结果[2 (https://arxiv.org/html/2605.15763#bib.bib28)]。

为了将我们的结果与最先进的专有系统进行基准比较,我们还使用Gemini-3-Flash[5 (https://arxiv.org/html/2605.15763#bib.bib11)]作为骨干模型进行质量估计。所有模型都使用相同的提示结构进行提示。

对于开源模型,我们通过将温度设置为零(T=0)来应用贪心解码。相反,我们以T=1运行Gemini-3-Flash,因为其文档不推荐降低温度。为了确保公平比较,我们通过将思考预算设置为零来最小化Gemini内部推理能力的影响。虽然Gemini 3系列不支持完全的“关闭思考”模式,但此配置会触发“最小”思考级别,效果

相似文章

CAT-Q: 用于LLM的高效且准确的三值量化

arXiv cs.CL

CAT-Q 提出了一种面向LLM的训练后三值量化方法,该方法使用可学习调制和软化三值化技术,仅需512个校准样本即可实现优于BitNet 1.58-bit的性能,并可扩展到235B参数规模。