TransClean:从大型语言模型输出中检测和提取干净翻译的基准

arXiv cs.CL 论文

摘要

TransClean 是一个基准,用于检测和提取来自大型语言模型输出的干净翻译,分析了超过 790,000 个翻译输出以识别噪声模式并评估提取方法。

arXiv:2609.11399v1 公告类型:新 摘要:大型语言模型(LLMs)越来越多地用于机器翻译,但它们的输出常常包含翻译本身之外的额外文本,例如语言标签、解释或双语重复,我们称之为翻译噪声。尽管这一问题普遍存在,但缺乏专门的基准和系统性研究。我们分析了来自12个LLMs在22个语言对(LPs)上的超过790,000个翻译输出,并识别出12种重复出现的噪声模式,将其分为格式噪声和内容噪声。基于观察到的模式,我们构建了TransClean,这是一个包含9,900对噪声和干净翻译输出的可控基准,包括8,800个合成生成实例和1,100个手动策划的真实实例。我们在TransClean基准上评估了两种提取方法:1)一种基于跨度的提取方法,利用翻译质量估计模型进行跨度检测;2)一种基于LLM的提取方法,通过提示LLM来隔离翻译。我们的基准和分析提供了第一个系统性框架,用于评估和提高LLM翻译输出的清洁度。
查看原文
查看缓存全文

缓存时间: 2026/09/11 08:29

# TransClean:一个用于检测和提取大语言模型输出中干净翻译的基准
来源:https://arxiv.org/html/2609.11399

大语言模型(LLMs)正越来越多地用于机器翻译,然而它们的输出常常包含除翻译本身之外的额外文本,例如语言标签、解释或双语重复,我们将其称为**翻译噪声**。尽管这一现象普遍,但相关研究缺乏专门的基准和系统性的研究。我们分析了来自12个大语言模型在22个语言对上产生的超过79万条翻译输出,并识别出12种重复出现的噪声模式,将其归类为**格式**和**内容**噪声。基于观察到的模式,我们构建了TransClean,一个包含9,900对噪声与干净翻译输出的受控基准,其中包含8,800个**合成生成**的实例和1,100个手动策划的**真实**实例。我们在TransClean基准上评估了两种提取方法:1)一种基于片段的提取方法,利用翻译质量估计模型进行片段检测;2)一种基于大语言模型的提取方法,通过提示大语言模型来隔离翻译。我们的基准和分析提供了首个用于评估和改进大语言模型翻译输出干净度的系统性框架。

## 1 引言
大语言模型(LLMs)正在迅速重塑机器翻译(MT)的格局。大语言模型仅通过提示即可执行高质量翻译,并在许多场景中越来越多地达到甚至超越特定任务的翻译系统(Zhang et al., 2023 (https://arxiv.org/html/2609.11399#bib.bib3);Vilar et al., 2023 (https://arxiv.org/html/2609.11399#bib.bib35);Kocmi et al., 2024 (https://arxiv.org/html/2609.11399#bib.bib30);Xu et al., 2024 (https://arxiv.org/html/2609.11399#bib.bib18))。大语言模型的灵活性和多语言能力使其在研究和部署环境中得到广泛应用,从为机器翻译会议(WMT111https://www2.statmt.org/)共享任务(Kocmi et al., 2025 (https://arxiv.org/html/2609.11399#bib.bib27))开发的系统,到像Google翻译(Caswell, 2024 (https://arxiv.org/html/2609.11399#bib.bib19))这样的大型商业平台以及像Instagram这样的社交媒体服务(Meta AI, 2026 (https://arxiv.org/html/2609.11399#bib.bib20))。随着大语言模型越来越多地作为翻译引擎,理解并规范化它们的输出变得至关重要。

图1:构建TransClean以基准测试噪声检测和干净翻译提取的过程。 然而,大语言模型的翻译常常包含除翻译本身之外的额外文本。模型可能不是生成单一的目标语言翻译,而是添加语言标签、附加解释、重复源句或提供文化评论。虽然这种行为在交互场景中可能有所帮助,但它为自动评估和下游集成带来了系统性的挑战。标准的MT评估流程假设模型输出仅包含翻译。额外内容可能会扭曲度量分数,并在大规模基准测试中引入不一致性。我们将这一现象称为**翻译噪声**:大语言模型输出中不属于预期目标翻译的任何内容。在针对多个模型和提示的初步实验中,我们观察到翻译噪声并非罕见。在我们评估的大多数大语言模型中,3%到99%222我们在§\[email protected] (https://arxiv.org/html/2609.11399#S2.SS2)中正式定义并量化了噪声率。的翻译输出包含额外的解释性或格式文本。尽管精心设计的提示(例如,“仅输出翻译。”)可以减少这种行为,但它们并不能完全消除。噪声的普遍性和形式在模型之间差异很大,反映了指令遵循能力的差异。因此,仅通过提示无法可靠地保证干净的翻译。

尽管具有实际重要性,翻译噪声尚未得到系统性研究。先前的工作考察了相关问题,例如多语言环境中的指令遵循(Li et al., 2024 (https://arxiv.org/html/2609.11399#bib.bib21))、指令遗忘(Chen et al., 2023 (https://arxiv.org/html/2609.11399#bib.bib22))以及诸如重复文本或错误目标语言输出等不良行为(Bawden and Yvon, 2023 (https://arxiv.org/html/2609.11399#bib.bib34);Wang et al., 2024 (https://arxiv.org/html/2609.11399#bib.bib33))。现有研究主要集中于通过模型修改或微调来缓解这些问题,或通过提出新的基准(如IFEval(Zhou et al., 2023 (https://arxiv.org/html/2609.11399#bib.bib23))、InFoBench(Qin et al., 2024 (https://arxiv.org/html/2609.11399#bib.bib32))和M-IFEval(Dussolle et al., 2025 (https://arxiv.org/html/2609.11399#bib.bib28)))来评估指令遵循能力。然而,很少有人关注直接分析大语言模型翻译输出中的噪声模式,或开发在不改变底层模型的情况下恢复干净翻译的后处理方法。这一区别在实际部署中至关重要,因为模型可能是专有的、闭源的或重新训练成本过高。

在本研究中,我们将**干净翻译提取**任务形式化:给定一个可能包含翻译噪声的大语言模型输出,提取对应于正确目标语言翻译的片段。我们分三步处理此任务:
1.  **1.** 我们对大语言模型输出中的翻译噪声进行了大规模的实证研究(§\lx@sectionsign2 (https://arxiv.org/html/2609.11399#S2)),分析了来自12个大语言模型在22个语言对上的超过79万条翻译,识别出12种重复出现的噪声模式和2个主要类别。
2.  **2.** 我们构建了TransClean333https://github.com/shenbinqian/TransClean,这是第一个用于干净翻译提取的基准(§\lx@sectionsign3 (https://arxiv.org/html/2609.11399#S3)),包含8,800个合成噪声实例和1,100个手动策划的真实噪声示例,并附有银标准干净翻译。创建TransClean的过程如图1 (https://arxiv.org/html/2609.11399#S1.F1)所示。
3.  **3.** 使用TransClean,我们对两种提取干净翻译的方法(§\lx@sectionsign4 (https://arxiv.org/html/2609.11399#S4))进行了基准测试:1)一种基于片段的提取方法,利用质量估计模型进行片段检测;2)一种基于大语言模型的提取器,提示大语言模型来隔离翻译。在此背景下,我们设计了两个评估指标,以实现标准化比较。

表1:不同提示和大语言模型的噪声率(Noise%)、生成解释性文本的率(Expl%)和输出错误目标语言的率(WrongL%)。我们未在DeepSeek-V3.2-Exp上运行所有提示,因为我们看到提示0通常会导致所有模型产生更高的噪声率。

## 2 大语言模型翻译输出中的噪声
为了评估大语言模型生成的翻译中噪声的普遍性和类型,我们使用12个代表性的大语言模型和3个提示模板(§\[email protected] (https://arxiv.org/html/2609.11399#S2.SS1))为22个语言对(LPs)生成了大量翻译样本。然后,我们系统地检查这些翻译输出,并分析它们的噪声率和模式(§\[email protected] (https://arxiv.org/html/2609.11399#S2.SS2)和§\[email protected] (https://arxiv.org/html/2609.11399#S2.SS3))。

### 2.1 生成噪声翻译
##### 数据来源
我们确定了22个具有不同资源水平和翻译方向的语言对,并从四个平行语料库集合中为每个语言对随机采样3,000个句子对:TED多语言平行语料库(Kulkarni, 2015 (https://arxiv.org/html/2609.11399#bib.bib1))、WMT20质量估计数据集(Barrault et al., 2020 (https://arxiv.org/html/2609.11399#bib.bib37))、SwissAdmin语料库(Scherrer et al., 2014 (https://arxiv.org/html/2609.11399#bib.bib42))和中韩平行语料库(Park and Zhao, 2019 (https://arxiv.org/html/2609.11399#bib.bib2)),共得到一个包含66,000个实例的测试集。有关语言对、数据集大小及其相应来源的详细信息,请参见附录中的表A.1 (https://arxiv.org/html/2609.11399#A1.T1)。

##### 提示模板
我们设计了三个提示模板(见图2 (https://arxiv.org/html/2609.11399#S2.F2)),以研究提示策略如何影响噪声翻译的生成,并确定哪个提示能产生最多的噪声实例。提示0采用自Zhang et al. (2023) (https://arxiv.org/html/2609.11399#bib.bib3),而提示1和提示2是新设计的模板。

提示0
{src_lang}: {src_txt}
{tgt_lang}:

提示1
Translate the following {src_lang} into {tgt_lang}: {src_text}

提示2
Translate the following {src_lang} into {tgt_lang} and only output the target text: {src_text}

图2:用于翻译的提示模板。

##### 模型选择
不同的大语言模型在产生噪声输出方面可能表现出不同的倾向。为了捕捉这种变异性,我们选择了12个开放权重的大语言模型,这些模型涵盖了不同的模型规模、架构、后训练方法和多语言训练覆盖范围。选定的模型包括解码器专用的指令调优模型及其推理变体,例如Qwen3-4B-Instruct-2507和Qwen3-4B-Thinking-2507(Qwen Team, 2025 (https://arxiv.org/html/2609.11399#bib.bib5));大型前沿混合专家模型,如DeepSeek-V3.2-Exp(DeepSeek-AI, 2025 (https://arxiv.org/html/2609.11399#bib.bib17));较小的稠密模型,包括Llama-3.2-3B-Instruct(Meta AI, 2024 (https://arxiv.org/html/2609.11399#bib.bib6))和gemma-3-27b-it(Gemma Team et al., 2025 (https://arxiv.org/html/2609.11399#bib.bib12));最近发布的指令调优编码器-解码器模型,如t5gemma-xl-xl-prefixlm-it(Zhang et al., 2025 (https://arxiv.org/html/2609.11399#bib.bib7));多语言模型,包括aya-expanse-32b(Dang et al., 2024 (https://arxiv.org/html/2609.11399#bib.bib8));以及Tower-Plus-72B(Rei et al., 2025 (https://arxiv.org/html/2609.11399#bib.bib9)),这是一个在Qwen-2.5-72B(Qwen Team, 2024 (https://arxiv.org/html/2609.11399#bib.bib4))上微调的面向翻译的大语言模型。所有模型的详细信息请参见附录中的表A.2 (https://arxiv.org/html/2609.11399#A1.T2)。

##### 推理
我们完全在零样本设置下生成翻译输出。用于生成翻译输出的大语言模型推理的详细信息请参见附录B (https://arxiv.org/html/2609.11399#A2)。

表2:由Claude Opus 4.6检测到的噪声模式、示例及在数据集中的频率(%)。我们使用“...”表示省略的长输出。红色文本表示噪声。

### 2.2 噪声率
为了估算大语言模型输出中翻译噪声出现的频率,我们采用了一个轻量级的基于规则的检测器,它捕获两种常见的噪声类型:解释性文本和错误目标语言生成的文本。该检测器旨在提供噪声普遍性的粗略估计,而不是所有噪声类型的完整描述。对于给定提示,噪声率(Noise%)正式定义为:
Noise% = |E∪W| / N  (1)
其中N表示翻译实例总数,E表示包含解释性文本的输出集合,W表示包含错误目标语言文本的输出集合。我们进一步定义Exp% = |E| / N和WrongL% = |W| / N,以分别衡量解释性噪声和错误语言输出的比例。解释性文本通过匹配常见解释性标记(例如,“解释”和附录C (https://arxiv.org/html/2609.11399#A3)中类似的元语言短语)的正则表达式进行检测。错误语言输出使用fastText语言识别模型(Bojanowski et al., 2017 (https://arxiv.org/html/2609.11399#bib.bib40))进行识别,置信度阈值为60%。如果检测到任一类型的信号,则认为该输出是噪声。虽然这种基于规则的检测器无法捕获所有可能的噪声类型,但正如在§\[email protected] (https://arxiv.org/html/2609.11399#S4.SS4)中所评估的,它足以估算不同提示和模型之间的噪声频率,并识别出§\[email protected] (https://arxiv.org/html/2609.11399#S3.SS2.SSS1)中用于人工策划的噪声候选。

表1 (https://arxiv.org/html/2609.11399#S1.T1)报告了不同提示和模型下的Noise%。提示0在三个提示中产生的噪声输出比例最高,特别是对于错误目标语言的生成,因此我们将其输出用于后续§\[email protected] (https://arxiv.org/html/2609.11399#S2.SS3)中的噪声分析。在模型中,gemma-3-27b-it表现出最高的噪声率(高达99.73%);人工检查证实,它经常在翻译旁边生成解释性文本。跨模型和提示的这些高噪声率凸显了系统性研究此问题的必要性,以及需要专门的方法来提取干净翻译以进行公平的MT评估。

### 2.3 噪声分析
我们利用12个模型使用提示0在22个语言对上生成的全部792,000条翻译输出进行噪声分析。为了在如此庞大的数据集中识别重复出现的噪声模式,我们进行了两阶段分析。首先,我们使用大语言模型Claude Opus 4.6(Anthropic PBC, 2026 (https://arxiv.org/html/2609.11399#bib.bib11))来协助总结和分组输出中类似的噪声行为。给定一个生成的翻译,该模型被提示提出代表性的噪声模式,估计它们的相对频率,并为每个模式提取最多十个代表性示例444所有实例在可用少于十个时都会被保存。。识别出的模式和示例(见表2 (https://arxiv.org/html/2609.11399#S2.T2))随后通过人工检查进行验证和完善。基于此检查,我们将观察到的十二种噪声模式分为两组:**内容**和**格式**噪声,分别对应语义和呈现层面的瑕疵。我们保留了一套相对细粒度的模式集以方便合成噪声生成,同时指出其他分类法也是可能的。由于在此规模上人工验证每种模式的确切频率不可行,因此报告的频率应解释为近似估计而非精确测量。555为了评估...

相似文章

Last Translation Benchmark

Hugging Face Daily Papers

Last Translation Benchmark 推出了一个实时数据集,包含经同行评审的多模态示例,旨在评估并突破领先的机器翻译模型,并配有手工验证规则以确保可靠评估。它针对当前基准测试的饱和问题以及自动指标的不可靠性。