对多语言大语言模型生成文本中翻译腔的研究

arXiv cs.CL 论文

摘要

本文研究了多语言大语言模型生成的文本是否表现出翻译腔的迹象,并将其与人工翻译进行比较,以评估语言的自然度。

arXiv:2608.17399v1 Announce Type: new 摘要: 从另一种语言翻译过来的文本往往带有翻译的痕迹$\unicode{x2014}$因此,它常被称为$\textit{翻译腔}$。多语言大语言模型(MLLMs)生成多种语言的文本。然而,尚不清楚MLLMs的生成是否类似于内部翻译(从英语或其他语言),从而导致翻译腔。在此,我们提出以下研究问题:(1)MLLMs生成的文本是否类似于翻译腔?(2)MLLMs产生的翻译腔与直接翻译产生的翻译腔有何不同?我们利用已建立的翻译文本指标来评估最先进的MLLMs在五种语言中生成的文本,并与非翻译和人工编写的基线进行比较,以将翻译腔与其他类型的干扰区分开来。通过使用高精度分类模型、对单个语言特征的方差分析,以及在两种语言(德语和西班牙语)的子集中收集人类标注,我们评估了MLLMs生成的翻译腔内容,并研究了区分MLLMs生成的文本与典型翻译相关干扰的关键特征。
查看原文
查看缓存全文

缓存时间: 2026/08/19 09:56

# 多语言大语言模型生成文本中的翻译腔现象研究  
来源:https://arxiv.org/html/2608.17399  
Téa Wright  
隶属机构:加州大学伯克利分校  
Julisa Granados  
隶属机构:科罗拉多大学博尔德分校  
Eliana Colunga  
隶属机构:科罗拉多大学博尔德分校  
& Katharina von der Wense  
隶属机构:科罗拉多大学博尔德分校  
隶属机构:美因茨约翰内斯·古腾堡大学  
\{first\.last\}@colorado\.edu  

###### 摘要  
从另一种语言翻译而来的文本往往会保留翻译的痕迹——因此,它们常被称为“翻译腔”。多语言大语言模型(MLLMs)能够生成多种语言的文本。然而,目前尚不清楚MLLMs的生成结果是否类似于内部翻译(从英语或其他语言进行的翻译),从而导致翻译腔的产生。本文提出以下研究问题:(1)MLLMs生成的文本是否类似于翻译腔?(2)MLLMs产生的翻译腔与直接翻译产生的翻译腔有何不同?我们利用已确立的翻译文本指标,评估了最先进MLLMs在五种语言中生成的文本,并与非翻译和人工撰写的基线进行比较,以区分翻译腔与其他类型的干扰。通过使用高精度分类模型、对单个语言特征进行方差分析,以及收集两种语言(德语和西班牙语)子集的人工标注,我们评估了MLLM生成文本中的翻译腔含量,并检查了区分MLLM生成文本与典型翻译相关干扰的关键特征。  

## 1 引言  
众所周知,大语言模型(LLMs)在生成非英语文本方面正变得越来越熟练。ChatGPT<sup>23 (https://arxiv.org/html/2608.17399#bib.bib3)</sup>等系统虽然并非专为多语言生成设计,但已展示出生成非英语文本的一定程度的能力。其他如PaLM2<sup>1 (https://arxiv.org/html/2608.17399#bib.bib2)</sup>等模型则明确为多语言使用而设计,并声称与主要针对英语训练的同类模型相比,其许多语言的流畅度有所提高。LLM生成文本的语言自然性是其整体质量的重要组成部分,对于语言学习材料设计等面向人类的应用高度相关。然而,它常常被更传统的重要属性(如正确性、连贯性和相关性)所掩盖。虽然这些属性对于评估至关重要,但LLMs理想情况下也应反映母语者的自然性,无论何种语言。近年来,MLLMs明显的多语言能力引发了一个问题:它们是否真正以语言学上母语的方式生成非英语文本,还是其输出反映了从主导内部语言(例如英语)翻译的结果。鉴于LLMs的黑箱性质,很难确切知道文本生成背后发生了什么。然而,最近的研究表明,MLLMs可能依赖于以英语为中心的内部表征,即使使用另一种语言提示也是如此<sup>27 (https://arxiv.org/html/2608.17399#bib.bib24)</sup>。在此,我们采用不同的方法,专注于MLLM的*生成*:我们使用翻译文本典型的外部可观察现象(即翻译腔)来评估LLMs。这在评估面向人类应用的LLM自然性以及可解释性研究方面具有潜在影响。图1 (https://arxiv.org/html/2608.17399#S1.F1)显示了翻译腔干扰的一个简单示例。  

在本文中,我们进行了多项实验,旨在回答以下研究问题:(1)MLLMs生成的文本是否类似于翻译腔?(2)MLLMs产生的翻译腔与直接翻译产生的翻译腔有何不同?  

在我们的第一个实验中,我们聚焦于高资源和中资源语言:英语、德语、西班牙语和希腊语。我们将LLM生成的文本与多个参考条件进行比较,使我们能够检查即使在拥有大量训练数据的语言中,多语言生成是否也会出现翻译腔。我们将此分析扩展到低资源语言普什图语,以研究在预训练数据较少时,效果是否会被放大。我们证明,LLM生成的文本在所有语言(甚至英语)中都表现出一定程度的翻译腔,但其在非英语语言中的存在尤为显著。我们进一步分析了单个语言特征,探索了跨语言的结构差异,提出了变异的解释,并为未来评估LLM输出翻译腔的工作建立了方法论。  

图1:翻译腔干扰示例。此示例显示了德语到英语翻译中词性分布n-gram的干扰,这可以通过各种机器学习模型自动检测。  

## 2 相关工作  
##### 翻译腔  
翻译腔指的是文本翻译后留下的“指纹”<sup>8 (https://arxiv.org/html/2608.17399#bib.bib5)</sup>。它被认为是忠于源文本含义同时适应目标语言语法结构的结果<sup>31 (https://arxiv.org/html/2608.17399#bib.bib18)</sup>。这包括独立于源语言的翻译过程的一般性影响,以及特定源语言在目标语言中留下独特印记的方式,这也被称为干扰<sup>18 (https://arxiv.org/html/2608.17399#bib.bib6); 32 (https://arxiv.org/html/2608.17399#bib.bib7)</sup>。33 (https://arxiv.org/html/2608.17399#bib.bib4)的研究表明,翻译腔具有独特特征,可以通过与简化和显化等原则相关的语言指标来索引,这两者都被认为是翻译的普遍现象。即使是经过机器翻译并由人工审阅/编辑的文本,也已被证明表现出翻译腔<sup>30 (https://arxiv.org/html/2608.17399#bib.bib16)</sup>。  

##### 翻译腔的自动检测  
许多研究探讨了如何使用计算方法自动检测或测量翻译腔。3 (https://arxiv.org/html/2608.17399#bib.bib8)和7 (https://arxiv.org/html/2608.17399#bib.bib17)利用支持向量机,以高准确度区分翻译文本及其原文。33 (https://arxiv.org/html/2608.17399#bib.bib4)在先前确定为翻译标志的语言特征上训练分类器,如上所述。这些指标包括基于简化假设的类符-词符比以及句子和单词长度<sup>2 (https://arxiv.org/html/2608.17399#bib.bib13)</sup>,以及基于干扰的词性分布n-gram<sup>32 (https://arxiv.org/html/2608.17399#bib.bib7)</sup>。12 (https://arxiv.org/html/2608.17399#bib.bib31)和25 (https://arxiv.org/html/2608.17399#bib.bib32)也采用了这种翻译腔识别方法。5 (https://arxiv.org/html/2608.17399#bib.bib30)支持使用这些表面特征,指出语义特征可能会引入虚假的主题偏差。最后,最近的研究如26 (https://arxiv.org/html/2608.17399#bib.bib19)和13 (https://arxiv.org/html/2608.17399#bib.bib11)进一步证明,即使没有平行语料库,翻译腔也可以被有效量化。  

##### 多语言与大语言模型  
先前的研究表明,MLLMs在捕捉文化细微差别以及平衡通用知识与特定语言细节方面存在困难,尤其是对于低资源语言——这些挑战直接关系到翻译腔,因为它与语言保真度密切相关<sup>19 (https://arxiv.org/html/2608.17399#bib.bib14); 11 (https://arxiv.org/html/2608.17399#bib.bib15)</sup>。另一个近期关于MLLMs的研究方向探讨了多语言能力如何与翻译相关,无论是在内部还是外部。例如,6 (https://arxiv.org/html/2608.17399#bib.bib1)观察到,诸如将输入翻译成英语的推理策略可以提高多语言环境中的性能。20 (https://arxiv.org/html/2608.17399#bib.bib34)同样发现LLM翻译表现出翻译腔,并将其追溯到监督微调的偏差,而不仅仅是推理时的处理。另一项研究表明,即使在其他语言提示下,MLLMs也会将标记传递通过英语表征空间。模型预训练的多样性越低,这种效应就越显著<sup>27 (https://arxiv.org/html/2608.17399#bib.bib24)</sup>。总之,这些发现表明,多语言生成可能涉及以英语为中心的处理或隐式翻译。  

## 3 人工撰写的数据  
### 3.1 德语、西班牙语和希腊语数据  
对于德语、西班牙语和希腊语,我们利用了欧洲议会数据集(Europarl)<sup>17 (https://arxiv.org/html/2608.17399#bib.bib21)</sup>中的母语者和非母语者人工翻译文本。该数据集是一个从1996年至2012年欧洲议会记录中收集的广泛多语言平行语料库。我们对文本进行分词,并将其划分为大约2000个标记(在句子边界结束)的块,以确保文章长度不会干扰分类。最终,德语和西班牙语数据集各包含8000个样本,其中4000个是母语撰写的,4000个是从英语翻译成德语或西班牙语的。我们使用80/20的训练/测试划分,分别得到6400和1600个训练和测试实例。<sup>111</sup>我们使用10折交叉验证进行模型开发。在我们的测试集中,我们还包括一个子集,该子集提取了翻译成目标语言*之前*的非母语、人工撰写的文本,并使用Google Translate进行翻译。包含此条件是必要的,以便将翻译腔效应与LLM生成效应区分开来;它允许我们测试分类器的信号是由以下因素驱动的:1. (a)翻译腔,它应以类似方式影响“人类 + 机器翻译”和“LLM + 机器翻译”文本,或 2. (b)LLM特有的风格偏差,这将导致“LLM + 机器翻译”条件与“人类 + 机器翻译”基线产生差异,即使两者经历了相同的机器翻译处理。最后,我们包含了由Gemini或Llama翻译的母语者人工文本配置,以检查任何潜在的模型特定翻译偏差。对于希腊语,虽然数据也按上述方式处理,但我们仅获得了大小为6000的数据集(训练/测试划分为4800/1200)。尽管我们从与德语和西班牙语相同的来源获取数据,但我们注意到,在微软的语言多样性指数<sup>15 (https://arxiv.org/html/2608.17399#bib.bib10)</sup>(其中5是资源最多的类别,0是最少的)中,希腊语被归为3级,这意味着其资源有些有限,但仍多于全球近95%的语言。  

### 3.2 英语数据  
我们还开发了一个用于比较的英语数据集,以确保我们测量的干扰是由于翻译腔,而不是纯粹来自LLM生成的干扰(这种干扰会出现在任何语言中)。我们也为此使用了Europarl,收集了一个与德语数据集比例匹配的数据集(6400/1600)。其中4000个是原始英语写作,4000个是从用于训练33 (https://arxiv.org/html/2608.17399#bib.bib4)分类器的十种语言翻译而来(每种语言400个)。  

### 3.3 普什图语数据  
我们进行了一项额外的实验,重点关注低资源语言普什图语,这是一种东部伊朗语言,全球约有4500万至5500万使用者。在微软的语言多样性指数<sup>15 (https://arxiv.org/html/2608.17399#bib.bib10)</sup>中,普什图语在0-5的量表中被归为1级,这意味着与英语、西班牙语、德语甚至希腊语相比,其数字资源非常有限。对于普什图语,我们主要通过爬取普什图语维基百科文章来收集母语者数据。我们从一个热门页面开始,随机选择其包含的链接,然后访问该页面并重复此过程。我们提取通过随机爬取获得的每篇文章标题对应的前10个句子。如果一篇文章少于10个句子,我们将其舍弃并选择另一篇。我们总共从500篇文章中收集了样本。为了获得人工翻译成普什图语的数据,我们利用了开放语言数据倡议(OLDI)种子数据集<sup>21 (https://arxiv.org/html/2608.17399#bib.bib22)</sup>。OLDI种子数据集包含约6193个句子,这些句子摘自英语维基百科并翻译成44种不同的语言。由于数据集中的条目是按句子存储的,我们按文章重组它们,并将其分成10句长的块。这最终产生了500个人工翻译的普什图语样本,均来自英语维基百科文章。我们最终的普什图语人工数据集包含1000个样本,训练/测试划分为800/200,划分在文章级别进行,以确保来自同一源文章的块不会同时出现在两个集合中。虽然不像我们的其他数据集那样是直接平行的,但此类可比语料库已被证明对翻译腔检测有效<sup>26 (https://arxiv.org/html/2608.17399#bib.bib19); 13 (https://arxiv.org/html/2608.17399#bib.bib11)</sup>。  

### 3.4 Europarl-UdS  
最后,我们在附录C (https://arxiv.org/html/2608.17399#A3)中包含了一个额外的实验,以进一步验证我们的西班牙语和德语结果。该实验使用了Europarl-UdS数据集<sup>16 (https://arxiv.org/html/2608.17399#bib.bib33)</sup>,这是Europarl的一个专门整理版本,分离了经证实由母语者发表的文本。我们不能使用UdS来替代我们的主要评估来源,因为它目前仅适用于英语、德语和西班牙语,并且仅提供英语到目标语的翻译平行数据,这使得它不足以满足我们完整的多语言评估需求(我们的英语验证基线也无法完全由UdS替代,因为英语仅在平行数据的源语言一侧)。  

## 4 实验  
我们的目标是评估几种具有不同特定语言训练文本可用水平的语言中,MLLM生成文本中的翻译腔水平。我们使用以下配置生成的每种语言的样本:(1)MLLM在目标语言中生成,(2)MLLM在英语中生成 + 机器翻译系统翻译,(3)目标语言母语者,(4)英语母语者 + 人工翻译,(5)英语母语者 + 机器翻译系统翻译,(6a)英语母语者 + Gemini翻译器,和(6b)英语母语者 + Llama翻译器。我们试图选择一组多样化的语言,以确保观察结果在不同语言中有效;所选语言在语言多样性指数、形态句法复杂性以及与英语的相似性方面有所不同。我们包含使用人工翻译和机器翻译的配置,以确保分类器能够准确分类两者,以及可能出现的任何LLM特定差异。  

### 4.1 测量翻译腔水平  
本节概述了我们用于评估所有模型或模型组合生成的文本是否存在翻译腔的指标,包括单个语言指标以及来自高精度二进制分类器的分类结果。  

#### 4.1.1 语言指标

相似文章

大型语言模型有多像人类?一个关注语域的语言评估框架

arXiv cs.CL

本文提出了一种关注语域的语言评估框架,通过使用最大均值差异(MMD)比较人类与LLM生成文本中67个词汇语法特征的分布,来评估大型语言模型(LLM)的人类相似度。在七个经过指令微调的开源模型和五个语域上的实验表明,没有模型能完美匹配人类基线,且与人类语言的接近程度因语域而异,而非模型规模。

语言再生:信息局部性对重建影响的探究

arXiv cs.CL

本文研究了在不可能语言(信息局部性被破坏)上预训练的GPT-2模型如何恢复自然英语,显示出对更短依赖长度的偏好以及结构恢复与表层恢复之间的分离。

语言模型中跨语言泛化的体外研究

arXiv cs.CL

本文引入了一个使用两种程序生成语言的体外框架,用于研究语言模型中的跨语言泛化,发现分词对可复用子结构的保留能力对于跨语言能力迁移比词汇相似性或数据平衡更为关键。

大型语言模型总是讲相同的故事吗?

arXiv cs.CL

本文研究大型语言模型是否能够生成多样化的故事。通过叙事相似性分析,作者发现,LLM生成的叙事彼此之间的相似度始终高于人类撰写的故事,而常见的缓解策略(如负面提示和温度缩放)未能解决这种同质化问题。