苹果比苹果?迈向可比的跨语言语言模型评估

arXiv cs.CL 论文

摘要

本文研究了语言模型跨语言评估方法的公平性,表明常见的归一化指标可能因分词和正字法差异而存在偏差,并提出使用语义等价序列上的句子级负对数似然进行更一致的跨语言比较。

arXiv:2608.25089v1 公告类型:新 摘要:语言模型的跨语言评估,实现公平比较,仍然是多语言NLP中的一个基本挑战。现有研究采用了各种下游任务和内在指标,并具有不同的理论依据,但几乎没有实证研究这些方法是否能产生有意义的跨语言结论。我们系统性地检查了跨语言评估方法,使用控制的单语语言模型在平行数据上训练,具有不同的分词器词汇大小和模型大小,并在多语言LLMs上进一步验证我们的发现。我们进一步讨论了实现跨语言可比下游评估的挑战。我们的结果表明,几个广泛使用的归一化指标引入了源于分词、编码和正字法差异的跨语言偏差。相比之下,在语义等价序列上计算的句子级负对数似然提供了更有意义和更一致的跨语言比较。
查看原文
查看缓存全文

缓存时间: 2026/08/27 09:15

# 从苹果到苹果?迈向可比的跨语言语言模型评估  
来源:https://arxiv.org/html/2608.25089  
Ethan Gotlieb WilcoxCatherine ArnettGeorgetown UniversityEleutherAIAffiliation:\{xy236,ethan\.wilcox\}@georgetown\.edu, catherine@eleuther\.ai  

###### 摘要  
能够实现公平比较的语言模型跨语言评估仍然是多语言自然语言处理中的一个基本挑战。现有研究采用了多种下游任务和具有不同理论依据的内在指标,但尚未对这些方法是否能得出有意义的跨语言结论进行实证研究。我们系统地考察了跨语言评估方法,使用在平行数据上训练的受控单语语言模型,这些模型具有不同的分词器词汇表大小和模型大小,并在多语言大语言模型上进一步验证了我们的发现。我们进一步讨论了在不同语言间实现可比的下游评估所面临的挑战。我们的结果表明,几种广泛使用的归一化指标引入了源于分词、编码和正字法差异的跨语言偏见。相比之下,在语义等价序列上计算的句子级负对数似然提供了更有意义和一致性的跨语言比较。代码:https://github.com/xiulinyang/multilingual-eval.git;模型:https://huggingface.co/parallelm。加载分词器时,请使用PreTrainedTokenizerFast而不是AutoTokenizer。  

## 1 引言  
在类型学多样的语言中公平地评估语言模型是多语言自然语言处理中一个基本但常被忽视的挑战。尽管在将语言技术扩展到越来越多的语言方面取得了重大进展,包括单语模型(Aravinda等人,2025(https://arxiv.org/html/2608.25089#bib.bib29);Zosa等人,2025(https://arxiv.org/html/2608.25089#bib.bib33),例如,)和多语言模型(BigScience Workshop等人,2023(https://arxiv.org/html/2608.25089#bib.bib7),例如,),但不同语言之间的性能差距仍然很大(Chang等人,2023(https://arxiv.org/html/2608.25089#bib.bib34);Joshi等人,2020(https://arxiv.org/html/2608.25089#bib.bib14);Shani等人,2026(https://arxiv.org/html/2608.25089#bib.bib48))。然而,准确地测量这些差距本身就是一个挑战:不同的指标可能会得出关于跨语言模型性能的截然不同的结论(Shani等人,2026(https://arxiv.org/html/2608.25089#bib.bib48)),这引发了什么是*公平*比较的疑问。多语言自然语言处理中的评估方法大致分为两类。下游任务评估在一系列语言能力上评估模型,但使用这种评估进行公平的跨语言比较远非直截了当:结论高度依赖于任务(Rust等人,2021(https://arxiv.org/html/2608.25089#bib.bib30);Limisiewicz等人,2023(https://arxiv.org/html/2608.25089#bib.bib3)),并且对于许多语言,特定语言的基准可能不存在。相比之下,内在指标直接量化模型为保留的平行文本分配概率的程度,为跨语言比较提供了一个更可行和可控的信号。然而,正如我们下面所讨论的,“更可控”并不一定意味着“公平”。图1:内在指标在跨分词器和跨语言比较中的适用性(✓= 适合;✗= 不适合;✓\\checkmark= 有条件地适合)。在语义等价的平行内容上计算的句子NLL是唯一适合这两种比较的指标。  
在内在评估内,对于使用哪种基于概率的指标没有共识。一项工作评估分配给跨语言表达相同含义的序列的概率,通常使用负对数似然、惊异度或相关的派生指标(Mielke等人,2019(https://arxiv.org/html/2608.25089#bib.bib46);Cotterell等人,2018(https://arxiv.org/html/2608.25089#bib.bib23);Wan,2022(https://arxiv.org/html/2608.25089#bib.bib27),例如,)。另一种常见方法依赖于单位归一化变体,如困惑度(PPL;Shliazhko等人,2024(https://arxiv.org/html/2608.25089#bib.bib25);Arnett和Bergen,2025(https://arxiv.org/html/2608.25089#bib.bib19);Thakur等人,2025(https://arxiv.org/html/2608.25089#bib.bib12))、每字节位数(BPB;Xue等人,2022(https://arxiv.org/html/2608.25089#bib.bib36))或每字符位数(BPC;Blevins等人,2022(https://arxiv.org/html/2608.25089#bib.bib37)),它们分别通过令牌、字节或字符归一化似然性。尽管每个指标都有直观的理由(例如,BPB与分词器无关;Gao等人,2020(https://arxiv.org/html/2608.25089#bib.bib1)),但关于使用哪个指标的经验证据仍然有限。最近,Poelman和de Lhoneux(2026)(https://arxiv.org/html/2608.25089#bib.bib15)认为,当前的评估指标可能不具有普遍可比性,原因有两个:(i)不同指标可能产生不同的跨语言排名,(ii)即使在单一指标内,表达相同含义的释义也可能导致不一致的跨语言排名。这些发现使得更广泛的问题悬而未决,即什么构成了公平的跨语言比较。在本文中,我们认为一个公平的指标应满足三个标准:首先,它应该*不被系统性地工程选择所驱动*,特别是分词、编码和正字法。也就是说,语言排名应反映语言建模质量,而不是表征层面的因素,如字符数、字节数或令牌数。其次,它应该*对语义等价形式的变化具有鲁棒性*:语言排名在表达相同内容的不同翻译选项中应保持稳定。第三,它应该*模型通用*,这意味着其行为应能跨不同规模的单语和多语言模型推广。为了将指标行为与多语言模型中固有的混淆因素隔离开来,我们首先使用在平行语料库上训练的50个单语语言模型,这些模型具有五种词汇表大小设置(Yang等人,2026(https://arxiv.org/html/2608.25089#bib.bib10)),并进行六种内在指标的系统实证比较,然后将这种比较扩展到更大的单语和多语言模型。我们发现六种指标中有五种违反了上述至少一个标准。相比之下,句子级NLL(通过意义而非表层单元如语素或字符进行归一化)满足所有三个标准:它(i)对分词和编码选择的敏感性大大降低(第4节(https://arxiv.org/html/2608.25089#S4)),(ii)在不同翻译选项中更稳定(第5节(https://arxiv.org/html/2608.25089#S5)),并且(iii)适用于跨规模的单语和多语言设置(第6节(https://arxiv.org/html/2608.25089#S6))。我们的结果挑战了多语言评估文献中的常见做法和最新提议。我们表明,令牌归一化指标(如困惑度)和字符级及字节级替代指标(这些已被明确主张为更鲁棒(Shani等人,2026(https://arxiv.org/html/2608.25089#bib.bib48)))引入了显著且系统的偏差,偏向于序列更长或令牌数更多的语言。同时,我们实证验证了先前工作使用的理论驱动假设,即使用句子级NLL或相关变换指标(Mielke等人,2019(https://arxiv.org/html/2608.25089#bib.bib46);Cotterell等人,2018(https://arxiv.org/html/2608.25089#bib.bib23);Chang等人,2023(https://arxiv.org/html/2608.25089#bib.bib34),例如,),为先前缺乏直接实证支持的说法提供了证据。我们进一步讨论了下游评估的注意事项,指出在不同语言和任务之间实现可比评估的挑战。  

## 2 背景与相关工作  
### 2.1 分词与表征偏差  
为了使跨语言评估有意义,有必要将内在的语言复杂性与表征和预处理选择引入的技术假象区分开来(Shani等人,2026(https://arxiv.org/html/2608.25089#bib.bib48))。先前的工作已经确定了几个此类假象的来源,特别是那些由分词和正字法编码引起的假象(Petrov等人,2023(https://arxiv.org/html/2608.25089#bib.bib44);Ahia等人,2024(https://arxiv.org/html/2608.25089#bib.bib4),例如,)。  

#### 分词  
语言模型被训练来预测离散令牌词表中序列的下一个令牌。因此,文本被分割成令牌的方式直接影响模型如何表示和学习语言结构。跨语言的语义等价内容可以被分割成数量差异很大的令牌,即使使用相同的分词算法也是如此(Petrov等人,2023(https://arxiv.org/html/2608.25089#bib.bib44);Arnett等人,2025(https://arxiv.org/html/2608.25089#bib.bib54))。这种差异通常用语料库令牌计数(CTC;Schmidt等人,2024(https://arxiv.org/html/2608.25089#bib.bib24))来量化,它衡量在给定分词器下编码语料库所需的令牌总数。令牌分割的差异可能影响训练动态和评估指标。即使在相同的分词设置下,不同语言也可能被分割成数量差异显著的片段,这可能影响模型性能(Shani等人,2026(https://arxiv.org/html/2608.25089#bib.bib48))。因此,不同语言可能受益于不同的分词策略(Fujii等人,2023(https://arxiv.org/html/2608.25089#bib.bib50);Vemula等人,2025(https://arxiv.org/html/2608.25089#bib.bib53);Reddy等人,2025(https://arxiv.org/html/2608.25089#bib.bib49);Toraman等人,2023(https://arxiv.org/html/2608.25089#bib.bib47),例如,)。例如,Toraman等人(2023)(https://arxiv.org/html/2608.25089#bib.bib47)表明,像土耳其语这样形态丰富的语言需要更大的词汇表大小来训练和微调编码器模型。  

#### 正字法与编码  
表征差异也源于正字法编码的差异。用不同文字书写的相同语义内容可能需要不同数量的UTF-8字节,这种现象称为字节溢价(Arnett等人,2024(https://arxiv.org/html/2608.25089#bib.bib45))。类似地,不同的书写系统可能使用数量差异显著的字符对等效内容进行编码,这被称为长度溢价(Arnett等人,2024(https://arxiv.org/html/2608.25089#bib.bib45))。这些表征差异与语言意义无关,但可能系统性地扭曲通过字节或字符归一化的评估指标。  

### 2.2 跨语言评估  
最广泛采用的方法依赖于在跨语言的语义等价序列上计算负对数似然(NLL)。在这个框架内,研究在如何对原始NLL分数进行归一化方面存在差异。Cotterell等人(2018)(https://arxiv.org/html/2608.25089#bib.bib23)和Mielke等人(2019)(https://arxiv.org/html/2608.25089#bib.bib46)通过特定语言(通常是英语)的字符数对句子级惊异度进行归一化,使用所得分数按难度对语言进行排名。Limisiewicz等人(2024)(https://arxiv.org/html/2608.25089#bib.bib35)采用类似方法,但通过字节数进行归一化。Wan(2022)(https://arxiv.org/html/2608.25089#bib.bib27)简单地将整个开发集上的句子级NLL聚合而不进行归一化。Tsvetkov和Kipnis(2024)(https://arxiv.org/html/2608.25089#bib.bib26)提出了一个更结构化的替代方案,他们引入了信息均等(IP),定义为英语NLL与平行文本上另一种语言NLL的比率。其他工作使用不同粒度的指标评估多语言模型。Shliazhko等人(2024)(https://arxiv.org/html/2608.25089#bib.bib25)报告了跨语言的困惑度分数,而Blevins等人(2022)(https://arxiv.org/html/2608.25089#bib.bib37)主张每字符位数(BPC)是更中立的语言单位。字节级语言模型进一步转向每字节位数(BPB;Xue等人,2022(https://arxiv.org/html/2608.25089#bib.bib36);Zhang和Xu,2022(https://arxiv.org/html/2608.25089#bib.bib80)),Shani等人(2026)(https://arxiv.org/html/2608.25089#bib.bib48)建议,当分数缩放到共享单位时,这可能产生更公平的比较。尽管每个指标都有明显的理论依据,但Poelman和de Lhoneux(2026)(https://arxiv.org/html/2608.25089#bib.bib15)证明,对同一模型在相同数据上应用不同的指标可能产生冲突的语言排名。这突显了指标选择不仅仅是一个技术细节,而是一个具有解释意义的实质性决策。本工作为跨语言评估中的指标选择提供了具体的实证指导,并为推进公平多语言自然语言处理的持续努力做出了贡献。  

## 3 现有内在指标及其潜在混淆因素  
在本节中,我们回顾语言建模中使用的主要基于概率的指标,并评估它们在跨语言和跨模型比较中的适用性。设\(t_i\)为序列\(\mathbf{s}\)中的第\(i\)个令牌,该序列具有\(b\)个UTF-8字节、\(c\)个字符,并且可以被分割成\(n\)个令牌。  

#### 每字节位数  
BPB由Gao等人(2020)(https://arxiv.org/html/2608.25089#bib.bib1)提出,因为“它对不同分词方案的不变性以及度量Unicode中字符的模糊性”。  
BPB(s)=−1b∑i=1nlog2(P(t_i | t_{<i}))  
尽管BPB在理论上与分词无关,但我们发现它与按令牌数、字符数和字节数衡量的序列长度存在强烈相关性(p < 0.01),而Sent-NLL则没有显示出与这些长度度量的显著相关性。  

## 5 实验2:Sent-NLL对翻译选项更具鲁棒性  
对Sent-NLL的一个潜在反对意见是,同一文本的不同翻译可能产生不同的概率分布,导致不一致的跨语言排名(Poelman和de Lhoneux,2026(https://arxiv.org/html/2608.25089#bib.bib15))。然而,Poelman和de Lhoneux(2026)(https://arxiv.org/html/2608.25089#bib.bib15)使用同一语言内的翻译和释义而不仅仅是翻译来展示这种不稳定性。因为释义允许更灵活的措辞,只要保持意义的要点(Neusner,1986(https://arxiv.org/html/2608.25089#bib.bib75);Bhagat和Hovy,2013(https://arxiv.org/html/2608.25089#bib.bib2)),它们更有可能编码不同数量的信息。在这种情况下,他们的发现涉及语言内变异,而不是平行翻译跨语言比较的有效性。我们在附录D(https://arxiv.org/html/2608.25089#A4)中对此假设进行了额外讨论。  

#### 实验设置。  
为了测试每个指标对意义等价翻译的敏感性,我们使用仅翻译重新评估了Poelman和de Lhoneux(https://arxiv.org/html/2608.25089#bib.bib15)的(2026(https://arxiv.org/html/2608.25089#bib.bib15))实验,并额外评估了Sent-NLL。具体来说,我们使用WMT2019中的英德翻译对。

相似文章

语言模型水印中的跨语言公平性审计

arXiv cs.CL

本文提出了一种针对语言模型水印跨语言公平性的评估框架,揭示了语言间的差异是语言类型学结构所致,而非特定语言的个别现象。

衡量跨语言理解差距:证据语言如何影响语言模型的理解

arXiv cs.CL

本文引入了跨语言理解差距(CLCG)指标,用于衡量当内容以非英语语言呈现时,LLM响应质量的下降程度。通过对18种语言和多个模型的评估,研究发现性能显著下降,尤其是在低资源语言上,这对以英语为中心的能力迁移假设提出了质疑。

语言模型中跨语言泛化的体外研究

arXiv cs.CL

本文引入了一个使用两种程序生成语言的体外框架,用于研究语言模型中的跨语言泛化,发现分词对可复用子结构的保留能力对于跨语言能力迁移比词汇相似性或数据平衡更为关键。