面向语言集成可靠性审计的多语言句子嵌入
摘要
本文评估了多语言句子嵌入能否在教育评估中替代翻译进行跨语言的语言集成可靠性审计,发现母语嵌入能紧密复现基于翻译的可靠性估计。
arXiv:2607.17466v1 Announce Type: new
Abstract: 多语言评估系统通常依赖翻译进行评分和质量控制过程。我们评估了多语言句子嵌入能否替代翻译后的英语输入,用于跨11个PIRLS建构反应试题和三种嵌入模型的语言集成可靠性审计(LiRA)。母语嵌入紧密复现了基于翻译的可靠性估计,同时恢复了因翻译失败而被排除的应答,可靠性无明显变化。
查看缓存全文
缓存时间: 2026/07/21 06:45
# 用于语言集成可靠性审计的多语言句子嵌入
来源: https://arxiv.org/html/2607.17466
Ummugul Bezirhan, Ji Yoon Jung, Matthias von Davier 波士顿学院,栗树山,马萨诸塞州,美国 \{bezirhan, jungjg, vondavim\}@bc\.edu
###### 摘要
多语言评估系统通常依赖翻译进行评分和质量控制过程。我们评估了多语言句子嵌入能否在11个PIRLS构答反应项目和三种嵌入模型中,替代翻译后的英文输入用于语言集成可靠性审计(LiRA)。母语嵌入在紧密复现基于翻译的可靠性估计的同时,还能恢复因翻译失败而被排除的回答,且可靠性没有显著变化。
# 用于语言集成可靠性审计的多语言句子嵌入
Ummugul Bezirhan, Ji Yoon Jung, Matthias von Davier
波士顿学院
栗树山,马萨诸塞州,美国
\{bezirhan, jungjg, vondavim\}@bc\.edu
## 1 引言
国际大规模评估(ILSAs)如PIRLS和TIMSS,越来越多地探索并实施自动化方法,用于构答反应(CR)项目的评分和质量控制(例如,Junget al.,2024 (https://arxiv.org/html/2607.17466#bib.bib9);Tyacket al.,2024 (https://arxiv.org/html/2607.17466#bib.bib17))。由于这些评估同时涉及数百种语言,多语言处理仍然是一个核心方法论挑战。因此,自动化评分系统必须支持对语言多样化的回答集进行可靠的语义处理,同时保持跨国家和语言的可比性。多语言自动化评分的一个常见策略是“先翻译后评分”范式,即在评分前将学生回答翻译成英语(Horbachet al.,2024 (https://arxiv.org/html/2607.17466#bib.bib8);Junget al.,2024 (https://arxiv.org/html/2607.17466#bib.bib9))。这种方法通过允许单一的基于英语的评分系统应用于多种语言和国家,简化了部署。最近基于大语言模型(LLM)的评分框架进一步将翻译直接整合到提示工作流程中,使得多语言回答可以在统一的评分框架内处理(Junget al.,2025b (https://arxiv.org/html/2607.17466#bib.bib11))。尽管这些方法显著提高了可扩展性和多语言覆盖率,但它们仍然依赖翻译作为中间表示。即使直接对母语书写的回答进行评分(Junget al.,2026 (https://arxiv.org/html/2607.17466#bib.bib12)),翻译通常作为关键组成部分保留,用于后续流程,如质量控制程序、一致性检查、可靠性分析和人工审核。虽然基于LLM的上下文感知翻译比传统神经机器翻译能更好地保留原始含义和细微差别(Junget al.,2025b (https://arxiv.org/html/2607.17466#bib.bib11)),但翻译过程中引入的任何失真都可能传播到评分之外的后续测量和验证活动中。
然而,翻译并非必然是一个中性的预处理步骤。先前关于跨语言表示学习的研究表明,语义空间在语言之间并非完全同构,尤其是对于结构差异较大或资源匮乏的语言(Søgaardet al.,2018 (https://arxiv.org/html/2607.17466#bib.bib15); Beinborn and Choenni,2020 (https://arxiv.org/html/2607.17466#bib.bib1))。即使翻译在表层看起来语义准确,它也可能改变局部邻域结构、成对相似性关系或嵌入几何形态。对于直接依赖回答间语义相似性关系的下游任务来说,此类失真可能尤为重要(Bezirhanet al.,2026 (https://arxiv.org/html/2607.17466#bib.bib2))。
这个问题与LiRA(语言集成可靠性审计;Junget al.,2025a (https://arxiv.org/html/2607.17466#bib.bib10))尤其相关,这是一个最近提出的用于多语言评分系统的可靠性审计框架。LiRA利用学生回答之间的语义相似性关系来估计可靠性。对于每个回答,该框架在嵌入空间中检索语义最相似的邻近回答,并使用邻近回答的标签构建一个相似性加权基准分数。然后,通过评估原始分数与基于邻域的基准分数之间的一致性来估计可靠性。由于LiRA完全在嵌入空间中运行,翻译引起的语义邻域变化可能会影响邻居检索、基准构建,并最终影响可靠性估计。
最近的研究表明,翻译会在多语言嵌入空间中引入可测量的语义漂移。在多语言句子嵌入模型中,已观察到翻译引起的成对相似性、局部邻域保持和全局几何对齐的变化(Artetxe and Schwenk,2019 (https://arxiv.org/html/2607.17466#bib.bib14); Conneau and Lample,2019 (https://arxiv.org/html/2607.17466#bib.bib4); Kornblithet al.,2019 (https://arxiv.org/html/2607.17466#bib.bib13))。然而,目前尚不清楚这些几何变化是否会在诸如LiRA之类的下游可靠性审计任务中产生有意义的影响。重要的是,多语言嵌入模型的进步现在允许直接从母语回答中计算语义表示,而无需翻译成英语。
本研究调查了LiRA是否必须依赖翻译。具体而言,我们比较了原始的基于翻译的LiRA流程与一个多语言流程,后者使用多语言句子嵌入直接嵌入母语回答。利用跨多种语言的11个PIRLS CR项目,我们评估了多语言LiRA是否能够在减少对翻译预处理依赖的同时,复现从翻译后英语回答中获得的可靠性估计,并恢复因缺少翻译而被排除的回答。
## 2 概念框架
翻译不仅仅是一个技术性预处理步骤;它可能改变学生回答的语言和语义特征。机器翻译和基于LLM的翻译系统旨在生成流畅的目标语言输出,这可能会规范化学生写作中常见的特征,包括零散表达、非标准拼写和语码转换。在某些情况下,翻译还可能改变或省略原始回答中包含的信息,尤其是当回答简短、模糊或依赖上下文时(Beinborn and Choenni,2020 (https://arxiv.org/html/2607.17466#bib.bib1); Somerset al.,2006 (https://arxiv.org/html/2607.17466#bib.bib16))。这种变化对于简短的CR项目尤其相关,因为单一的想法或短语可能决定所分配的分数。因此,即使是微小的含义变化也可能影响自动化评分结果和后续的可靠性分析。
这些挑战在不同语言中并非均匀分布。对于资源匮乏和形态复杂的语言,翻译质量通常较低,因为有限的训练数据、丰富的屈折系统以及更大的正字法变异性增加了翻译错误的可能性(Beinborn and Choenni,2020 (https://arxiv.org/html/2607.17466#bib.bib1))。在实际操作中,翻译可能会被跳过或产生不完整的输出,从而需要将受影响的回答排除在后续分析之外。因此,基于翻译的流程可能不成比例地影响那些本已最难可靠建模的语言和回答类型。
翻译引起的语义漂移不一定是由于明显的误译。即使翻译在语言上是准确的,翻译后的表达可能并不具有与原始表达完全相同的语义关联。跨语言语义学研究表明,概念在不同语言中的语义范围往往不同(Conneauet al.,2018 (https://arxiv.org/html/2607.17466#bib.bib3)),而将语言投影到一个共享表示空间既可能通过跨语言词义消歧来锐化细粒度区分(Faruqui and Dyer,2014 (https://arxiv.org/html/2607.17466#bib.bib6)),也可能通过诸如枢纽性(hubness)等现象使其模糊化——即少量表示在其它表示的最近邻居中出现频率过高(Dinuet al.,2014 (https://arxiv.org/html/2607.17466#bib.bib5))。因此,对人类读者来说看似等价的回答,在语义空间中可能占据不同的位置,并表现出不同的邻域关系。对于依赖语义相似性的基于检索的方法,这些局部变化可能比全局几何结构的变化更具影响。对于基于嵌入的方法,这些差异之所以重要,是因为它们不仅影响个体回答的表示,还影响它们与周围回答之间的关系(Bezirhanet al.,2026 (https://arxiv.org/html/2607.17466#bib.bib2))。翻译后的回答可能与其原始版本大致相似,但会表现出不同的最近邻关系、改变的局部密度或增加的枢纽性。此类变化对于依赖局部邻域结构而非全局几何对齐的基于检索的方法尤其相关。
LiRA通过利用嵌入空间中回答之间的语义关系来估计可靠性,而不是依赖额外的人工评分(Junget al.,2025a (https://arxiv.org/html/2607.17466#bib.bib10))。对于每个回答,LiRA检索语义最相似的邻近回答,从它们的标签构建一个相似性加权基准分数,并通过原始分数与这个基于邻域的基准之间的加权完全一致来估计可靠性。由于LiRA完全在语义邻域上运行,其有效性直接依赖于底层表示空间的质量。在基于翻译的实现中,该空间是由多语言回答的英语翻译构建的。因此,翻译引起的局部邻域结构变化可能会影响邻居检索、基准构建,并最终影响可靠性估计。
最近的多语言句子嵌入模型提供了一种替代方案,通过在共享的多语言语义空间中直接以母语表示回答。如果多语言表示保留了基准构建所需的局部邻域结构,那么翻译对于基于语义相似性的可靠性审计来说可能是不必要的。本研究通过在其他条件相同的情况下比较基于翻译和多语言的LiRA流程来评估这种可能性。
## 3 方法
### 3.1 数据和设计
我们使用PIRLS 2021年对来自三个阅读文章的11个二分评分CR项目的阅读理解回答。每个项目有效评分的回答数量从12,729到15,794不等,涵盖参与PIRLS 2021的29个国家的语言。
本研究的目标是隔离翻译对LiRA可靠性估计的影响。为此,LiRA程序和嵌入模型保持不变,仅改变提供给编码器的文本表示。评估了两种处理条件。在基于翻译的条件下,在嵌入之前使用GPT-4.1并采用上下文丰富的翻译框架将回答翻译成英语。这对应于原始的LiRA实现(Junget al.,2025a (https://arxiv.org/html/2607.17466#bib.bib10))。对于提出的无翻译条件,回答直接以其原始语言嵌入,无需翻译步骤。
在两种条件下,使用相同的嵌入模型、LiRA参数和可靠性估计程序。因此,可靠性估计中的任何差异都可以归因于使用翻译后的表示与母语表示,而不是模型架构或评分方法论的差异。
### 3.2 LiRA程序
我们形式化地总结LiRA,以明确翻译可能进入可靠性估计过程的环节。考虑一个项目的一组NN个已评分回答。每个回答ii有一个观察到的人工分数hi∈Sh\_\{i\}\\in S,其中SS是该项目的分数集。在本研究中,所有项目都是二分评分的,因此S=\{0,1\}S=\\\{0,1\\\}。
设xix\_\{i\}表示回答ii的文本表示。在基于翻译的条件下,xix\_\{i\}是回答的英语翻译;在无翻译条件下,xix\_\{i\}是原始的母语回答。编码器ff将回答文本映射到一个嵌入向量:
ei=f\(xi\)∈Rd,\\mathbf\{e\}\_\{i\}=f\(x\_\{i\}\)\\in\\mathbb\{R\}^\{d\},\(1\)
并使用余弦相似度计算两个回答之间的相似度:
sim\(i,j\)=ei⋅ej∥ei∥∥ej∥。\\operatorname\{sim\}\(i,j\)=\\frac\{\\mathbf\{e\}\_\{i\}\\cdot\\mathbf\{e\}\_\{j\}\}\{\\lVert\\mathbf\{e\}\_\{i\}\\rVert\\,\\lVert\\mathbf\{e\}\_\{j\}\\rVert\}。\(2\)
对于每个回答ii,LiRA检索包含kk个与ii最相似回答的集合Nk\(i\)N\_\{k\}\(i\),排除回答本身;这里k=3k=3,遵循原始LiRA实现。在此邻域内,支持每个候选分数s∈Ss\\in S的总相似性权重为:
wi\(s\)=∑j∈Nk\(i\)hj=ssim\(i,j\),w\_\{i\}\(s\)=\\sum\_\{\\begin\{subarray\}\{c\}j\\in N\_\{k\}\(i\)\\\\ h\_\{j\}=s\\end\{subarray\}}\\operatorname\{sim\}\(i,j\),\(3\)
而相似性加权多数分数为:
si∗=argmaxs∈Swi\(s\)。s\_\{i\}^\{\*\}=\\arg\\max\_\{s\\in S\}w\_\{i\}\(s\)。\(4\)
仅当获胜分数获得总邻域权重的足够份额时,LiRA才分配此基准分数。设:
pi=wi\(si∗\)∑j∈Nk\(i\)sim\(i,j\)。p\_\{i\}=\\frac\{w\_\{i\}\(s\_\{i\}^\{\*\}\)\}\{\\sum\_\{j\\in N\_\{k\}\(i\)\}\\operatorname\{sim\}\(i,j\)\}。\(5\)
如果pip\_\{i\}超过阈值τ\\tau,则分配基准分数si∗s\_\{i\}^\{\*\};否则,回答ii被标记为不一致。遵循原始实现,我们使用τ=0.60\\tau=0.60。被标记为缺失或未翻译的回答将从基于翻译的可靠性计算中排除,而被标记为无意义的回答则被分配最低分数类别。对于每个分配了数值基准分数的回答,定义其检索到的邻居的平均余弦相似度:
c ̄i=1k∑j∈Nk\(i\)sim\(i,j\)。\\bar\{c\}\_\{i\}=\\frac\{1\}\{k\}\\sum\_\{j\\in N\_\{k\}\(i\)\}\\operatorname\{sim\}\(i,j\)。\(6\)
设VV表示同时具有观察到的分数和分配的LiRA数值基准的有效回答集。加权精确一致(WEA)为:
WEA=∑i∈Vc ̄iI\(hi=si∗\)∑i∈Vc ̄i。\\operatorname\{WEA\}=\\frac\{\\sum\_\{i\\in V\}\\bar\{c\}\_\{i\}\,\\mathbb\{I\}\(h\_\{i\}=s\_\{i\}^\{\*\}\)\}\{\\sum\_\{i\\in V\}\\bar\{c\}\_\{i\}\}。\(7\)
因此,具有较高平均邻域相似度的回答对可靠性估计的贡献更大。这个形式化清晰地揭示了翻译可能在何处影响LiRA。所有下游量都是回答嵌入的函数。
### 3.3 多语言嵌入模型
为了评估所提出方法在不同嵌入架构下的稳健性,我们评估了三种代表不同建模目标的多语言句子编码器:LaBSE(Fenget al.,相似文章
评估多语言句子嵌入用于翻译错误检测:一项英语-希腊语对比研究
本研究评估了多语言句子嵌入在区分正确英希翻译与错误翻译方面的表现,发现这些嵌入提供了有用的语义信号,但更适合集成到更广泛的翻译评估框架中。
跨语言共识:通过多语言自一致性对齐多语言文化知识
本文提出一个自监督框架,利用多语言自一致性和自我批评机制在不同语言间迁移文化知识,通过从本地语言表征中揭示潜在文化知识,在BLEnD基准测试的英语查询中平均提升5.03%。
构建欧洲多语言评估数据集:EMT网络内的MMLU本地化项目
本文报告了欧盟委员会翻译总局与欧洲翻译硕士网络合作,将MMLU数据集本地化为11种欧洲语言的项目。该项目不仅为LLM评估创建了更具包容性的基准,还为翻译专业学生提供了真实的项目式专业培训。
利用多语言LLM嵌入发现词汇空缺
本文提出了一种数据驱动的框架,利用多语言LLM的嵌入来检测语言间的词汇空缺,在韩语-英语对中实现了高准确率。
Inspect India Evals:面向印度语言文化语境的大语言模型开放评估框架
介绍Inspect India Evals,一个用于在印度语言文化语境中评估大语言模型的开源框架,包含六项基准测试,涵盖多语言能力、偏见、安全性和文化知识。对五个模型的测试显示,Sarvam-M 24B和Gemma 2 27B表现领先。