科学领域的趋同与宗教领域的分歧:Wikipedia各语言版本间经过校准的框架差异

arXiv cs.CL 论文

摘要

本研究使用多语言编码器来测量Wikipedia各语言版本间的框架差异,发现宗教和政治概念的分歧大于科学概念。

arXiv:2608.21821v1 公告类型:新 摘要:当Wikipedia的语言版本描述同一概念时,它们的框架有多大差异?先前的工作测量版本间的覆盖差距;我们测量匹配概念的框架距离。我们分析了2,799篇有效文章,基于3,000个可能的概念-语言观察,涵盖150个Wikidata锚定概念、20个语言版本、4个领域和一个校准集。原始嵌入距离反映了内容差异以及编码器对齐每种语言对的能力。即使在具有稳定跨文化指称的校准概念中(例如,化学元素、数字、颜色),最大的语言对平均距离是最小距离的3.6倍,且距离通常在语言族内较小。我们定义了一个基线调整距离(校准距离):两个语言版本间的概念距离减去同一语言对中校准概念的平均距离。这一调整显著减少了特定语言对的对齐差异和语言族模式。跨三个多语言编码器(LaBSE、multilingual MPNet和CMLM),科学文章比校准文章对齐更紧密,所有三个编码器都将宗教排在第一,科学/技术排在最后。概念级别的排名在编码器间高度一致(Spearman rho=0.75-0.79,对于MPNet和CMLM相对于LaBSE)。在LaBSE下,宗教显著高于校准基线。在政治领域,分歧集中在审查和难民等概念上,而民主和人权是最对齐的概念之一。代码、数据和每语言对校准基线已发布。 ootnote{https://github.com/hhchen1105/cross-linqual-concept}
查看原文
查看缓存全文

缓存时间: 2026/08/25 04:18

# 科学趋同,宗教分歧:维基百科不同语言版本间的校准框架差异
来源:https://arxiv.org/html/2608.21821
洪玄轩  
所属机构:计算机科学与信息工程系  
所属机构:中央大学  
所在地:台湾桃园  
电子邮箱:[[email protected]](mailto:)

###### 摘要

当维基百科的不同语言版本描述同一概念时,它们的框架表述差异有多大?以往的研究测量版本间的内容覆盖差距;我们则测量匹配概念的框架距离。我们分析了来自3000个可能概念-语言观测中的2799篇有效文章,涵盖150个维基数据锚定概念、20种语言版本、4个领域以及一个校准集。原始嵌入距离同时反映了内容差异以及编码器对每对语言的对齐程度。即使在校准概念(具有稳定的跨文化指称,如化学元素、数字、颜色)中,最大语言对平均距离也是最小平均距离的3.6倍,且语系内部的距离通常更小。我们定义了一个基线调整距离(校准距离):一个概念的两个语言版本之间的距离减去同一语言对校准概念的平均距离。这种调整显著减少了特定语言对间的对齐差异以及语系模式。通过三个多语言编码器(LaBSE、多语言MPNet和CMLM)的分析显示,科学类文章比校准文章对齐更紧密,且这三个编码器都将宗教列为首位,科学/技术类列末位。概念层面的排名在各编码器间高度一致(MPNet和CMLM相对于LaBSE的Spearman相关系数ρ=0.75–0.79)。在LaBSE模型下,宗教领域显著高于校准基线。在政治领域内,分歧集中在审查制度和难民等概念上,而民主和人权则是最趋同的概念之一。代码、数据及逐语言对的校准基线已发布。111https://github.com/hhchen1105/cross-linqual-concept

## 1 引言

维基百科以超过300种语言存在。其各语言版本在很大程度上是独立编写的,而非从共同来源翻译而来。当土耳其语、韩语和波兰语版本描述“朝圣”或“审查制度”时,它们依赖于不同的编辑社区、资料来源和文化背景。因此,维基百科提供了一个罕见的语料库,用于探讨以下问题:当不同语言社区描述相同概念时,它们的框架表述差异有多大?我们发现,在宗教和政治敏感概念上的分歧最大,而非已确立的科学知识领域。

以往关于维基百科跨语言差异的计算研究主要关注“覆盖范围”:哪些文章、事实或表格条目出现在一个版本而未出现在另一个版本(14 (https://arxiv.org/html/2608.21821#bib.bib1);2 (https://arxiv.org/html/2608.21821#bib.bib4))。我们转而研究“框架”。对于跨版本匹配的概念,文章内容在宗教和政治等文化负载领域,是否比基础科学和化学元素等文化负载较轻的领域分歧更大?这一区分将版本包含的内容与它们如何描述共同主题区分开来。这种区分的重要性也超越了维基百科本身,因为各语言版本是多语言语言模型的核心预训练数据。这些模型可能会根据查询语言改变历史叙述。例如,同一个模型在俄语中将无线电发明归功于波波夫,而在英语和意大利语中归功于马可尼;它在中文中将活字印刷术发明归功于毕昇,而在德语中归功于古腾堡(7 (https://arxiv.org/html/2608.21821#bib.bib6))。测量百科全书源材料中的分歧,是识别此类语言依赖性行为的数据端根源的第一步。

多语言句子编码器带来了一个方法论问题,是以往基于嵌入的比较未能解决的。诸如LaBSE(6 (https://arxiv.org/html/2608.21821#bib.bib12))等编码器对某些语言对的对齐效果远好于其他对。在我们的数据中,校准文章的平均距离范围从波斯语-印尼语对的0.107到印地语-中文对的0.389。这些文章涵盖了具有相对稳定跨文化指称的概念,包括化学元素、数字、颜色、动物和自然种类。因此,它们3.6倍的离散度反映了编码器对齐效果和版本级别的写作差异,而不仅仅是内容差异。原始距离在语系内部(如法语-西班牙语)也比跨语系(如印地语-中文)更小,语系内平均为0.177,跨语系为0.217。未经校准,分析可能会将这些工件误认为文化距离。我们从每个原始距离中减去同一语言对的平均校准距离。我们将此基线调整后的量称为“校准距离”。此修正显著减少了聚合的语系对比(参见结果部分)。

本文有三点贡献。首先,它说明了为何需要校准:中性文章基线在不同语言对间变化达3.6倍,并携带语系信号。逐对校准显著减弱了这两种模式,平行文本验证了基线结构(参见方法部分和“校准集组成”小节)。其次,它在涵盖超过12个语系和9种文字的20种语言中的2799篇文章中,识别出一个清晰的领域排序。在LaBSE模型下,宗教领域高于校准基线(+0.034,Holm校正双侧置换p=0.007),而科学领域低于基线。政治分歧集中在特定概念上:各版本对“民主”的描述相似,但对“审查制度”的描述不同(参见结果部分)。第三,它将稳健的排名与依赖于编码器的幅度区分开来。另外两个编码器也将宗教列为首位,科学/技术类列末位,并重现了概念层面的排名(Spearman ρ=0.75–0.79),但只有在LaBSE模型下,宗教领域才显著超过基线。排除机器人创建和翻译生成的文章,对宗教估计的影响很小(参见稳健性部分)。

在概念层面,仪式和制度性宗教术语(祭祀、神职人员、寺庙、殉道者)以及政治敏感概念(审查制度、难民)分歧最大。已确立的知识和经典理念——进化、DNA、量子力学、民主和人权——则是最趋同的。这些对比支持一种文化解释,但并未确定其原因。

## 2 相关工作

#### 维基百科版本间的跨语言差异。

InfoGap(14 (https://arxiv.org/html/2608.21821#bib.bib1))是最接近的先前工作。它将文章分解为事实,并使用LaBSE和大语言模型验证跨版本对齐。应用于英语、法语和俄语的2.7K篇LGBT人物传记后,发现存在巨大的覆盖差距,且俄语版本中不成比例地包含负面内涵的事实。InfoGap测量“覆盖范围”:一个版本包含哪些事实。我们测量“框架”:在控制编码器噪声后,匹配文章内容的相距程度。一个版本可以用不同的重点呈现相同的事实,或者用相似的框架呈现不同的事实,因此这两种测量是互补的。这种区分不仅是概念性的:InfoGap基于LaBSE的候选检索之后是离散的大语言模型验证步骤,因此编码器对齐质量主要影响考虑哪些候选文章,而非报告的事实存在性判断本身;我们的连续距离度量没有这种下游校正,直接继承了该质量,这就是为什么它需要校准。将事实级对齐扩展到测量同一事实在不同版本中的表述差异,将重新引入该工件,使得校准(公式1 (https://arxiv.org/html/2608.21821#S4.E1))成为必要。InfoGap研究两到三个语言对;我们的概念级指标覆盖20种语言间的所有190个语言对,并比较领域。其他工作使用行为信号,包括编辑战主题的重叠(18 (https://arxiv.org/html/2608.21821#bib.bib2))和从共同编辑推断的文化边界(15 (https://arxiv.org/html/2608.21821#bib.bib3))。这些信号捕捉的是编辑者行为和主题选择,而非文章内容。关于多语言维基百科表格的工作(2 (https://arxiv.org/html/2608.21821#bib.bib4))使用维基数据标识符跨版本对齐表格条目,并提出跨语言嵌入相似性作为未来工作;我们的校准将是这种未校准嵌入比较的必要补充。

#### 嵌入空间中的跨文化语义。

16 (https://arxiv.org/html/2608.21821#bib.bib5)使用置换检验和自助法区间,比较对齐多语言嵌入中的监督情感梯度(效价、唤醒度、主导度),发现广泛共享的效价结构伴随着可解释的剩余差异。他们的研究对象是情感词汇表;我们的则是百科全书文章内容。我们采用了他们基于置换的显著性哲学,并适应于一种设计,其中校准基线必须在每个置换内重新计算,以避免构建偏差(参见方法部分)。

#### 语言模型的文化对齐。

越来越多的研究探索*LLM输出*的社会文化倾向:它们是否与基于调查的文化价值观一致(1 (https://arxiv.org/html/2608.21821#bib.bib8);10 (https://arxiv.org/html/2608.21821#bib.bib9)),开放式叙述中的职业性别模式是否更符合人类刻板印象而非劳动力统计数据(3 (https://arxiv.org/html/2608.21821#bib.bib11)),以及——最接近我们动机的是——同一个模型是否根据查询语言产生不同的历史归因(7 (https://arxiv.org/html/2608.21821#bib.bib6))。我们提出的是一个数据端的问题,测量*人类撰写的维基百科内容*中的分歧;因此,这些论点与LLM对齐文献没有重叠。

#### 多语言句子编码器。

LaBSE(6 (https://arxiv.org/html/2608.21821#bib.bib12))通过翻译排序训练在109种语言间对齐句子嵌入。对齐质量随训练对的可用性而变化,这影响了我们的基线所捕获的语言对变异。该方法本身与编码器无关:替换另一个多语言编码器将为该编码器产生基线,并反映相同的版本级写作差异。我们在“编码器稳健性”小节中用两个额外的编码器(13 (https://arxiv.org/html/2608.21821#bib.bib16);17 (https://arxiv.org/html/2608.21821#bib.bib17))证明了这一特性。

## 3 数据

### 3.1 概念

我们研究了150个概念,涵盖四个文化负载领域——*宗教*、*政治*、*科学/技术*和*流行文化*——每个领域30个概念,另加一个由30个文化负载最小化概念组成的校准集:化学元素、小数字、基本颜色、常见动物和普遍自然种类,仅用于估计中性文章基线(参见方法部分)。文化负载领域包括业、法、民主、自由主义、自由、人权和工作生活平衡等概念。

维基百科标题为语言技术应用(例如,科学关键词编制或生成(5 (https://arxiv.org/html/2608.21821#bib.bib10);4 (https://arxiv.org/html/2608.21821#bib.bib18)))提供了一个机器可读的概念词汇表。我们跨语言使用这个词汇表。每个概念由一个维基数据QID锚定,该QID将其映射到各版本的文章标题。

我们从英语文章的`wikibase_item`页面属性中解析QID。首次实体搜索不可靠。例如,它将“Sin”映射到新加坡,将“Sun”映到Sun Microsystems。对于受此类消歧或重定向错误影响的五个概念,我们手动验证了正确的QID。我们将其记录在一个有文档的覆盖文件中,解析管道会查阅该文件而非不可靠的首次搜索。所有150个概念都成功解析。附录中完整列出了它们。

### 3.2 语言

我们使用来自15个语系和9种文字的20种语言:阿拉伯语、中文、英语、芬兰语、法语、德语、希伯来语、印地语、印尼语、日语、韩语、波斯语、波兰语、葡萄牙语、俄语、西班牙语、斯瓦希里语、泰语、土耳其语和越南语。表1 (https://arxiv.org/html/2608.21821#S3.T1)列出了它们的语系、文字和覆盖情况。选择受到两个约束:每种语言都必须得到LaBSE支持,并且20种语言的样本使3000篇文章的获取和验证管道保持可管理,同时提供190个语言对。在此预算内,我们最大化了语系、文字和地区的多样性。

### 3.3 文章文本和验证

对于每个有维基数据站点链接的概念-语言观测,我们通过MediaWiki API检索文章的导言部分作为纯文本。导言部分比完整文章更标准化且长度更可比,减少了长度和结构的混淆因素。我们排除没有站点链接(即该版本中不存在文章)、消歧页面或存根文章的观测。存根检测使用支持文字的计数方法。对于中文、日语和泰语,我们计算字符数而非空格分隔的词符,因为这些文字不一致地使用空格分词。如果此计数低于20,我们认为该摘录是存根。

在150×20=3000个概念-语言观测中,2799个(93.3%)有效:154个缺少站点链接,47个是存根,零获取错误。排除情况分布不均(表1 (https://arxiv.org/html/2608.21821#S3.T1)):斯瓦希里语仅有71%有效观测,而其他每个版本至少达到89%。我们将逐语言排除视为维基百科覆盖不平等的实质性信号,并在距离结果中一起报告。

表1:20种语言版本:语系、文字和有效概念-语言观测,按覆盖率升序排列。斯瓦希里语的低覆盖率本身就是一个覆盖不平等发现(稳健性部分显示它也是我们样本中最多机器人创建和翻译中介的版本)。
代码 语言 语系 文字 有效率  
sw 斯瓦希里语 班图语系 拉丁文 106/150 71%  
hi 印地语 印度-雅利安语族 天城文 133/150 89%  
fi 芬兰语 乌拉尔语系 拉丁文 134/150 89%  
ko 韩语 韩语族 谚文 136/150 91%  
pl 波兰语 斯拉夫语族 拉丁文 138/150 92%  
de 德语 日耳曼语族 拉丁文 139/150 93%  
ja 日语 日本语系 日文 141/150 94%  
th 泰语 壮侗语族 泰文 141/150 94%  
id 印尼语 南岛语系 拉丁文 141/150 94%  
he 希伯来语 闪米特语族 希伯来文 142/150 95%  
ru 俄语 斯拉夫语族 西里尔文 142/150 95%  
ar 阿拉伯语 闪米特语族 阿拉伯文 143/150 95%  
pt 葡萄牙语 罗曼语族 拉丁文 143/150 95%  
vi 越南语 南亚语系 拉丁文 143/150 95%  
zh 中文 汉藏语系 汉字 144/150 96%  
fr 法语 罗曼语族 拉丁文 146/150 97%  
es 西班牙语 罗曼语族 拉丁文 146/150 97%  
tr 土耳其语 突厥语族 拉丁文 146/150 97%  
fa 波斯语 伊朗语支 阿拉伯文 146/150 97%  
en 英语 日耳曼语族 拉丁文 149/150 99%

## 4 方法

### 4.1 嵌入

我们将每个有效的导言部分分割成句子,并用LaBSE(6 (https://arxiv.org/html/2608.21821#bib.bib12))对每个句子进行嵌入。我们对每个句子向量进行L2归一化,使得每个句子无论其大小如何,对池化向量的贡献相等,然后对归一化后的向量进行均值池化,并对结果进行L2归一化。这为每个概念c和语言ℓ生成一个768维向量v_{c,ℓ}。嵌入计算在内部计算集群上作为单GPU作业运行,而非云提供商;完整的三编码器过程在无GPU的机器上也仅需几CPU小时即可完成。

### 4.2 校准距离

令d(c,i,j)=1−co

相似文章

跨主题与媒体类型的概念隐喻发现

arXiv cs.CL

本文提出了一种无监督方法,用于提取语言隐喻并将其分组为概念隐喻,并将该方法应用于分析左倾与右倾播客之间的框架差异。