Large Language Models中的机构声望作为地理偏见:来自三项因子实验的证据与Bootstrap置信区间

arXiv cs.CL 论文

摘要

本文通过三项因子实验研究了Large Language Models中的机构声望和地理偏见,发现声望对评估有显著影响,以及一种救援效应,即在高声望期刊上发表论文可以补偿低机构声望。

arXiv:2608.18107v1 公告类型:新 摘要:我们研究大型语言模型(LLMs)是否在候选人评估中基于申请者姓名种族和/或机构声望及地理位置进行系统性歧视。报告了三项因子实验(4,320次API调用,四种LLMs,五个专业领域)。研究1(3x4设计)发现了一个统计上稳健的机构层级梯度,在10分制上+0.297分(95% bootstrap CI:+0.175到+0.422),而姓名来源效应可忽略且不显著(95% CI跨越零)。研究2(2x2声望x国家设计)打破了声望-地理混淆:声望效应(+0.185;95% CI:+0.093到+0.275)是原产国效应(+0.126;95% CI:+0.037到+0.218)的1.5倍。研究3(2x2期刊x机构设计)显示期刊声望(Nature对比一个边缘开放获取期刊)主导机构声望5.7倍:期刊效应+1.937(95% CI:+1.811到+2.062)对比机构效应+0.341(95% CI:+0.184到+0.504)。确认了一种'救援效应':在Nature上发表论文对来自University of Guayaquil的候选人(+2.127)比来自MIT的候选人(+1.745)更强地补偿低机构声望。使用中立偏差指数NBI<T,I,F>量化结果;I成分揭示了低声望档案的评估不一致性升高,一种仅均值指标无法捕捉的认识劣势。代码和数据:https://github.com/mleyvaz/geo-bias-llm
查看原文
查看缓存全文

缓存时间: 2026/08/20 10:02

# 大语言模型中的机构声望作为地域偏见:基于三项析因实验与Bootstrap置信区间的证据

本研究的早期两版研究曾以西班牙语发表于《中智计算与机器学习》(Neutrosophic Computing and Machine Learning)(Leyva-Vázquez and Smarandache, 2026)。本扩展版新增了研究3(期刊×机构声望)、全文Bootstrap置信区间以及修正后的统计结论。

(《大语言模型中的机构声望作为地域偏见:基于三项析因实验与Bootstrap置信区间的证据》西班牙语标题)
来源:https://arxiv.org/html/2608.18107

Maikel Leyva-Vázquez¹*,Florentin Smarandache²
¹ 厄瓜多尔玻利瓦尔大学;瓜亚基尔大学,厄瓜多尔。*《中智计算与机器学习》主编。ORCID:0000-0001-7911-5879
² 新墨西哥大学,盖洛普,NM 87301,美国。*《中智集与系统》主编。ORCID:0000-0002-5560-5926
*通讯作者:[[email protected]](mailto:[email protected])

(2026年6月)

###### 摘要

我们研究了大语言模型(LLMs)是否会基于申请人姓名的族裔和/或机构声望与地理位置,在候选人评估中表现出系统性歧视。本报告包含三项析因实验(共4,320次API调用,使用四种LLM,覆盖五个专业领域)。研究1(3×4×4设计;1,440次调用)发现了一个统计上稳健的机构层级梯度,其差异为+0.297分(95% bootstrap CI:[+0.175, +0.422]),而姓名来源效应微不足道且统计不显著(±0.094;95% CI跨越零点)。研究2(2×2 声望×国家设计;1,440次调用)分离了声望与地理的混淆因素:声望效应(+0.185;95% CI:[+0.093, +0.275])比原籍国效应(+0.126;95% CI:[+0.037, +0.218])高出1.5倍。研究3(2×2 期刊×机构声望设计;1,440次调用)揭示,*期刊*声望(《自然》与一份边缘性开放获取期刊)对*机构*声望的压制力高达5.7倍:期刊效应+1.937(95% CI:[+1.811, +2.062]);机构效应+0.341(95% CI:[+0.184, +0.504])。研究证实了“拯救效应”:在《自然》上发表论文对来自瓜亚基尔大学的候选人(Δ=+2.127)比对来自麻省理工学院的候选人(Δ=+1.745)更能补偿其较低的机构声望。结果采用中智偏见指数NBI⟨T,I,F⟩进行量化;其I分量揭示了低声望候选人档案中存在的评估不一致性升高,这是一种被仅考虑均值的指标所忽视的认知劣势。代码与数据:https://github.com/mleyvaz/geo-bias-llm。

关键词:机构声望偏见;大语言模型;地域偏见;Bootstrap置信区间;中智偏见指数;期刊声望;析因实验。

## 1 引言

大语言模型正日益被用作学术评选、招聘流程、信用评估和研究资助(Zheng et al., 2023;Li et al., 2023)中的自动化评估器。与基于规则的系统不同,LLMs编码了来自训练语料库的潜在关联,这些关联反映了深刻的地理和机构不平等。如果一个模型为功能相同的候选人分配分数时,来自麻省理工学院(MIT)的比来自瓜亚基尔大学的更高,那么该模型就不是中立的:它复制了现有的机构声望等级。

以往关于LLM偏见的研究集中于性别(Wan et al., 2023)、种族(Tamkin et al., 2023)和基于姓名的族裔信号(An et al., 2024;Gallegos et al., 2024)。最近,机构声望偏见已在同行评审(Howell et al., 2025)和大学推荐情境(Gupta and Ranjan, 2024)中被记录,并被认定为主要的偏见渠道(Basu and Chakraborty, 2026)。然而,尚无研究使用干净的析因设计来:(a)区分LLMs是响应*声望本身*还是*原籍国*的地理信息,或(b)测试*发表场所*的声望是否与机构声望存在交互作用。本文通过三项贡献填补了这两个空白。

首先,一项3×4×4析因实验在四个LLM和五个专业领域中确立了机构层级梯度(研究1)。其次,一项2×2 声望×国家设计将机构声望与地理刻板印象分离开来(研究2)。第三,一项2×2 期刊×机构声望设计测试了发表场所是否改变机构偏见——并揭示了期刊声望是*主导*信号(研究3)。所有研究均报告了基于10,000次迭代的bootstrap 95%置信区间。结果采用此处引入的中智偏见指数NBI⟨T,I,F⟩进行分析,其I分量揭示了此前未报道过的、对低声望候选人的认知劣势。

## 2 相关研究

关于LLM偏见的研究涵盖了人口统计、机构和地理维度。Tamkin等人(2023)证明与非裔美国人相关的姓名获得较低的信用评分。Wan等人(2023)记录了LLM生成的推荐信中的性别不对称。使用多达75万个提示的大规模审计证实了招聘中的种族和族裔效应(An et al., 2024),尽管经过对齐训练的模型显示出基于姓名的歧视减少。Gallegos等人(2024)概述了LLM公平性干预措施的现状。

机构声望偏见已成为一个独特的现象。研究人员发现LLMs过度代表精英大学——模型生成的建议中有72.45%倾向于排名靠前的机构,尽管这些机构仅占实际入学率的8.56%(Gupta and Ranjan, 2024)。在同行评审模拟中,一项使用四个声望水平的因子审计将机构隶属关系认定为主要的偏见渠道,低声望稿件面临明确的拒稿惩罚(Howell et al., 2025)。ICE-Guard框架在3,000个情景中测试了11个LLM,发现权威/声望偏见同样重要,但比人口统计偏见研究得更少(Basu and Chakraborty, 2026)。在招聘中,即使人口统计偏见因对齐训练而减少,教育声望偏见仍然存在(Iso et al., 2025)。

地理偏见与机构偏见相交,但一直被分开研究。Naous等人(2024)记录了LLM文化知识中的西方默认设定。原籍国效应出现在职业推荐(Forcada Rodríguez et al., 2025)和招聘评估(Rao et al., 2025)中。这些研究均未采用干净的“声望×国家”析因设计,也未将期刊声望作为独立偏见来源进行测试。本研究解决了所有这三个空白。

## 3 方法

### 3.1 共同要素

通过OpenRouter测试了四种LLM:*Claude Haiku 4.5*(Anthropic)、*GPT-4o-mini*(OpenAI)、*Gemini 2.0 Flash*(Google)和*Llama 3.1 8B Instruct*(Meta),温度设置为0.1。变化了三个候选人的姓名来源:盎格鲁(*John Smith*)、拉丁裔(*Juan Carlos Rodriguez*)和阿拉伯裔(*Omar Al-Hassan*)。候选人的资历保持恒定;仅姓名、机构和/或期刊在不同条件间变化。

评估情景共三十个,覆盖五个专业领域(每个领域6个):*奖学金*(研究生招生)、*招聘*(研究科学家招聘)、*信用*(商业贷款)、*健康*(研究资助)和*公共政策*(发展机构提案)。系统提示分配了评估者角色,但未包含反偏见指令,以捕捉模型的默认行为。分数从强制格式“SCORE: [0-10]”中提取;少于0.5%的回复需要回退提取。

### 3.2 研究1:机构层级梯度(3×4×4设计)

因素A(姓名,3水平)× 因素B(机构层级,4水平):T1 = 麻省理工学院(MIT,美国剑桥);T2 = 智利大学(圣地亚哥);T3 = 哥伦比亚国立大学(波哥大);T5 = 瓜亚基尔大学(厄瓜多尔)。层级标签遵循QS世界大学排名区间(T1 = 前100;T2 = 101–400;T3 = 401–800;T5 = 未上榜)。这产生12个档案×30个刺激×4个模型 = 1,440次API调用。局限:在研究1中,机构层级与国家共变;研究2直接解决了这个问题。

### 3.3 研究2:声望×国家(2×2设计)

一项2×2 声望(高/低)×国家(发达/发展中)设计使用:MIT(高声望,美国)、UNAM - 墨西哥国立自治大学(高声望,墨西哥;QS≈100-200)、弗雷明汉州立大学(FSU;低声望,美国;QS未上榜)和瓜亚基尔大学(低声望,厄瓜多尔)。主效应:声望 = [(MIT + UNAM) - (FSU + UGye)] / 2;国家 = [(MIT + FSU) - (UNAM + UGye)] / 2。关键对比:UNAM vs. FSU——如果声望驱动效应,则UNAM > FSU;如果国家驱动效应,则FSU > UNAM。

### 3.4 研究3:期刊声望×机构声望(2×2)

研究3将机构声望固定在两个水平(MIT = 高,瓜亚基尔大学 = 低),并将其与期刊声望进行交叉:*Nature*(由Springer Nature出版,英国;高声望)vs.*NCML*(《中智计算与机器学习》;边缘性开放获取;低声望)。候选人姓名、城市和所有资历均保持恒定。该设计分离了*候选人发表的地方*是否独立于*他们学习的地方*来改变评估。这产生4个单元×3个姓名×30个刺激×4个模型 = 1,440次API调用。

### 3.5 中智偏见指数(NBI)

对于每个模型-档案组合,NBI = ⟨T, I, F⟩(Smarandache, 1998)定义为:

T = s̄ / 10 (归一化的偏好度)
I = min(σₛ / 5, 1.0) (归一化的不一致性)
F = max(0, (s̄_ref - s̄) / 10) (系统性惩罚)
其中σ_max = 5 将I限制在[0, 1]范围内,适用于任何在{0,...,10}上经验合理的分数分布。F分量衡量与盎格鲁-MIT参考值的系统性向下偏差。Bootstrap 95% CI(10,000次迭代,百分位数法)通过为每次比较独立地对30个刺激进行有放回重采样来计算。

## 4 结果

### 4.1 研究1:机构层级梯度

表1(https://arxiv.org/html/2608.18107#S4.T1)显示了按机构层级划分的平均分。四个模型中有三个显示出从T1到T5大致递减的模式。跨模型的梯度为+0.297(95% CI:[+0.175, +0.422]),区间完全为正——确认了统计稳健性。T1与T2的对比(+0.189;95% CI:[+0.064, +0.311])显著;T2与T3(-0.011;95% CI:[-0.133, +0.114])不显著,确认了{T2≈T3}。Llama 3.1 8B并非严格单调(T3=7.589 > T2=7.444),但在典型分数方差范围内。参见图1(https://arxiv.org/html/2608.18107#S4.F1)。

表 1:研究1 – 按机构层级划分的平均分。跨模型CI基于10,000次bootstrap迭代。✓ = 95% CI完全为正。*Llama非单调:T3 > T2,高出0.144分。
参见图注:图1:研究1 – 按模型显示的机构层级梯度及跨模型95% Bootstrap CI。

### 4.2 研究1:姓名来源效应

表2(https://arxiv.org/html/2608.18107#S4.T2)显示,盎格鲁姓名获得最低的跨模型平均分(7.540),而阿拉伯裔(7.633)和拉丁裔(7.612)姓名得分略高。两个对比的bootstrap CI均跨越零点:阿拉伯裔–盎格鲁 = +0.094(95% CI:[-0.015, +0.204]);拉丁裔–盎格鲁 = +0.073(95% CI:[-0.033, +0.181])。两者均未在95%水平上达到显著性。观察到的反转与旨在抑制族裔姓名偏见的对齐训练一致。

表 2:研究1 – 按姓名来源划分的平均分。所有对比的Bootstrap CI均跨越零点(⇒ 不显著)。

### 4.3 研究2:声望 vs. 原籍国

表3(https://arxiv.org/html/2608.18107#S4.T3)展示了2×2单元均值和析因效应。跨模型的声望效应(+0.185;95% CI:[+0.093, +0.275])和国家效应(+0.126;95% CI:[+0.037, +0.218])均统计显著。声望效应比国家效应高1.5倍。图2(https://arxiv.org/html/2608.18107#S4.F2)可视化了每个模型的四个单元均值。

表 3:研究2 – 2×2单元均值及析因效应,含95% Bootstrap CI。† = CI完全为正(显著)。Dev = 发达国家;Dvlp = 发展中国家。参见图注:图2:研究2 – 按模型显示的2×2声望×国家单元均值。

### 4.4 混淆因素打破对比:UNAM vs. 弗雷明汉州立大学

表4(https://arxiv.org/html/2608.18107#S4.T4)显示了关键测试。Haiku将UNAM评分比FSU高+0.222。GPT、Gemini和Llama显示出接近零的差异(范围:-0.033至+0.044)。跨模型UNAM - FSU = +0.058(95% CI:[-0.072, +0.186]),跨越零点。四个模型中有三个给出UNAM ≥ FSU;没有模型给出FSU > UNAM的差距超过0.033分。证据排除了纯粹国家偏见作为驱动因素:一个低声望的美国机构并未系统性优于一个高声望的拉丁美洲机构。

表 4:研究2 – 关键对比:UNAM(墨西哥,高声望)vs. 弗雷明汉州立大学(美国,低声望)。

### 4.5 领域层面分析(研究2)

表5(https://arxiv.org/html/2608.18107#S4.T5)按领域细分了声望和国家效应。声望在招聘(+0.160;CI:[+0.035, +0.292])、信用(+0.278;CI:[+0.076, +0.479])和公共政策(+0.201;CI:[+0.028, +0.375])中统计显著。

相似文章

大型语言模型中地理条件作用的意外影响

arXiv cs.CL

本文识别并分析了LLM中的“位置泄漏”现象,即地理条件作用导致模型即使在与位置无关的提示中也过度依赖位置元数据,揭示了超出内容的结构性条件作用效应。

一些大型语言模型表现出一致的风险态度

arXiv cs.AI

本文介绍了一个框架,用于测试大型语言模型是否在不同领域表现出一致的风险态度。研究发现,大多数大型语言模型在风险态度上表现出任务内和跨领域的稳定性,并趋近于比人类更窄的分布。