从基列河到大型语言模型的推理分布:规模化的隐性方言偏见与语言剖析

arXiv cs.CL 论文

摘要

本文通过分析大型语言模型在四种英语方言上的内部概率分布,考察其隐性方言偏见,发现模型将更多负面住房相关形容词与非裔美国人英语和尼日利亚皮钦语相关联,反映了类似于人类歧视的继承偏见。

arXiv:2609.18068v1 公告类型:新 摘要:大型语言模型(LLMs)越来越多地部署在高风险领域,如住房筛选。尽管对齐技术缓解了生成文本中的显性种族偏见,但它们往往未触及内部概率分布中的隐性态度关联。通过调整匹配伪装的社会语言学范式,我们考察了四种变体在住房相关社会判断中的隐性方言偏见:标准美式英语(SAE)、非裔美国人英语(AAVE)、尼日利亚标准英语(NSE)和尼日利亚皮钦语(NP)。AAVE反映了先前隐性偏见评估中研究的种族化方言,而NSE和NP代表了非洲黑人、后殖民变体,此前文献中未涉及。使用260个意义匹配的句子四元组和住房相关形容词的对数概率评分,我们在三种社会接近程度不同的背景下探测了十个开源权重LLMs:租户筛选、邻居接受和室友选择。在所有十个模型中,AAVE和NP始终与比SAE更负面的形容词相关联,其中NP受到的惩罚最为严重。关键的是,每个方言都通过独特的刻板印象集群而非通用的非标准类别受到惩罚。NSE具有制度威望,表现出依赖于背景的转变:在正式租户筛选中比SAE更受青睐,但随着社会接近程度的增加,惩罚逐渐加重。我们的发现揭示,LLMs在种族身份和威望两个维度上继承了隐性方言偏见,呼应了有记录的人类住房歧视,并展示了其在后殖民英语变体中的普遍性。
查看原文
查看缓存全文

缓存时间: 2026/09/17 09:06

# 从基列的“河”到大型语言模型的推断分布:大规模的隐蔽方言偏见与语言分析
来源:https://arxiv.org/html/2609.18068
###### 摘要

大型语言模型(LLMs)正日益被应用于塑造重大生活结果的各类服务中,从住房平台到自动化筛选工作流。虽然对齐技术减少了模型输出中种族偏见的显性表达,但模型内部概率分布所反映的态度关联却未受影响。这些隐蔽偏见对用户不可见,且能抵抗仅检查生成文本的传统审计方法。本文基于匹配语态的社会语言学范式,考察了LLMs在住房相关社会判断中针对四种英语变体的隐蔽方言偏见:标准美式英语(SAE)、非裔美国人白话英语(AAVE)、尼日利亚标准英语(NSE)和尼日利亚皮钦语(NP)。AAVE反映了先前隐蔽偏见评估中所研究的方言变体,而NSE和NP则代表了此前该研究领域未涉及的黑人非洲、后殖民英语变体。通过使用260个意义匹配的句子四元组,并对住房相关形容词进行对数概率评分,我们在三个逐渐变化的社会邻近度评估情境(租户筛选、邻居接纳、室友选择)中,探究了十个开源LLMs。结果显示,在所有十个模型中,与SAE相比,AAVE和NP始终与更负面的住房相关形容词相关联,其中NP整体受到的惩罚最为严重。此外,每种方言是通过一组独特的刻板印象簇而非作为一个通用的非标准类别而受到惩罚的。与NP共享尼日利亚身份但拥有制度声望的NSE,展现出一种与两者都截然不同的、依赖于情境的模式:在正式的租户评估中比SAE更受青睐,但随着社会邻近度的增加则受到惩罚。综合来看,这些结果表明LLMs沿两个不同维度——种族身份和声望——继承了隐蔽的方言偏见,这呼应了人类中长期存在的住房歧视,并将其影响范围从非裔美国人群体扩展到了种族化的后殖民英语变体。

达尔豪斯大学计算机科学学院

加拿大新斯科舍省哈利法克斯市
\{ch309901, rita\.orji\}@dal\.ca
数据、代码及补充材料仓库——https://github\.com/intricate\-potato/dialect\-prejudice\-of\-llms

## 1 引言

语言分析是指依据人们的说话方式而非说话内容来进行评判的做法,其后果从未无足轻重。方言是其最早期也最持久的信号之一(Baugh 2021 (https://arxiv.org/html/2609.18068#bib.bib3); Hofmann et al\. 2024 (https://arxiv.org/html/2609.18068#bib.bib15))。《士师记》(12:6)中关于语言分析的一个最生动文本例证,我们在此将其视为一个说明性的文学叙述而非经过验证的历史记录。以法莲支派渡过约旦河去对抗基列人,当他们的进攻失败后,幸存者试图在夜色掩护下渡河逃回。复仇心切的基列人把守了渡口。由于没有任何可靠的方法能凭外观区分敌友,他们设计了一个测试。每个寻求渡河的人都被要求说出“shibboleth”这个词。以法莲人因方言中没有“sh”音,只能发出“sibboleth”,这个失误被证明是致命的。经文记载“那时以法莲人被杀的有四万二千人”(《士师记》12:6)111钦定版圣经。这个词本身并无任何道德内涵。相反,它揭示了说话者的来源,而这本身就足以构成死亡的理由,这是语言标记群体成员身份并触发排斥的早期例子。

跨越千年和不同的社会语境,口语持续作为社区归属感的信号发挥作用,在人们考虑任何话语内容之前,就已激活了对某个群体的态度(Lambert et al\. 1960 (https://arxiv.org/html/2609.18068#bib.bib20); Greer, Mills, and Lapka 2024 (https://arxiv.org/html/2609.18068#bib.bib11))。在住房市场中,这一机制已被实证精确地记录下来。房东在电话中筛选潜在租户,依据他们的说话方式,在任何正式的信用评估开始之前,就将方言作为种族的代理指标(Massey and Lundy 2001 (https://arxiv.org/html/2609.18068#bib.bib24))。本文提出的问题是:如今被部署在类似筛选情境中的大型语言模型(LLMs),是否已经吸收并自动化了同样的偏见?这种偏见是由种族身份、语言声望还是两者共同驱动的?我们将这一更广泛的现象称为人工智能的“示播列”问题,即AI系统使用语言特征作为标记来自动化排斥,而与交流内容无关。

我们的关注点位于两条汇聚的证据链的交叉点。第一条是社会语言学的。Tucker and Lambert(1969)(https://arxiv.org/html/2609.18068#bib.bib33)的匹配语态实验表明,听者并非中立地评估一个声音。相反,他们将对某个社会群体的态度直接概括到该群体所使用的语言上,以至于说话者不是被看作个体,而是被看作一个群体的代表,承载着该群体累积的关联。这些关联本质上并非单一的;它们表现为基于种族或族裔身份的惩罚(Baugh 2021 (https://arxiv.org/html/2609.18068#bib.bib3); Purnell, Idsardi, and Baugh 1999 (https://arxiv.org/html/2609.18068#bib.bib27)),以及基于声望等级的惩罚,后者将语言变体排列为或多或少的合法,而与说话者种族无关(Lippi-Green 1997 (https://arxiv.org/html/2609.18068#bib.bib23))。后殖民和非标准英语方言是完全合法的语言系统,有其自身的语法连贯性和社会历史。然而,它们却持续地依据一种编码了历史上占主导地位人群的惯例和偏好的标准英语规范来接受评判(Kachru 1990 (https://arxiv.org/html/2609.18068#bib.bib19))。

第二条证据链专门关于LLMs。这些模型在网络规模的语料库上训练,这些语料库过度代表了霸权观点和主导群体的语言惯例(Bender et al\. 2021 (https://arxiv.org/html/2609.18068#bib.bib4); Alvero et al\. 2024 (https://arxiv.org/html/2609.18068#bib.bib2))。嵌入在这些数据中的态度在预训练期间被吸收进模型参数。事后应用的对齐干预措施塑造了模型的输出,但其设计目的并非修改编码态度关联的基础概率分布。因此,预训练后持续存在的偏见不会在对齐过程中被消除;相反,它变得不易被观察到(Lin et al\. 2024 (https://arxiv.org/html/2609.18068#bib.bib22); Hofmann et al\. 2024 (https://arxiv.org/html/2609.18068#bib.bib15); Wen et al\. 2024 (https://arxiv.org/html/2609.18068#bib.bib35))。

Hofmann et al\.(2024)(https://arxiv.org/html/2609.18068#bib.bib15)通过为计算环境改编Lambert的匹配语态技术,使这种隐蔽偏见变得可测量。他们向LLMs呈现意义匹配的标准美式英语(SAE)和非裔美国人白话英语(AAVE)句子对,并测量每个输入条件下被赋予的刻板印象形容词的概率。因为语义内容在各方言变体间保持恒定,所以被赋予概率的任何差异都可以归因于方言。模型持续为AAVE输入分配更高的负面刻板印象形容词概率,这种隐蔽歧视与模型在明确指明种族时更积极的显性刻板印象形成鲜明对比。这仍然是唯一一项研究LLMs中隐蔽、概率层面方言偏见的研究,受限于其设计时的北美社会语言学背景。由此产生第二个局限,由于SAE和AAVE同时在种族身份和声望上存在差异,该设计无法分离究竟是哪个维度在驱动惩罚。

这两个局限性激发了我们对方言变体的选择。从地理角度看,容易受到隐蔽语言分析的人群远不止AAVE使用社区。尼日利亚拥有非洲最大的英语使用人口,尼日利亚说话者占据着双重边缘化的位置:在北方被种族化为黑人,在世界英语根深蒂固的声望等级体系中被标记为后殖民者(Kachru 1990 (https://arxiv.org/html/2609.18068#bib.bib19); Ugwuanyi and Aboh 2026 (https://arxiv.org/html/2609.18068#bib.bib34))。两种变体界定了这一格局。尼日利亚标准英语(NSE),是制度认可的变体,具有受过教育的正式语域所携带的国内声望。尼日利亚皮钦语(NP),是一种广泛使用的白话,在国内和侨民中都被污名化为“破碎英语”,这与AAVE的污名化类似。NSE和NP共同构成了SAE–AAVE对比的天然全球南方对应物(Hofmann et al\. 2024 (https://arxiv.org/html/2609.18068#bib.bib15)),直接回应了第二个局限。这两种变体共享相同的尼日利亚国家和种族身份,但在制度声望上差异显著(Tanyi et al\. 2025 (https://arxiv.org/html/2609.18068#bib.bib31))。这使它们成为一个自然的测试案例,用以检验LLMs对非标准方言的惩罚究竟是由身份、声望还是两者共同驱动。如果LLMs惩罚NP但偏爱NSE,那么声望的作用就超出了身份本身能解释的范围;如果两者受到同等惩罚,那么身份就是更简洁的解释。然而,我们的结果揭示的模式比这两种预测都更复杂。

我们在住房相关社会判断的语境中研究LLM方言偏见,该领域同时满足三个条件。首先,住房决策中基于方言的歧视已有充分文献记载,为比较LLM行为提供了实证基准(Massey and Lundy 2001 (https://arxiv.org/html/2609.18068#bib.bib24); Squires and Chadwick 2006 (https://arxiv.org/html/2609.18068#bib.bib30))。其次,住房受到强有力的反歧视法律保护,因此基于方言的区别对待具有直接的政策影响(Baugh 2021 (https://arxiv.org/html/2609.18068#bib.bib3))。第三,住房包含随社会邻近度变化的评估情境,从房东的租户筛选,到社区对邻居的接纳,再到对室友的个人选择,使我们能够考察随着关系变得更加个人化,偏见是否会加剧(McClintock 2010 (https://arxiv.org/html/2609.18068#bib.bib25); Gaddis and Ghoshal 2020 (https://arxiv.org/html/2609.18068#bib.bib8))。基于AI的文本分析已经整合到租赁平台和住房服务中(Pallavi et al\. 2025 (https://arxiv.org/html/2609.18068#bib.bib26)),随着代理系统承担更多自主角色,它们可能在最少人类监督的情况下塑造住房决策(Hosseini and Seilani 2025 (https://arxiv.org/html/2609.18068#bib.bib16))。我们的工作并非直接研究这些下游决策。相反,它刻画的是LLMs在概率层面对方言的编码,先于任何部署情境。

遵循Hofmann et al\.(2024)(https://arxiv.org/html/2609.18068#bib.bib15),我们使用匹配语态设计,将意义匹配的陈述呈现给十个开源LLMs,涵盖四种方言条件:SAE、AAVE、NSE和NP。隐蔽偏见通过每种方言输入下正面和负面住房相关形容词的对数概率分数来衡量。模型的选择考虑了地理、制度和架构的多样性,涵盖基础模型和指令微调变体。

我们的设计产生三方面贡献。首先,我们通过引入作为SAE和AAVE对应物的全球南方变体NSE和NP,将匹配语态范式应用于超越北美语境的隐蔽LLM偏见评估,这是首次针对黑人非洲后殖民英语使用人群进行此类评估。其次,我们表明AAVE和NP在所有十个评估模型和三个住房情境中,通过独特的刻板印象簇(而非通用的非标准惩罚)一致地受到比SAE更严重的惩罚。第三,NSE的模式依赖于情境,它与NP共享国家和种族身份,但具有制度声望,这揭示了声望作为一个独立于身份运作的机制,分离了仅凭SAE–AAVE对比无法区分的两种惩罚途径。

## 2 背景与相关工作

本研究位于两类实证研究的交叉点:i) 关于自然语言处理(NLP)系统如何编码和再现基于方言的偏见的研究,以及 ii) 关于方言如何调解住房市场中种族歧视的研究。本节回顾这两方面,确立为何在住房语境中探究LLMs在方法论上有依据且具有重要后果。

### 2\.1 NLP中的方言偏见

NLP系统中基于方言的差异早于LLM时代。早期工作已证实,非标准英语变体在一系列任务中遭受可量化的更差系统性能。Tatman(2017)(https://arxiv.org/html/2609.18068#bib.bib32)显示,自动语音识别对苏格兰英语说话者产生了显著更高的单词错误率,并将此差距归因于训练语料库中的系统性代表性不足。这种将NLP中方言不平等根本上归为数据代表性问题的框架,成为该领域反复出现的诊断(Blodgett et al\. 2020 (https://arxiv.org/html/2609.18068#bib.bib5))。Halevy et al\.(2021)(https://arxiv.org/html/2609.18068#bib.bib13)将这一发现扩展到下游分类,证明毒性语言检测器系统性地将非裔美国人白话英语(AAVE)文本标记为比语义等价的标准英语更具毒性,并且在模型层面应用标准去偏技术并不能解决这一差异。因此,这种偏见不仅仅是训练数据的产物;相反,它规避了标准的补救努力并在部署的系统中持续存在。

向大型生成模型的转变改变了这种失败的性质,而非消除了它。其主要失败模式从性能下降转变为生成输出中的态度刻板印象。Fleisig et al\.(2024)(https://arxiv.org/html/2609.18068#bib.bib7)向GPT-3.5 Turbo和GPT-4提供了涵盖十种英语变体的母语者文本,发现两个模型无论输入方言如何,都压倒性地默认使用标准美式英语。母语者评价模型对少数族裔变体(包括尼日利亚英语)的回应比对标准变体的回应更具刻板印象和居高临下。值得注意的是,尽管理解能力有所提高,GPT-4的刻板印象比例比其前代高出18个百分点,表明能力的提升与偏见的减少并不可靠地同步发生。Himelstein et al\.(2026)(https://arxiv.org/html/2609.18068#bib.bib14)提供了一个解释其发生机制的说明,他们使用Llama、Gemma和Qwen系列的十个LLMs进行激活引导,表明强烈偏见的

相似文章

并列比较加剧语言模型中的方言偏见

arXiv cs.CL

该研究发现,语言模型在并列比较标准美式英语和非裔美国人白话英语时,会表现出更强的方言偏见,即使经过安全微调也是如此。反事实公平微调可以在孤立情况下减少某些偏见,但在对比设置中并不一致。

语言模型中的深层和浅层偏差

arXiv cs.CL

本文引入了一个偏差深度评分,用于区分大型语言模型中稳定的“深层偏差”与依赖提示的“浅层偏差”,并展示深层偏差更持久且更难移除。