LLMs悄悄纠正非裔美国人英语:通过激活操控审计和缓解方言偏见
摘要
本文审计并缓解大型语言模型中的方言偏见,显示它们系统性地偏好标准美式英语而非非裔美国人英语。作者引入了激活操控,一种无需训练的方法,在保持流畅性的同时显著减少偏见,并发布了迄今为止最大的真实AAE平行语料库。
arXiv:2607.06845v1 公告类型:新
摘要:非洲裔美国人英语(AAE)是一种有规则约束的方言,有超过3000万人使用,但经常被大型语言模型(LLMs)误解和“纠正”。通过对六个指令微调的LLM(14B至70B),我们表明,即使前文语境是AAE,最先进的模型系统性地偏好标准美式英语(SAE)的续写,实际上是将AAE改写为SAE。我们提出了一个端到端的框架来审计和缓解这种偏见。在审计方面,我们引入了条件方言群体不变性(cDGI),它可以从翻译引入的伪影中隔离出真正的模型偏见,以及一项特征级定位分析,以识别哪些AAE标记最强烈地触发偏见;我们发现,句法结构,尤其是否定一致(例如,“ain't nobody”),是所有模型中的通用触发因素。在缓解方面,我们首次(据我们所知)将激活操控应用于方言偏见:一种无需训练、测试时的方法,通过因果追踪提取方言方向并将其注入偏见相关层。激活操控将偏见减少了5到20倍,同时保持了SAE流畅性。为实现这项工作,我们发布了REAL-AAE ,这是迄今为止最大的真实AAE平行语料库:来自自然推文的17,479个AAE/SAE/AAE_back三元组(比之前的真实AAE资源大2到6倍),经过自动验证(BERTScore F1 = 0.95)和三位母语为AAE的说话者验证(83.0%语义一致性)。
查看缓存全文
缓存时间: 2026/07/09 07:48
# 大型语言模型无声地纠正非裔美国人英语:通过激活导向审计和缓解方言偏见 来源: https://arxiv.org/html/2607.06845 Huan Wu¹,²,³、Ali Emami⁴、Muhammad Furquan Hassan¹、Osaretin Igbinoba⁵、Osakpolor Idusuyi⁶、Osamede Igbinoba⁷、Faiza Khan Khattak⁸、Laleh Seyyed-Kalantari¹,²,³,⁹ ¹约克大学、²向量研究所、³互联心智、⁴埃默里大学、⁵威尔弗里德·劳里埃大学、⁶多伦多大学、⁷圭尔夫大学、⁸Monark Health、⁹CIFAR解决方案网络成员 ∗[email protected] ###### 摘要 非裔美国人英语(AAE)是一种有规则可循的方言,有超过3000万人使用,但大型语言模型(LLM)经常错误地理解并“纠正”它。在六个指令微调的大语言模型(14B到70B)中,我们发现,即使前文语境是AAE,当前最先进的模型也系统性地偏好标准美国英语(SAE)的续文,实际上是将AAE改写成了SAE。我们提出了一个端到端的框架来审计和缓解这种偏见。在审计方面,我们引入了条件性方言组不变性(cDGI),将真正的模型偏见与翻译器引入的伪像分离开,并进行特征级定位分析,识别哪些AAE标志最强烈地触发偏见;我们发现,句法结构,特别是否定一致性(例如,“ain’t nobody”),是所有模型的普遍触发因素。在缓解方面,据我们所知,我们首次将激活导向应用于方言偏见:这是一种无需训练、测试时的方法,通过因果追踪提取方言方向并注入到与偏见相关的层中。与提示相比,激活导向将偏见减少了5到20倍,同时保持了SAE的流畅性。为了支持这项工作,我们发布了Real-AAE,这是迄今为止最大的真实AAE平行语料库:来自自然推文的17,479个AAE/SAE/AAE回溯三元组(比之前的真实AAE资源大2到6倍),经过自动验证(BERTScore F1 = 0.95)和三位母语AAE使用者验证(语义一致性83.0%)。我们的语料库和代码可在 https://anonymous.4open.science/r/dialect/ 获取。 ## 1 引言 当前最先进的大型语言模型(LLM)在无声地“纠正”非裔美国人英语(AAE)。给定AAE语境“But I ain’t doing no dishes,”,我们测试的六个LLM中有五个更偏好标准美国英语(SAE)的续文“I’m going to stay in my room”,而不是有效的AAE替代句“Imma stay in my room”(图1 (https://arxiv.org/html/2607.06845#S1.F1))。 我们将这种行为称为方言偏好偏见:LLM系统性地倾向于SAE而非像AAE这样的有效变体,即使使用者正在使用AAE。将AAE视为需要纠正的东西并非中立的风格选择,而是一种语言歧视:AAE是一种有规则可循的语言变体,有其自身一致的语法和音系,有超过3000万人使用(Lin et al., 2025 (https://arxiv.org/html/2607.06845#bib.bib38))。下游后果已得到充分记录:LLM会不成比例地错误分类AAE文本(Hassan et al., 2025 (https://arxiv.org/html/2607.06845#bib.bib37)),对AAE使用者的回应充满更多的刻板印象和居高临下(Fleisig et al., 2024 (https://arxiv.org/html/2607.06845#bib.bib34)),并且在处理非标准方言输入时任务表现下降(Ziem et al., 2023 (https://arxiv.org/html/2607.06845#bib.bib30); Lin et al., 2025 (https://arxiv.org/html/2607.06845#bib.bib38))。随着LLM进入招聘、医疗保健和内容审核领域,这种偏见正使数百万用户处于不利地位。 参见图注 **图1**: 在一个真实AAE推文上的方言偏好偏见。在强制选择续文任务中,六个最先进的LLM中有五个在AAE语境下偏好SAE续文而非流畅的AAE替代项,并且在SAE语境下全体都偏好SAE续文。 | 工作 | 来源 | 构建方法 | 规模 | 判别式评估 | 生成式评估 | 特征分析 | 去偏方法 | |------|------|----------|------|------------|------------|----------|----------| | VALUE (Ziem et al., 2022 (https://arxiv.org/html/2607.06845#bib.bib10)) | 合成 | SAE→AAE (规则, 人工验证) | 2,880* | 任务准确率 | ✗ | ✓ | ✗ | | Multi-VALUE (Ziem et al., 2023 (https://arxiv.org/html/2607.06845#bib.bib30)) | 合成 | SAE→方言 (规则, 母语验证) | 7,983* | 任务准确率 | ✗ | ✓ | 增强 | | AAVENUE (Gupta et al., 2024 (https://arxiv.org/html/2607.06845#bib.bib27)) | 合成 | SAE→AAE (LLM, 人工验证) | 5,000 | 任务准确率 | ✗ | ✗ | ✗ | | EnDive (Gupta et al., 2025 (https://arxiv.org/html/2607.06845#bib.bib18)) | 合成 | SAE→方言 (LLM, 母语验证) | 40k+ | 推理准确率 | ✗ | ✗ | ✗ | | Fleisig et al. (2024 (https://arxiv.org/html/2607.06845#bib.bib34)) | 真实 | 提示诱发 | ~3,000 | ✗ | 是 | ✓ | ✗ | | Mire et al. (2025 (https://arxiv.org/html/2607.06845#bib.bib36)) | 真实 | 偏好对 | 1,843 + 2,365 | RM分数 | ✗ | ✗ | ✗ | | Hassan et al. (2025 (https://arxiv.org/html/2607.06845#bib.bib37)) | 真实 | AAE优先 + 反向翻译 | ~5,000 | DGI | ✗ | ✗ | ✗ | | **Real-AAE (ours)** | **真实** | **AAE优先 + 反向翻译 + 人工验证** | **17,479** | **DGI, cDGI** | **PPL, LP, MC** | ✓ | **导向** | **表1**: 与之前关于方言偏见评估和缓解的工作的比较。**Real-AAE** 是唯一一个结合了真实AAE、人工验证、判别式和生成式审计、特征级分析以及缓解方法的项目。HV: 人工验证;NV: 母语者验证;Aug.: 数据增强;* 标记评估子集而非完整基准规模。 现有关于AAE方言偏见的工作存在三个关键局限性(表1 (https://arxiv.org/html/2607.06845#S1.T1))。首先,大多数基准通过规则或LLM驱动的翻译从SAE*合成*生成AAE(Ziem et al., 2022 (https://arxiv.org/html/2607.06845#bib.bib10), 2023 (https://arxiv.org/html/2607.06845#bib.bib30); Gupta et al., 2024 (https://arxiv.org/html/2607.06845#bib.bib27), 2025 (https://arxiv.org/html/2607.06845#bib.bib18)),产生的AAE低估了现实世界中的方言影响(Lin et al., 2025 (https://arxiv.org/html/2607.06845#bib.bib38); Gupta et al., 2025 (https://arxiv.org/html/2607.06845#bib.bib18))。其次,真实AAE研究范围狭窄:它们要么评估分类一致性(Hassan et al., 2025 (https://arxiv.org/html/2607.06845#bib.bib37)),要么评估生成式回应(Fleisig et al., 2024 (https://arxiv.org/html/2607.06845#bib.bib34)),要么评估奖励模型评分(Mire et al., 2025 (https://arxiv.org/html/2607.06845#bib.bib36)),但没有一个同时结合判别式和生成式审计、识别哪些语言特征触发偏见、或提供缓解方法。第三,现有的少数缓解方法需要重新训练(Ziem et al., 2023 (https://arxiv.org/html/2607.06845#bib.bib30))、架构更改(Srirag et al., 2025 (https://arxiv.org/html/2607.06845#bib.bib53); Zhou et al., 2025 (https://arxiv.org/html/2607.06845#bib.bib31)),或完全清除方言的辅助翻译流水线(Klisura et al., 2025 (https://arxiv.org/html/2607.06845#bib.bib54))。 我们如下解决这些局限性。首先,从母语AAE使用者的推文语料库(Blodgett, 2021 (https://arxiv.org/html/2607.06845#bib.bib29))出发,我们通过翻译和反向翻译构建了 **Real-AAE**,一个包含17,479个AAE/SAE/AAE回溯三元组的语料库,并经过自动验证和三位母语AAE使用者的验证。这种AAE优先的构建方法保留了合成AAE所缺失的方言特征。 然后,我们沿着两个维度审计六个指令微调的LLM(14B到70B):通过我们新的条件性方言组不变性(cDGI)指标进行*判别式一致性*审计,该指标将模型偏见与翻译器伪像分离开;通过困惑度、对数概率和强制选择续文进行*生成式偏好*审计。特征级定位分析进一步指出了哪些AAE标志触发偏见。 最后,据我们所知,我们首次将激活导向应用于方言偏见:一种无需训练的方法,通过因果追踪识别与偏见相关的层,并在推理时注入学习到的方言方向。我们的分析产生了三个主要发现:(i)所有六个模型即使在AAE语境下也更偏好SAE续文,默认“纠正”方言;(ii)句法结构是所有测试模型的普遍偏见触发因素;(iii)导向将偏见减少了5-20倍,远远超过提示方法,同时保持了SAE的流畅性。 ##### 贡献。 - • 我们发布了 **Real-AAE**,这是迄今为止最大的真实AAE平行语料库:来自自然推文的17,479个AAE/SAE/AAE回溯三元组,比之前的真实AAE资源大2到6倍,并经过自动验证和三位母语AAE使用者的验证。 - • 我们引入了一个审计框架,结合cDGI(控制翻译器引起的漂移)与生成式偏好指标,以及特征级定位分析,识别最强烈触发偏见的AAE标志。 - • 我们提出了第一种用于方言去偏的激活导向方法:无需训练、测试时可用,并适用于不同模型规模。在六个最先进的LLM(14B到70B)上,它比提示方法更有效地缓解方言偏见5到20倍,同时保持了SAE的流畅性。 参见图注 **图2**: **Real-AAE** 构建流水线。从真实的AAE推文开始,我们过滤数据,将AAE翻译成SAE,移除无效输出,然后将SAE句子反向翻译成AAE,以构建最终的三元组数据集。 ## 2 相关工作 自然语言处理中的方言偏见:方言偏见已在多个自然语言处理任务中得到记录,包括语言识别(Blodgett, 2021 (https://arxiv.org/html/2607.06845#bib.bib29))、仇恨言论和毒性检测(Sap et al., 2019 (https://arxiv.org/html/2607.06845#bib.bib46); Davidson et al., 2019 (https://arxiv.org/html/2607.06845#bib.bib5); Sap et al., 2022 (https://arxiv.org/html/2607.06845#bib.bib7))、自动语音识别(Koenecke et al., 2020 (https://arxiv.org/html/2607.06845#bib.bib47))、文本生成(Deas et al., 2023 (https://arxiv.org/html/2607.06845#bib.bib49)),以及关于就业能力、犯罪性和个性的下游决策(Hofmann et al., 2024 (https://arxiv.org/html/2607.06845#bib.bib39))。最值得注意的是,Hofmann等人(2024 (https://arxiv.org/html/2607.06845#bib.bib39))表明,即使在明显的种族偏见减少后,方言偏见仍然存在于指令微调的LLM中,这促使需要对前沿模型进行特定于方言的审计。 AAE偏见基准:评估AAE偏见的资源沿着方法论轴线划分。*合成*基准通过规则或LLM驱动的翻译将SAE转换为AAE(Ziem et al., 2022 (https://arxiv.org/html/2607.06845#bib.bib10), 2023 (https://arxiv.org/html/2607.06845#bib.bib30); Gupta et al., 2024 (https://arxiv.org/html/2607.06845#bib.bib27), 2025 (https://arxiv.org/html/2607.06845#bib.bib18)),这种方法被证明低估了现实世界的方言影响(Lin et al., 2025 (https://arxiv.org/html/2607.06845#bib.bib38); Gupta et al., 2025 (https://arxiv.org/html/2607.06845#bib.bib18))。*真实AAE*资源直接从AAE使用者那里获取文本(Blodgett, 2021 (https://arxiv.org/html/2607.06845#bib.bib29); Hassan et al., 2025 (https://arxiv.org/html/2607.06845#bib.bib37); Fleisig et al., 2024 (https://arxiv.org/html/2607.06845#bib.bib34); Mire et al., 2025 (https://arxiv.org/html/2607.06845#bib.bib36)),但每个都针对单一评估模式:分类一致性(Hassan et al., 2025 (https://arxiv.org/html/2607.06845#bib.bib37))、生成式回应(Fleisig et al., 2024 (https://arxiv.org/html/2607.06845#bib.bib34))或奖励模型评分(Mire et al., 2025 (https://arxiv.org/html/2607.06845#bib.bib36))。最接近的先前工作,Hassan等人(2025 (https://arxiv.org/html/2607.06845#bib.bib37)),在用于情感分类的真实AAE语料库上引入了方言组不变性(DGI)。我们在多个维度上扩展了这项工作:**Real-AAE** 语料库大2-6倍;增加了判别式和生成式指标;对偏见触发因素进行了特征级定位;并提供了测试时缓解方法(表1 (https://arxiv.org/html/2607.06845#S1.T1))。 方言偏见缓解:先前的缓解方法分为三类。*训练时*方法用方言例子增强训练数据(Ziem et al., 2023 (https://arxiv.org/html/2607.06845#bib.bib30)),但可能降低SAE的准确性。*架构*方法添加方言特定模块,如LoRDD适配器(Srirag et al., 2025 (https://arxiv.org/html/2607.06845#bib.bib53))或基于编码器的DialectGen(Zhou et al., 2025 (https://arxiv.org/html/2607.06845#bib.bib31))。*推理时*方法在将AAE输入传递给LLM之前将其翻译成SAE(Klisura et al., 2025 (https://arxiv.org/html/2607.06845#bib.bib54)),这避免了重新训练,但引入了辅助模型并清除了方言,而不是缓解对其的偏见。我们的方法相反在推理时直接干预目标模型的激活,无需重新训练、架构更改、辅助模块或清除方言。 激活导向:我们的方法建立在激活导向之上,这是一种可解释性机制技术,通过在推理时向隐藏状态添加学习到的方向来控制模型行为。该方法已应用于一般行为控制(Turner et al., 2023 (https://arxiv.org/html/2607.06845#bib.bib3); Zou et al., 2023 (https://arxiv.org/html/2607.06845#bib.bib1); Rimsky et al., 2024 (https://arxiv.org/html/2607.06845#bib.bib21))、拒绝行为(Arditi et al., 2024 (https://arxiv.org/html/2607.06845#bib.bib24))和人物特征(Chen et al., 2025 (https://arxiv.org/html/2607.06845#bib.bib26))。Liu等人(2024 (https://arxiv.org/html/2607.06845#bib.bib4))将其扩展到社会偏见缓解,但未涉及方言偏见。据我们所知,我们是第一个将激活导向应用于方言去偏的工作。 ## 3 基准构建 为了审计AAE方言偏见而不将其与翻译伪像混为一谈,我们构建了 **Real-AAE**,一个基于自然发生的AAE推文的(AAE, SAE, AAE_back)三元组的*AAE优先*平行语料库(图2 (https://arxiv.org/html/2607.06845#S1.F2))。与从SAE推导AAE的合成基准不同,我们的流水线从真实AAE开始并向外部翻译,保留了合成生成可能缺失的方言特征。 ##### 源数据和过滤: 我们基于TwitterAAE语料库(Blodgett et al., 2018 (https://arxiv.org/html/2607.06845#bib.bib9)),该语料库通过地理位置和网络分析的人口统计推断识别来自非裔美国人账户的推文。为了确保有足够的内容进行情感分析和续文建模,我们保留至少10个词的推文,并剥离非ASCII字符、用户提及和URL,得到17,495条推文。 ##### 翻译和反向翻译: 我们将每条AAE推文使用Gemini-3-flash翻译成SAE,然后使用相同的模型将SAE反向翻译成AAE(记为AAE_back)。反向翻译有两个目的:(i)它提供了内容保留检查,因为如果翻译没有引入漂移,AAE和AAE_back在语义上应保持一致;(ii)它使我们能够使用cDGI指标(§4.1 (https://arxiv.org/html/2607.06845#S4.SS1)),该指标以翻译稳定的例子为条件,将模型偏见与翻译伪像分离开来。我们手动检查样本翻译并定义过滤标准,以移除带有添加解释、语义扭曲或翻译伪像的对,最终得到17,479个
相似文章
并列比较加剧语言模型中的方言偏见
该研究发现,语言模型在并列比较标准美式英语和非裔美国人白话英语时,会表现出更强的方言偏见,即使经过安全微调也是如此。反事实公平微调可以在孤立情况下减少某些偏见,但在对比设置中并不一致。
DiaLLM:英语方言适应中鲁棒性与生成能力差距的研究
本文介绍了DiaLLM,一个将LLMs适应英语方言的框架,揭示了方言鲁棒性(理解)与生成(产生方言文本)之间的差距,并表明明确的变体目标对齐能改进生成,但不一定符合人类偏好。
你在说我的语言吗?关于多模态大语言模型中的口语遵循问题
本文解决了多模态大语言模型在ASR中的口语遵循问题,提出了一种软提示方法和新颖的度量标准来量化语言违规。它评估了三种缓解策略——零样本提示、监督微调和思维链推理——在多种语言上的效果,以提高转录保真度。
方言能否像语言一样被引导?阿拉伯语大语言模型中的稀疏神经元与分布式方向
本文研究了通过识别稀疏神经元群体和提取方言激活方向来引导阿拉伯语大语言模型生成特定方言的方法,从而在不进行微调的情况下实现推理时的方言控制。
将LLM性别偏见锚定于人类基线:一项跨语言审计
本文对六种大型语言模型在英语、韩语、中文和日语中的性别刻板印象进行审计,并以人类基线作为锚定。研究发现,LLM的刻板印象程度往往超过人类跨国差异,且可能跨语言叠加,为此引入了一个四模式框架来表征此类行为。