方言税:方言偏见在语言建模流程中的持续存在
摘要
本文研究了方言偏见如何在整个语言建模流程中持续存在和累积,从分词到推理,表明差异在每一步都被编码。
arXiv:2608.24952v1 公告类型:新
摘要:语言模型(LMs)中系统性的方言性能差距已有充分记录,但现代语言建模流程中这些差异的来源仍不明确。我们的研究追溯了这一“方言税”在整个自然语言处理流程中的存在。使用平行英语方言语料库,在保持意义固定而改变表面形式的情况下,我们首先确认语言模型将匹配的标准美式英语(SAE)和方言文本识别为语义等价。然而,我们发现了与下游性能差距相对应的进一步表示差距。在不同模型家族和世代中,现代语言模型在分词、预训练、后训练和推理过程中仍然不等地编码方言文本。引人注目的是,通过字符级反事实分词器绕过传统的子词分割,既没有消除输入和输出的不对称性,也没有消除方言准确性差距。在预训练期间,方言对比完全无关的SAE文档对产生更分歧的梯度更新,表明模型发现语义等价的方言内容比无关的SAE文档更难学习。在后训练期间,奖励模型表现出上下文相关的、不稳定的方言偏好,将更高的值分配给孤立的AAVE专属令牌而不是SAE专属令牌,而完整的推理上下文则受到任务和模型相关的方言惩罚。总体而言,我们的发现表明,方言税并非由任何单一步骤孤立编码,而是在语言建模过程的每一步都被编码和累积。
查看缓存全文
缓存时间: 2026/08/27 09:13
# 方言税:方言偏见在语言建模全流程中的持续性 来源:https://arxiv.org/html/2608.24952 ###### 摘要 语言模型(LM)在系统性方言性能差距方面已有充分记录,但现代语言建模流程中导致这些差异的根源仍不明确。本研究追踪了这一"方言税"在自然语言处理流程中的传递路径。我们使用保持语义固定但改变表面形式的平行英语方言语料库,首先证实语言模型能将标准化美式英语(SAE)与方言文本识别为语义等价。然而,我们进一步发现对应下游性能差距的表征差异。跨模型家族与迭代版本,现代语言模型在分词、预训练、后训练及推理阶段仍对方言文本进行不平等编码。值得注意的是,通过字符级反事实分词器绕过传统子词分割,并未消除输入/输出不对称性或方言准确度差距。在预训练阶段,方言对引发的梯度更新比完全无关的SAE文档对更为发散,表明模型认为语义等价的方言内容比无关SAE文档更难学习。后训练阶段,奖励模型表现出上下文相关的不稳定方言偏好:孤立出现的AAVE专属词元获得比SAE专属词元更高的奖励值,而完整推理语境则受到任务相关且模型依赖的方言惩罚。总体而言,我们的发现表明方言税并非由单一环节单独产生,而是在语言建模流程的每个阶段被编码并累积。 ## 1 引言 人工智能系统(尤其是语言模型)已成为全球技术支柱。尽管自然语言处理(NLP)领域的深度学习进步提升了这些系统的性能,但这些技术在语言建模全流程的每个阶段仍持续表现出社会偏见(Okpala等,2022;Buyl等,2024;Joshi等,2024)。语言变异的一个显著形式是方言变异,其特征由地理、社会经济阶层、种族、性别和年龄等宏观社会因素决定(Haugen,1966;Haugh与Schneider,2012)。由此产生的方言主要分为两类:标准方言与非标准方言(Trudgill,2004)。定义上,由多数群体使用的"标准"方言会获得政府和教育机构的优待,使标准方言使用者比少数方言使用者获得更多社会经济机会(Trudgill,1979)。这形成了循环累积效应,系统性损害少数群体利益,使使用"非标准"语言变体的历史边缘化社区更容易遭受基于历史数据训练的现代AI系统的进一步歧视(Blodgett等,2016;Jurgens等,2017;Kantharuban等,2023;Drożdżowicz与Peled,2024;Nayeem与Rafiei,2026)。 先前研究表明,语言建模技术栈的各组件在处理罕见语言形式(如低资源语言和方言)时表现不佳,导致成本、延迟和质量上的问题性偏见与差异,加剧了语言技术可及性的经济鸿沟。这些偏见已在分词器(Ahia等,2023;Petrov等,2023)、语言模型(Lin等,2025)和奖励模型(Mire等,2025,RMs)中被识别。学界普遍认为不同社会群体原始文本的系统性表征差异会导致下游性能问题,但这些偏见是否起源于分词器仍是开放性问题。 在标准NLP流程中,分词是将人类可读文本转换为机器可读格式的首要步骤(Grefenstette,1999)。现代语言模型使用子词分词技术,将文本分解为从分词器词汇中提取的子词单元序列(即"子词元")。尽管具体算法存在差异,分词器通过在训练语料库上优化分割模型来实现分词,这一过程并未显式考虑罕见语言形式。例如,"buildin'"可能被分为['build', 'in', '’'],而"building"则由单个词元['building']表示。这种算法方法是把双刃剑:既可能通过促进形式模式识别来提升模型性能(Wegmann等,2025),也可能因产生非预期伪影而降低模型性能(Hofmann等,2022;Arnett与Bergen,2024;Schmidt等,2024)。 为推进能最小化语言内变异不良影响的公平语言技术,本研究旨在识别方言偏见的来源。我们使用英语(最高资源语言)的平行方言语料库,追踪现代NLP流程各阶段(分词、预训练、后训练、推理)中的"方言税"。通过英语对英语的比较分析,消除了字节溢价的干扰因素(Arnett等,2024)。 我们首先证实模型对语义等价的SAE与方言文本的匹配识别度,高于对相同文本的翻译或字符扰动副本的识别(第2节)。尽管如此,实验记录了最新代分词器中方言偏见的持续存在,并在当前主流语言模型中重现了推理差距(第3节)。结果证实,与标准化美式英语(SAE)相比,已常被污名化的非裔美国人英语(AAVE)等方言仍面临次优模型性能。 为探究方言偏见起源,我们首先使用字符级分词反事实实验隔离分词器的因果作用(第4节)。通过在推理时移除子词分割,我们缩小了输入侧的方言差距。然而,这种字符级分词干预基本未改变准确率和输出行为。这些结果表明方言偏见通过分词器持续存在于模型学习权重中,需要对训练动态进行深入考察。我们确实提供了经验证据,表明方言税在预训练和后训练阶段均被引入(第5节)。 跨方言对观察到基础模型梯度、语言模型隐藏状态和奖励模型偏好的发散性。SAE与AAVE输入对产生的梯度更新,比两个完全无关的SAE文档对更具差异性,表明方言文本无论问题难度如何都始终具有更高预测成本。奖励模型在孤立情境下奖励方言专属词元,却在上下文中惩罚这些词元,这可能将偏见传播至部署的语言模型。总之,我们证明方言偏见并非仅源于分词器,而是跨语言模型和奖励模型累积产生。因此,解决方言税需要全新的模型训练方法。 ## 2 相同意义,更高税负 在追踪方言偏见来源前,我们首先排除观察到的差距源于显著语义不匹配的可能性。我们验证了文本嵌入模型为匹配的方言对分配高语义相似度,表明方言相关行为反映的是表面形式偏见。 图1:模型理解语义等价性却惩罚表面形式。我们在MultiVALUE数据集上可视化各种文本变换的语义等价性。所有方言对的相似度均超过每种扰动和翻译基线。 **数据集**:ParallelAAVE(Groenwold等,2020)和MultiVALUE(Ziems*等,2023)提供了SAE与美国方言间的平行文本(表4)。ParallelAAVE每对包含AAVE书写的推文及其对应的SAE人工改写版。MultiVALUE使用基于规则的翻译系统,将CoQA(Reddy等,2018)的SAE文本合成生成AAVE、阿巴拉契亚方言、奇卡诺方言、印度英语和新加坡英语变体。 **实验设置**:我们采用基于Gemma-3语言模型家族、拥有3亿参数的文本嵌入模型EmbeddingGemma(Vera等,2025),该模型通过俄式套娃表示学习(Kusupati等,2024)生成四个嵌套维度(768×768, 512×512, 256×256, 128×128)的数值向量表示。选择EmbeddingGemma衡量相似度的原因是其明确针对语义相似度等任务优化,且源自后续分析所用的语言模型家族之一。我们通过计算文本嵌入向量x与y的余弦相似度sim(x,y)=⟨x,y⟩/(‖x‖₂‖y‖₂)来量化两文本间的语义等价性。 将MultiValue和ParallelAAVE中的每个SAE样本与三类文本变换进行比较,作为评估方言处理时保持意义不变改变表面形式的校准基线。 **变换类型**: (1)方言变换:使用平行文本。 (2)字符级扰动:交换(P=0.05)、删除(P=0.15)、插入(P=0.05)和大小写变换(交替或P=0.5)。 (3)翻译:将原始SAE文本翻译成高资源(法语、中文)、中资源(印地语、波兰语)和低资源(柬埔寨语、约鲁巴语)六种语言。 **方言语义等价性验证**:我们发现嵌入模型在表面形式变换下表现出语义不变性。图1比较了SAE与方言改写文本、SAE与扰动控制组、SAE与翻译控制组的逐句余弦相似度。在MultiVALUE中,所有五种方言对的相似度超过0.98,显著高于相似度在0.659至0.978间的每种扰动和翻译控制基线。通过单侧配对Wilcoxon符号秩检验(对429个对齐句子进行Holm校正p<0.001),确认所有五种方言条件比每个控制组更接近SAE。在ParallelAAVE中,SAE与AAVE的相似度为0.92,显著高于(Holm校正p<0.001)字符删除(0.840)、大小写变换(0.702至0.786)和翻译(0.534至0.872),但低于字符交换(0.956)和插入(0.951)。所有数值远高于无关文档对的零基线(μ=0.41)。 我们检查了混淆因素:嵌入模型是否为模型更易预测的文本分配更高相似度,而非为保持意义的文本分配更高相似度。如果此混淆成立,对模型而言更意外(更高困惑度)的变换应预测更低相似度。但实际结果显示相似度追踪语义内容而非语言模型困惑度(表9)。跨所有变换,平均相似度与对数中值逐词输入困惑度比呈正相关(MultiVALUE: ρ=+0.54, ParallelAAVE: ρ=+0.43),而非负相关。 ## 3 模型(仍然)具有方言偏见 (a)ParallelAAVE平均词元生成率(b)MultiVALUE词元长度比率 图2:现代分词器持续表现方言偏见。 (2a)三种分词算法在ParallelAAVE上的平均词元生成率显示SAE与AAVE方言间存在统计显著差异。 (2b)BPE词元长度在MultiVALUE各方言与SAE的比率,揭示了与美国少数群体当前收入差距大体平行的持续性方言分词性能差距(附录D.1)。 尽管模型已改进并在各类基准测试中持续优化,我们验证了新一代模型仍在信息压缩和下游推理任务中表现出词元偏见。 ### 3.1 分词器具有方言偏见 **分词器**:我们探索三种最流行的分词方法:字节对编码(BPE)(Sennrich等,2015)、Unigram(Kudo,2018)和WordPiece(Schuster与Nakajima,2012)。使用流行语言模型的分词器评估分词指标(表5)。BPE变体包括GPT-5、GPT-2、Gemma-3、Llama-3和Qwen-3模型。Unigram使用T5模型。WordPiece使用BERT模型。当模型版本明确时,省略语言模型家族编号。 **评估指标**:通过八项指标(表10)衡量词元偏见,主要展示词元长度和词元生成率(词元数除以单词数)。我们通过评估这些指标在平行文本中是否在所有方言间达到均等(即在相同内容条件下指标应具有可比性)来评估分词器公平性。 **结果**:分词器在英语各方言间持续产生不平等表征。图2(a)证明方言分词偏见跨越现代分词器和模型家族持续存在。所有分词器中,AAVE文本的平均词元生成率(↓越好)均高于对应SAE文本,平均每词差距为+0.07个词元。图2(b)显示...
相似文章
从基列河到大型语言模型的推理分布:规模化的隐性方言偏见与语言剖析
本文通过分析大型语言模型在四种英语方言上的内部概率分布,考察其隐性方言偏见,发现模型将更多负面住房相关形容词与非裔美国人英语和尼日利亚皮钦语相关联,反映了类似于人类歧视的继承偏见。
并列比较加剧语言模型中的方言偏见
该研究发现,语言模型在并列比较标准美式英语和非裔美国人白话英语时,会表现出更强的方言偏见,即使经过安全微调也是如此。反事实公平微调可以在孤立情况下减少某些偏见,但在对比设置中并不一致。
语言模型中的深层和浅层偏差
本文引入了一个偏差深度评分,用于区分大型语言模型中稳定的“深层偏差”与依赖提示的“浅层偏差”,并展示深层偏差更持久且更难移除。
语言模型认为谁是称职的?职业偏见的机制分析
论文提出了一个因果框架,用于分析语言模型的职业偏见,发现即使行为指标未显示差异,表征偏见也可能持续存在,并且在干预时这些偏见可能影响下游行为。
语言模型受困于歧义诅咒
本文发现语言模型中存在歧义诅咒:下一个词分布越模糊,学习难度越大,这源于架构和学习方面的原因,并通过合成数据和真实数据进行了验证。