DiaLLM:英语方言适应中鲁棒性与生成能力差距的研究

arXiv cs.CL 论文

摘要

本文介绍了DiaLLM,一个将LLMs适应英语方言的框架,揭示了方言鲁棒性(理解)与生成(产生方言文本)之间的差距,并表明明确的变体目标对齐能改进生成,但不一定符合人类偏好。

arXiv:2607.07669v1 公告类型:新 摘要:大型语言模型越来越能\emph{理解}方言英语,但仍然只\emph{生成}标准的、偏向美式的英语,使得方言生成——这个问题的更困难的一半——在很大程度上未被解决。我们引入了\textbf{DiaLLM},它在国际英语语料库上持续预训练三个开放权重语言模型家族,并应用隐式和显式的后训练范式,每种范式结合三种模型对齐策略,从而首次对这些组件在澳大利亚英语、印度英语和英国北部英语中进行受控比较。我们的结果表明,方言鲁棒性和生成是\emph{分离的}:基准测试受持续预训练和SFT的影响,而对齐则以基准测试无法捕捉的方式明显地重塑了生成。明确的变体目标适应产生的输出被可靠地识别为方言,并且比广泛对齐更受欢迎,然而最激进地优化方言奖励的方法并不被人类评估者偏好。独立的语言学分析证实了这种奖励-质量差距,在两个家族中最为明显。没有单一的对齐方法占据主导地位,缩小差距将需要更丰富的奖励设计和对方言资源的持续投入。我们发布了所有代码、检查点和偏好数据集。
查看原文
查看缓存全文

缓存时间: 2026/07/09 07:50

# 英语方言适应中的鲁棒性与生成能力差距研究  
来源:https://arxiv.org/html/2607.07669  

Jordan Painter¹ Dipankar Srirag² Adarsh Kappiyath¹ Diptesh Kanojia¹ Aditya Joshi² Lu Yin¹  
¹萨里大学以人为中心的人工智能研究所,英国萨里  
²新南威尔士大学,澳大利亚悉尼  

{j.painter, a.kappiyath, d.kanojia, l.yin}@surrey.ac.uk  
{d.srirag, aditya.joshi}@unsw.edu.au  

###### 摘要  

大型语言模型理解方言英语的能力日益增强,但在输出时仍倾向于标准美式英语。方言生成——这一问题的更难部分——在很大程度上尚未得到解决。我们提出DiaLLM,该方法对三个开源语言模型家族在国际英语语料库上进行持续预训练,并应用隐式和显式两种后训练范式,每种范式结合三种模型对齐策略,从而首次对澳大利亚英语、印度英语和北英格兰英语的这些组件进行受控比较。我们的结果表明,方言鲁棒性与方言生成能力是**分离的**:基准测试结果由持续预训练和监督微调塑造,而对齐以基准测试无法捕捉的方式明显重塑了生成结果。显式品种定向适应产生的输出可靠地被识别为方言,并优于宽泛对齐,然而最激进地优化方言奖励的方法并未被人类评估者偏好。独立语言学分析证实了这种奖励-质量差距,在三个家族中的两个上最为明显。没有任何单一对齐方法占据主导地位,缩小差距需要更丰富的奖励设计以及对方言资源的持续投入。我们发布了所有代码、检查点和偏好数据集。  

DiaLLM:英语方言适应中的鲁棒性与生成能力差距研究  

Jordan Painter¹ Dipankar Srirag² Adarsh Kappiyath¹ Diptesh Kanojia¹ Aditya Joshi² Lu Yin¹  
¹萨里大学以人为中心的人工智能研究所,英国萨里  
²新南威尔士大学,澳大利亚悉尼  
{j.painter, a.kappiyath, d.kanojia, l.yin}@surrey.ac.uk  
{d.srirag, aditya.joshi}@unsw.edu.au  

## 1 引言  

[参见标题]  
图1:DiaLLM流水线概述:在ICE上进行持续预训练,然后进行**隐式适应**(标准SFT + 对齐)或**显式适应**(方言SFT + 品种定向对齐),并在两种范式中比较DPO、GRPO和GSPO。  

大型语言模型(LLM)在一系列NLP任务中表现出色(Wang et al., 2024;Touvron et al., 2023),但常常在方言和非标准变体——即偏离标准规范的地区性和社会性形式——上表现不佳(Joshi et al., 2025;Blodgett et al., 2016;Hofmann et al., 2024;Mire et al., 2025)。这些差异反映了训练数据的结构性失衡:大规模语料库偏爱主流语言形式,边缘化了非标准变体(Bender et al., 2021;Joshi et al., 2020)。虽然领域适应已受到大量关注(Gururangan et al., 2020),但单语内对方言变体的鲁棒性仍然相对研究不足。现有工作高度集中于非裔美国人英语和语码转换(Blodgett et al., 2016;Sap et al., 2019;Hofmann et al., 2024;Mire et al., 2025),而对诸如澳大利亚英语、印度英语和北英格兰英语等地区变体在对齐阶段的关注则明显较少。那些确实解决方言变体的方法——TADA(Held et al., 2023)、HyperLoRA(Xiao et al., 2023)——通过方言适配器或低秩组件来针对NLU在方言**输入**下的鲁棒性;LoRDD(Srirag et al., 2025a)同样在特定任务设置中为解码器模型采用低秩方言适配器。这些方法均未研究跨预训练、微调和对齐的完整流水线适应,也未探究模型是否能产生方言适当的**输出**。方言生成(输出时产生语言变体,而非仅在输入时容忍它)是当前方法尚未解决的关键问题。  

想象三个用户追踪一件迟到的包裹:  

> 印度英语:My parcel is not yet coming; kindly do the needful and prepone the delivery.  
> 北英格兰英语:Me parcel’s not arrived; summat were up wi’ the courier.  
> 澳大利亚英语:Me parcel still hasn’t turned up, reckon it’s good this arvo, eh?  

一个现代LLM会**理解**这三种表达,但用平淡的标准美式英语回答每一个。一个能理解每种变体却只说一种的模型并没有解决方言问题;它隐藏了问题的一半。  

我们提出DiaLLM,一个方言适应框架,它在国际英语语料库(ICE;Greenbaum and Nelson 1996)上对三个开源LLM家族(Llama 3.1-8B、Qwen 3-8B、Gemma 3-4B)进行持续预训练,覆盖18种英语变体。如图1所示,从每个CPT检查点出发,我们追求两种后训练范式:**隐式适应**应用标准的指令微调和宽泛对齐;**显式适应**使用方言扰动的监督和品种定向对齐。在这两种范式中,我们比较直接偏好优化(DPO)、群相对策略优化(GRPO)和组序列策略优化(GSPO)。我们将每个流水线组件和对齐方法的相对有效性视为一个实证问题,而非假设任何单一方案最佳。  

我们的结果揭示了方言鲁棒性与方言生成之间的分离:基准测试性能主要由CPT和SFT驱动,而对齐以基准测试无法捕捉的方式明显重塑了生成结果。显式品种定向适应被人类标注者和LLM评判者可靠地识别为方言,并优于宽泛对齐。然而,最激进地优化方言奖励的方法并非他们偏好的方法。我们的语言学分析证实,该方法在所有三个家族中产生的可识别方言标记最少,显示了特征密度奖励与感知方言质量之间的不匹配。  

我们做出三项主要贡献:  

1. DiaLLM,一个完整流水线的方言适应框架,包含对持续预训练、监督微调和三种对齐方法(DPO、GRPO、GSPO)在两种后训练范式和三个开源LLM家族上的受控比较。我们发布所有代码(含语言学分析工具包)、模型检查点和方言偏好数据集¹¹¹https://github.com/jordanpainter/diallm。  
2. 我们确立了**鲁棒性–生成能力差距**:基准测试性能由CPT和SFT设定,而对齐对基准测试的改变微乎其微,却明显重塑了生成结果,表明仅凭基准测试会误判对齐的作用。  
3. 我们暴露了**奖励–质量差距**:尽管显式、品种定向适应被可靠识别为方言并优于宽泛对齐,但最激进地优化方言奖励的方法(GRPO)**不是**LLM评判者或人类标注者在Llama-3.1-8B上偏好的(进行了偏好评估);跨所有三个家族的独立语言学分析证实了这一发现。  

## 2 相关工作  

LLM在方言和非标准英语上系统性地表现不佳:标准NLP工具在AAVE上失效(Blodgett et al., 2016),方言文本被不成比例地标记为有害(Sap et al., 2019),LLM编码了种族语言学刻板印象,即使在对齐后,对于方言提示也会生成低质量输出(Hofmann et al., 2024;Mire et al., 2025),奖励模型本身将输出导向白人主流英语(Mire et al., 2025)。这些差距通过VALUE(Ziems et al., 2022)、BESSTIE(Srirag et al., 2025b)和DialectBench(Faisal et al., 2024)在281种变体上大规模记录。那些确实解决方言变体的方法——TADA(Held et al., 2023)和HyperLoRA(Xiao et al., 2023)——通过方言适配器或低秩组件来针对NLU在方言**输入**下的鲁棒性;LoRDD(Srirag et al., 2025a)同样在特定任务设置中为解码器模型采用低秩方言适配器。所有这些现有工作均未研究跨预训练、微调和对齐范式的完整流水线适应,也未探究模型是否能产生方言适当的**输出**。  

领域内文本的持续预训练是一个成熟的适应基础(Gururangan et al., 2020),已应用于医学、法律和多语言环境(Xie et al., 2024;Huang et al., 2023);Khan et al.(2025)表明魁北克法语中的方言差距可以通过CPT在有限的基准性能下降下缩小。在后训练方面,DPO(Rafailov et al., 2024)、GRPO(Shao et al., 2024)和GSPO(Zheng et al., 2025)提供了对比鲜明的偏好优化方法;De Langis et al.(2024)表明,具有自动语言学奖励信号的RL可以将生成导向风格定义的目标——我们将这一原则扩展到方言特定特征。这些方法均未被系统比较用于方言适应。  

## 3 方法论  

### 3.1 基础模型  

我们将方言适应流水线应用于三个开源LLM家族,参数范围在4B–8B之间:Llama 3.1-8B(Grattafiori et al., 2024)、Qwen 3-8B(Yang et al., 2025)和Gemma 3-4B-it(Team et al., 2025)²²²对于Gemma 3-4B-IT,我们从头开始使用指令微调变体而非基础模型进行CPT,因为初步实验中基础检查点表现不佳;其余流水线相同。选择架构多样的模型使我们能够评估方言适应的增益是否跨训练制度和词汇选择具有鲁棒性,而非特定于单一架构。  

### 3.2 持续预训练  

**语料库:** 我们使用国际英语语料库(ICE)对所有模型进行持续预训练,该语料库是一个包含来自25个以上英语使用地区的可比语料库集合。每个变体包含100万词的口语和书面语言样本,采用一致的社会语言学标准采样,这使得ICE特别适合本任务:它是唯一可用且覆盖内圈和外圈变体的多变体语料库,规模可用,且没有其他可比资源覆盖如此广泛的地区英语。在这项工作中,我们包含18个已清理、数字化数据可用的ICE变体³³³参见附录A了解预处理和过滤细节。我们只能获得使用该语料库中这些变体的权限。我们曾试图获取更多变体的访问权,但未能成功,要么是因为相关的ICE团队未回应请求,要么是数据未能以可用的数字化形式提供。该语料库覆盖广泛的地区、文化和后殖民英语,包括香港、尼日利亚、印度、牙买加等。总体而言,我们的训练语料库包含约2000万词。  

**预训练设置:** 我们在任何监督或基于偏好的后训练之前,使用GaLore(Zhao et al., 2024)对每个选定模型在清理后的ICE语料库上进行持续预训练,实现内存高效的全参数优化。CPT作为对清理后ICE文本的因果语言建模实现;完整训练细节见附录C。  

### 3.3 后训练数据集  

对于后训练,我们使用Cui et al.(2023)引入的偏好数据集,该数据集包含高质量提示-响应对,并对完成结果带有二元偏好标注。对于方言特定的训练分支,我们使用Multi-VALUE库(Ziems et al., 2023)将偏好完成结果转换为方言变体,针对三种英语变体:澳大利亚英语、印度英语和北英格兰英语。Multi-VALUE基于eWAVE特征(Kortmann et al., 2020)进行转换,eWAVE是唯一覆盖本工作中所有英语变体的形态句法变体特征级清单。这使得eWAVE成为方言扰动和奖励规范的自然基础。在转换过程中,代码块被自动检测并逐字保留。生成的数据集分别包含约11.8k、15.4k和18.4k个偏好对,对应澳大利亚英语、北英格兰英语和印度英语。数据集大小的差异源于Multi-VALUE产生的失败转换。  

### 3.4 对齐策略  

从每个CPT检查点出发,我们追求两种方言适应范式:**隐式分支**(宽泛训练,无品种定向)和**显式分支**(整个过程中单一品种定向),如图1所示。我们将每个阶段视为流水线中的独特角色:持续预训练引入了否则模型主要训练在标准英语语料上会缺失的方言暴露;后训练方法可以塑造输出分布,但无法引入模型权重中尚未潜伏的方言信号;监督微调恢复通用的指令遵循行为。  

#### 3.4.1 监督微调  

两个适应分支都从CPT检查点应用SFT,仅对单轮指令格式中的被选完成结果进行训练,并根据保留集的评估损失进行早停。完整超参数见附录C。**隐式分支**在标准`ultrafeedback-binarized-preferences`语料库上进行微调,提供通用的指令遵循目标,无明确的方言信号。**显式分支**则在目标品种的方言特定数据集上进行微调,因此被选完成结果已经包含Multi-VALUE的方言特征。

相似文章

Linguistic Monoculture in LLM-Assisted Language Use

arXiv cs.AI

This paper introduces a mathematical framework to study how reliance on shared LLMs for writing may reduce population-level linguistic diversity, analyzing fixed, recursive, and personalized interaction mechanisms and characterizing equilibria and convergence rates.

迈向超越英语中心化开发的大语言模型

arXiv cs.CL

本文证明了大语言模型严重偏向英语,并表明持续预训练在将模型适配到其他语言(尤其是文化理解方面)时,并不比从头训练更具成本优势。