大语言模型中词汇对齐与偏好阶段转变的全自动识别

arXiv cs.CL 论文

摘要

本文提出了两种自动化指标:词汇对齐分数(Lexical Alignment Score)和三角化偏好转变(Triangulated Preference Shift),用于识别大语言模型中的词汇过度使用,并将其归因于偏好学习阶段。该方法在六个模型家族上使用PubMed摘要进行测试,无需人工干预即可重复先前的研究发现。

arXiv:2606.03165v1 Announce Type: new Abstract: 数字聊天助手(如ChatGPT)所使用的语言可能与人类预期存在偏差(即不对齐)。现有研究主要针对科技英语,描述了偏差的类型,并在一定程度上解释了其原因,将其与人类偏好学习的训练阶段联系起来。然而,现有方法依赖于人工策展。本文引入了两种无需策展、低假设依赖性的评估指标:词汇对齐分数(Lexical Alignment Score),用于识别词汇过度使用;以及三角化偏好转变(Triangulated Preference Shift),用于量化这些转变在多大程度上可归因于人类偏好学习。我们使用PubMed摘要生成续写,并利用窗口化文档出现率对六个模型家族(Falcon、Gemma、Llama、Mistral、OLMo、Yi)进行了测量。该过程无需人工干预即可识别出过度使用的词汇,如'suggest'、'additionally'和'strategy',并估计它们与偏好学习的关联。我们的研究结果重复了先前的工作,并且在不同的参数设置、随机种子以及额外数据的评估下保持稳定。该方法易于扩展,能够对科技英语之外的语言以及跨语言环境下的词汇(不对齐)进行系统研究,因此这些指标有望为未来模型的改进对齐及其起源理解做出贡献。
查看原文
查看缓存全文

缓存时间: 2026/06/03 09:37

# 大型语言模型中词汇对齐与偏好阶段转移的全自动识别

来源:https://arxiv.org/html/2606.03165

###### 摘要

诸如ChatGPT等数字聊天助手使用的语言可能偏离人类预期(即失配/不对齐)。现有研究主要关注科学英语领域,不仅描述了哪些偏差发生,还在一定程度上解释了原因,将其与人类偏好学习的训练阶段联系起来。然而,现有方法依赖于人工筛选。本文引入了两种无需人工筛选、假设较少的评估指标:词汇对齐分数(用于识别词汇过度使用)和三角化偏好转移指标(用于量化此类转移中有多少可归因于人类偏好学习)。我们使用PubMed摘要,通过窗口文档频率对六个模型系列(Falcon, Gemma, Llama, Mistral, OLMo, Yi)生成的续写内容进行测量。该过程无需人工干预即可识别出*suggest*、*additionally*和*strategy*等被过度使用的词汇,并估计它们与偏好学习的关联。我们的发现复现了先前的研究,并且在参数设置、随机种子以及其他数据评估中保持稳定。该方法易于扩展,能够对科学英语之外以及跨语言的词汇(失配/不对齐)进行系统研究。因此,这些指标有潜力为改进未来模型的对齐以及理解其起源做出贡献。

关键词:词汇对齐,评估,大型语言模型,偏好学习,科学英语

## 1\. 引言

基于大型语言模型(如ChatGPT)的数字助手的使用正在快速增长,这些人工智能(AI)工具现在广泛用于编程、语言编辑和信息查找(Stack Overflow, 2024;Coffey, 2024;O’Brien和Sanders, 2025;Sidoti和McClain, 2025)。它们在标准基准测试(例如,法律、数学和语言任务;Achiam等人, 2023;Hendrycks等人, 2020;Cobbe等人, 2021)上表现出色。然而,它们可能以系统性的方式偏离人类用法。这种"失配/不对齐"的一个显著实例涉及词汇行为:在科学英语中,助手不成比例地偏爱诸如“delve”、“intricate”和“furthermore”等词汇(Matsui, 2024;Kobak等人, 2024;Liang等人, 2024;Liu和Bu, 2024;Gray, 2024;Geng和Trotta, 2024)。当前的证据表明,偏好学习阶段——例如,基于人类反馈的强化学习(RLHF;Ouyang等人, 2022)或直接偏好优化(DPO;Rafailov等人, 2024)——是这些转移的显著驱动因素(Bharadwaj等人, 2025;Juzek和Ward, 2025)。

基于LLM的聊天助手的训练通常遵循四个阶段:预训练(生成基础模型)、指令微调(使模型成为更有帮助的助手)、偏好学习(与人类判断对齐)以及任务特定微调(Christiano等人, 2017;Wei等人, 2021;Touvron等人, 2023)。对于经过指令和偏好微调后的模型,我们在本文中统称为指令模型;它们有时也被称为聊天模型。重要的是,偏好学习在助手行为方面带来了显著的提升(Ouyang等人, 2022;Rafailov等人, 2024)。然而,对AI相关词汇项的评估,无论是所谓的"是什么"(模型与人类的失配/不对齐;例如,Matsui, 2024;Kobak等人, 2024;Liang等人, 2024;Liu和Bu, 2024;Geng和Trotta, 2024)还是"为什么"(特定阶段转移;例如,Juzek和Ward, 2025),都面临一个主要问题:主流方法依赖于人工筛选和过滤(主要是临时启发式方法),这限制了跨领域和跨语言的可重复性和可扩展性。

我们引入了一种无需人工筛选的模型生成评估流程。我们将词汇过度使用视为一种可处理的启发式探测,其主要贡献在于在对齐流程中提供诊断,并指向归因(即观察到的模型行为的原因)。为此,我们评估了六个模型系列的基础版本和指令版本,使用42,000篇PubMed摘要作为输入。所有生成都使用确定性解码,并对人类和模型文本应用对称清洗(见第3节)。然后我们引入两个指标:词汇对齐分数(LAS),用于量化相对于人类续写内容,*什么*被过度使用(见第4.3节);以及三角化偏好转移指标(TPS),用于隔离*为什么*,即可归因于偏好学习阶段的提升(见第4.4节)。这些指标给出了有希望的结果,无论是针对单个词汇项还是估计观察到的转移中有多少源于偏好学习,以及宏观层面的模型趋势(见第5节)。我们通过分析额外数据、改变参数以及将结果与先前文献进行比较来验证这些指标(见第6节)。我们的工作通过提供更有效的诊断,为更有效的缓解措施奠定了基础,但这仍有待进一步发展。这使我们的研究与近期的研究相呼应,这些研究表明后训练可以改善助手行为,同时也会缩小输出多样性、减少偏好变化或放大主导响应模式(Kirk等人, 2023;Xiao等人, 2024;Zhang等人, 2025;Murthy等人, 2025)。更广泛的启示在第7节中讨论。

## 2\. 相关工作

### 2\.1\. LLM中的词汇过度使用

ChatGPT发布后,学术界注意到一小部分词汇(例如,“delve”、“furthermore”、“intricate”)的使用突然激增(Matsui, 2024;Kobak等人, 2024;Liang等人, 2024;Liu和Bu, 2024)。由于其中许多词汇在AI生成的文本中也同样被过度使用(Matsui, 2024),因此对这些激增最合理的解释是AI辅助写作促成了这些激增(Kobak等人, 2024)。虽然大多数工作集中在科学英语领域,但在新闻/编辑室环境中也有类似的发现(Fitterer等人, 2025)。这些分析主要基于书面语料库;一些工作注意到在即兴口语中AI相关语言的增加(Yakura等人, 2024;Anderson等人, 2025),但因果归因仍不完整。

### 2\.2\. 词汇过度使用的潜在机制

证据表明RLHF/DPO是大型语言模型中词汇过度使用的驱动因素。三元组比较(人类 vs 基础模型 vs 指令模型)显示出与偏好学习起作用的假设一致的模式(Bharadwaj等人, 2025;Juzek和Ward, 2025)。对于风格和格式选择,偏好数据中的微小偏差可能导致不成比例的大行为变化(Zhang等人, 2024)。关于自我训练和合成指令调优数据的工作强调了反馈循环和风格漂移的风险,包括可能的输出退化(Alemohammad等人, 2023;Briesch等人, 2023;Shumailov等人, 2023)。这些发现进一步推动了能够将一般失配/不对齐与偏好阶段效应区分开来的自动化诊断的需求。

### 2\.3\. 先前识别方法的局限性

文献中提出的用于识别AI过度使用词汇的大多数方法都有两个缺点(研究通常显示其中一个或两个;代表性例子包括Kobak等人, 2024;Gray, 2024;Matsui, 2024;Juzek和Ward, 2025):首先,它们依赖于人工筛选,特别是手工调整的启发式方法和事后过滤,这限制了可扩展性、可重复性以及跨领域和跨语言的应用。讨论主要围绕英语展开,跨语言的例外包括德语、西班牙语、葡萄牙语、中文和日语,但主要集中在AI检测和风格计量学领域(Irrgang等人, 2024;da Silva和Rottava, 2024;Kotz等人, 2024;Jin等人, 2025;Zaitsu和Jin, 2023;Schaaff等人, 2024;Terčon和Dobrovoljc, 2025)。其次,它们通常依赖生产流程不清晰的数据,然后*假设*写作中突然的变化是由于AI造成的。具体而言,许多论文分析了2022年前后科学摘要的变化,注意到“delve”等词汇的显著增加,并将其归因于AI。这是一个合理的推论,但它仍然是一个假设。

### 2\.4\. 对齐、失配/不对齐以及对人类可能的影响

对齐的总体目标是使系统反映人类的目标、价值观、信仰和更广泛的期望(Russell等人, 2015;Gabriel, 2020)。对齐研究通常通过一系列的诊断、特征描述、归因和缓解措施来进行。在数字助手中,对齐通常通过偏好学习(RLHF/DPO)来操作化(Ouyang等人, 2022;Rafailov等人, 2024);最近的工作为LLM操作化了价值观对齐测量(Norhashim和Hahn, 2024)。然而,文献记录了更广泛的失配/不对齐和社会危害(Blodgett等人, 2020;Bender等人, 2021),以及更具体的问题,例如LLM行为和下游领域中的性别和种族偏见(Kotek等人, 2023;Omiye等人, 2023),以及将能力与风格偏好混淆的评估假象(Perez等人, 2023)。一种更温和的失配/不对齐形式是谄媚奉承,即AI助手无论真实情况如何都赞美用户;已有努力来识别和缓解谄媚行为(Sharma等人, 2023;Wei等人, 2025);同样的情况也适用于冗长(Park等人, 2024)。高风险价值观层面的失配/不对齐以DeepSeek-R1为例(Gibney, 2025;Allen, 2025):在涉及自由民主话语的核心话题上,据报道其回应受到审查或严重重构,偏向于与政治实体一致的叙事(Samuel和Crook, 2025;Stokel-Walker, 2025;Nasch等人, 2025;Cole, 2025)。这种模型行为与自由民主语境中广泛认同的言论自由规范相悖(Poushter等人, 2025)。社会风险在于一种不良的规范漂移:重复的、低显著性的暴露可能使此类叙事正常化(单纯曝光/虚幻真相效应;Zajonc, 1968;Hasher等人, 1977),并且LLM撰写的政治信息可能改变态度(Bai等人, 2025)。我们的工作关注词汇选择对齐,特别是诊断、特征描述和归因步骤,并指向缓解措施。总体主题是对齐的副作用,我们的工作受到围绕价值观和内容对齐的讨论的启发。因此,关于词汇(失配/不对齐)的结构性发现,特别是关于偏好学习的作用,可能与价值观和内容(失配/不对齐)的问题相关联,并对这些讨论具有价值。

### 2\.5\. 与AI检测的关系

此外,大量文献探索了AI检测(基于分类器的、水印的、困惑度/风格计量学),并且存在大量用于检测的领域特定语料库(包括Gehrmann等人, 2019;Chakraborty等人, 2023;Mitchell等人, 2023;Kirchenbauer等人, 2024;Huang等人, 2025)。AI检测的优势包括可用的自动化以及分析多种语言和

相似文章

语言模型中对齐算法的机制分析

arXiv cs.LG

本文对六种偏好优化方法(PPO、DPO、SimPO、ORPO、GRPO、KTO)在三种开源模型系列上进行了系统性的机制分析,通过探针和稀疏自编码器揭示了对齐算法如何以不同的方式重塑内部表示。

探究语言模型的思维失调过程

arXiv cs.AI

本文提出通过将LLM的失调分解为细粒度的认知过程(失调指标),并利用线性探针检测内部激活中的这些指标,从而在分布外对话记录上实现了高AUROC。

测量、定位和消除LLM中的对齐特征

arXiv cs.LG

本文研究了LLM后训练如何引入类似AI的风格规律,并提出了PASTA,一种无需训练的方法来定位和消除这些对齐特征,从而在11个模型和6个检测器上降低AI检测率同时保持连贯性。