隔离LLM词汇偏见:一种无需人工筛选的三角测量偏好阶段学习指标
摘要
介绍了一种无需人工筛选的指标(Triangulated Preference Shift),用于隔离和量化LLM在偏好学习过程中诱导的词汇偏见,无需手动筛选,覆盖六个模型家族。
查看缓存全文
缓存时间: 2026/06/02 15:36
# 隔离LLM词汇偏差:一种无人工标注的三角化度量用于偏好学习阶段 来源:https://arxiv.org/html/2606.00334
###### 摘要
> 近年来,各种语言领域经历了显著变化;这些变化很大程度上归因于大型语言模型的出现及其与自然语言使用的不对齐。这些不对齐被认为部分源于偏好学习阶段(例如基于人类反馈的强化学习),该阶段通常使模型更有用,但同时可能引入系统性的词汇偏差。在词汇行为上,这表现为模型对特定格式的偏好或某些词语(如*delve*、*furthermore*)的过度使用,即使这些模式在基础模型输出中并不存在。关于偏好训练期间引发的词汇不对齐的研究受到对人工标注依赖的限制。我们通过引入三角化偏好偏移分数(Triangulated Preference Shift score)来解决这一问题,该指标在人工黄金标准、基础模型和指令变体之间进行三角化,以隔离由偏好学习专门引发的偏移,无需人工标注。我们提供了来自六个模型系列的数据,将结果锚定在文献中,并通过分析偏好学习是否将模型转向可解读为“声望语言”的方向,展示了通用方法的实用性。该指标提供了一种自动化的初始方法,用于量化可归因于偏好调优的行为偏移,从而有助于模型对齐和可信AI的开发。
## 1 引言
随着由大型语言模型(LLM)驱动的AI助手的快速普及,LLM响应偏离人类期望的行为已成为一个紧迫问题:输出可能与期望不对齐(?;?;?;?;?)。近期研究表明,来自人类反馈的偏好学习(见第2.1节(https://arxiv.org/html/2606.00334#S2.SS1))可能促成这些偏移,例如通过降低图像生成的多样性(?),或引发对话和风格上的伪影,如奉承(?)和词汇过度使用(?;?;?;?;?;?)。
参见图注:图1:隔离指令阶段效应可实现模型行为的语言探针:指令调优将指令模型引向与声望相关的词汇,相对于基础模型提高了罗曼语族与日耳曼语族的实词比率(根据 χ2\\chi^{2} 检验具有显著性)。
LLM不对齐调查过程通常概念化为四个主要阶段:诊断(识别偏移发生的位置)、表征(描述偏移的性质)、归因(隔离负责的具体训练阶段)和缓解(纠正或减少不对齐行为的影响)。本文旨在加强该诊断基础,并支持表征和归因作为迈向缓解的必要步骤。具体而言,规模化地隔离和量化这些与偏好相关的词汇偏移面临两个障碍。首先,识别通常依赖人工标注和启发式方法。其次,即使识别出行为,将其归因于偏好学习阶段也非易事。我们通过引入一种无需人工标注的词汇偏移分析流水线和指标来应对这些障碍。我们使用42000篇PubMed摘要作为提示,采用确定性解码和标准化预处理,从六个模型系列(每个系列包含一个基础模型和一个指令跟随变体)获取生成结果(第3.2节(https://arxiv.org/html/2606.00334#S3.SS2))。然后,我们比较人类文本、基础模型生成和指令跟随生成的词汇分布,并通过三角化偏好偏移(TPS)得分形式化结果。TPS量化了过度代表是否与指令跟随模型向人类使用偏移相一致。我们在第4.1节(https://arxiv.org/html/2606.00334#S4.SS1)中验证TPS,在第五部分(https://arxiv.org/html/2606.00334#S5)中展示其在语域关联词汇上的实用性(也见图1(https://arxiv.org/html/2606.00334#S1.F1)),并在第六部分(https://arxiv.org/html/2606.00334#S6)中讨论其在受控偏好训练消融研究中的潜力。
## 2 背景
### 2.1 偏好学习在LLM训练流程中的作用
现代LLM训练通常按以下阶段进行:大规模预训练、指令调优、来自人类判断的偏好学习,以及可选的任务或领域特定微调(?;?;?)。在此流程中,偏好学习涉及向模型展示同一提示的多个候选响应,并训练其偏好于人类评估者排名更高的输出(?)。通过这些相对比较的学习,模型被调优以提升有用性和安全性(?)。诸如基于人类反馈的强化学习(RLHF;??)和直接偏好优化(DPO;??)等偏好学习方法被广泛认为是推动指令跟随性能的关键因素。尽管如此,偏好学习已被发现与各个方面的意外不对齐行为偏移有关(?;?;?)。注意,本文中我们广泛使用“偏好学习阶段”一词,指代旨在使模型行为与人类期望对齐的预训练后阶段程序,与文献中的讨论一致。
### 2.2 LLM中的词汇不对齐
在各种类型的不对齐行为中,本文聚焦于科学英语中的词汇选择。ChatGPT于2022年发布后,多项研究报告了科学英语的快速变化,一小部分词汇(如*intricate*、*nuanced*、*underscore*)在短时间内急剧增加(?;?;?;?;?)。然而,现有工作存在两个局限。首先,分析依赖人工标注和/或事后过滤,限制了可扩展性及超越(科学)英语的扩展。其次,人类与模型词汇行为之间不对齐的来源仍不明确。因此,进一步进展需要自动化的程序,同时比较人类文本、基础模型生成和指令跟随生成,以便将这些不对齐的来源归因于偏好学习。
### 2.3 词汇不对齐的意义与社会影响
量化这些偏移至关重要。证据表明,AI辅助会影响人类编写代码的方式(?),甚至可能影响自发口语(?;?)。更广泛地说,隔离训练阶段的贡献与对不对齐危害的关注相关联,包括有偏输出、不对齐信念和谄媚(?;?;?;?;?;?)。此类行为引发了对规范漂移的担忧,即反复接触AI生成语言可能会改变预期或使特定的语言和意识形态模式正常化(?;?;?)。
## 3 方法与实验
### 3.1 数据与模型系列
#### 数据
关于词汇过度使用的文献聚焦于科学英语。为了将我们的工作与之联系起来,我们的数据由PubMed摘要组成。我们随机抽取了2012–2021年间的42000篇摘要(每年4200篇,无放回),即ChatGPT于2022年发布前的十年。我们基于以下条件选择模型系列:(i) 既有基础版本也有指令调优版本;(ii) 支持确定性解码(温度 T=0T=0)以确保可重复性。我们选择了六个模型系列,具体使用参数大小为7B的Falcon-3(?)、4B的Gemma-3(?)、8B的Llama-3.1(?)、7B的Mistral(?)、7B的OLMo -2(?)和6B的Yi-1.5(?)。我们使用中等规模变体,因为更大的模型通常包含多模态能力,但在与本研究所相关的纯文本任务上改进微不足道(?)。关于模型版本,请参见我们的仓库(第11节(https://arxiv.org/html/2606.00334#S11))。
### 3.2 生成、解码与(预)处理
#### 模型生成
摘要在其中间点最近的句子边界处被切成两半。对于每个模型系列,前半部分作为提示 rir_{i}(i∈{1,...,42,000}i \in \{1,\dots,42{,}000\})用于生成基础模型流 BB 和指令模型流 II,而后半部分构成人类黄金标准流 HH。该方法与先前类似完形填空的工作相关(?;?)。此过程在所有流中产生了6340万个词元。所有生成均遵循确定性贪婪解码(第3.2节(https://arxiv.org/html/2606.00334#S3.SS2.SSSx2))。应用第3.3节(https://arxiv.org/html/2606.00334#S3.SS3.SSSx1)中的窗口方法后,每个模型变体的覆盖范围约为200万词元。
#### 解码策略
为了可重复性,我们全程采用确定性贪婪解码。禁用采样(温度 T=0T=0),并停用核/top-kk 控制。在存在随机性的地方,我们设置全局种子。解码在序列结束标记或达到最大长度时终止。我们通过抑制设置强制最小输出长度为120词元,并将生成上限设定为200词元。一个4-gram无重复约束以减轻退化循环。基础模型被视为纯下一个词元生成器,接收提示 rir_{i} 作为原始输入。指令模型通过一个最小包装器调用,包含标准化的系统消息(仅回复续写内容;不重复用户文本;无序言)。
#### 清洗与词性标注
我们分两阶段清洗所有流:(i) 确定性正则表达式通过,用于标准化空白并丢弃摘要结论后的文本;(ii) 基于LLM的通过,使用GPT-4o-mini(温度为0)去除AI人格标记(“Certainly, here is ...”)、对话脚手架(“”)、循环(保留一个副本)以及第一、二人称内容(“Can you explain the meaning of ...”)。清洗器被指示仅执行删除操作,不进行释义或重新排序原文(完整提示见第11节(https://arxiv.org/html/2606.00334#S11)仓库链接)。我们将此程序应用于所有流:人类黄金标准 {H}\{H\}、基础模型输出 {B}\{B\} 和指令模型输出 {I}\{I\}。为了将屈折形式(如“delves”、“delved”等作为动词“delve”)处理为单一词元,并区分同形异义词,我们使用spaCy 3.8(?)(模型:`en_core_web_trf`)对所有清洗文本进行词性(POS)标注。输出格式为CoNLL–U(?),包含来自通用依存框架(?)(UPOS)的POS标签。
### 3.3 评估指标流水线
我们使用处理后的数据流 S∈{H,B,I}S \in \{H,B,I\} 来定义三角化偏好偏移(TPS)指标,该指标对三个流进行三角化。该指标包含两个阶段,*估计*和*评分*,基于窗口文档流行度(第3.3节(https://arxiv.org/html/2606.00334#S3.SS3.SSSx1))。在估计阶段,我们计算所有词元类型的流行度估计并存储在查找表中。在评分阶段,我们使用该表来识别相对于基础模型和人类基线的指令阶段偏移。这使我们能够量化偏好学习引发的不对齐偏移(第3.3节(https://arxiv.org/html/2606.00334#S3.SS3.SSSx2)),既可以在细粒度词汇分辨率下进行,也可以在跨模型系列的全局比较中进行。
#### 窗口文档流行度
指标的可靠性取决于词元频率估计器的稳健性。简单的相对频率可能不稳定,因为重复出现集中在少数文档中会扭曲聚合统计量。为了减轻此效应并控制模型生成输出长度的变化,我们采用窗口文档流行度方法。对于每个提示 rir_{i},确定性地选择一个百分位偏移 πi∈(0,1)\pi_{i} \in (0,1),并一致应用于 HH–BB–II 三元组。然后在该百分位位置提取一个固定长度 KK 个词元的连续*窗口*。如果任何续写内容在对称清洗过程(第3.2节(https://arxiv.org/html/2606.00334#S3.SS2.SSSx3))后太短而无法支持完整窗口,则排除整个三元组。为了具体说明该程序,考虑以下示例(为清晰起见使用表面词而非词元化词元)。假设一个文档包含:
> This sentence contains five words. This sentence contains 5 words.
当 K=2K=2 时,有 5−2+1=45-2+1=4 个可能的连续窗口。如果该提示的百分位偏移为 πi=0.5\pi_{i}=0.5,将该值乘以可能窗口数得到起始位置索引 0.5×4=20.5 \times 4=2。注意,位置索引从第一个单词“This”开始从0计数(见句子下方的索引编号),因此该窗口包含索引2和3,对应于单词“contains”和“five”。提取的窗口如下:
> This sentence [contains five] words.
> 0 1 2 3 4
仅记录一个词元是否出现在此窗口内。在实践中,为了获得稳定的词元流行度估计,我们为每个提示 rir_{i} 的文档 ii 选择 M=4M=4 个分层窗口,起始索引为 π\pi。设 YiS,m(w)Y_{iS,m}(w) 为流 S∈{H,B,I}S \in \{H,B,I\} 中文档 ii 的第 mm 个窗口内词元 ww 的二元指示变量:
YiS,m(w)=1[w∈Window(S,πi,m,K)]Y_{iS,m}(w)=\mathbf{1}\bigl[\,w\in\text{Window}(S,\pi_{i,m},K)\,\bigr]
如果词元 ww 在流 SS 中提示 rir_{i} 的第 mm 个 KK-词元窗口内至少出现一次,则取值为 11,否则为 00。YiS,m(w)Y_{iS,m}(w) 仅记录词元在第 mm 个窗口内是否出现,从而防止重复局部使用主导信号。然后,文档 ii 中词元的存在性定义为这些 MM 个窗口的平均值 YiS(w)Y_{iS}(w),将 YiS(w)Y_{iS}(w) 对所有 RR 个文档聚合得到窗口化文档频率 cS(w)c_{S}(w):
YiS(w)=1M∑m=1MYiS,m(w)cS(w)=∑i=1RYiS(w)Y_{iS}(w)=\frac{1}{M}\sum_{m=1}^{M}Y_{iS,m}(w) \quad c_{S}(w)=\sum_{i=1}^{R}Y_{iS}(w)
最后,通过 Jeffreys 平滑(?),得到词元 ww 的窗口化流行度:
lS(w)=cS(w)+12R+1.l_{S}(w)=\frac{c_{S}(w)+\tfrac{1}{2}}{R+1}.
#### 指标定义
我们惩罚基础模型中已存在的偏移,并隔离指令/偏好学习中出现的变化。正 wTPS\mathrm{wTPS} 仅在指令使用超过人类基线和基础模型时发生,超越了预训练效应。使用平滑流行度,对于模型家族 MM,我们定义:
ΔIH(w)=lI(w)−lH(w)\Delta_{IH}(w)=l_{I}(w)-l_{H}(w)
ΔIB(w)=lI(w)−lB(w)\Delta_{IB}(w)=l_{I}(w)-l_{B}(w)
ΔBH(w)=lB(w)−lH(w)\Delta_{BH}(w)=l_{B}(w)-l_{H}(w)
词元类型级别的三角化偏好偏移为:
wTPSM(w)=min{ΔIH(w),ΔIB(w)}−max{0,ΔBH(w)}.\mathrm{wTPS}_{M}(w)=\min\{\Delta_{IH}(w),\Delta_{IB}(w)\}-\max\{0,\Delta_{BH}(w)\}.
这隔离了频率中独特地作为偏好学习阶段产物的“提升”,有效过滤掉不对齐词元,以识别特定阶段驱动的词汇过度使用驱动因素。为了对更大的单元 UU(如序列、文档或语料库)评分,我们计算 L2 均方根(RMS)得分,记为 uTPS(U;M)\mathrm{uTPS}(U;M):
uTPS(U;M)=(1|T(U)|∑t∈T(U)wTPSM(ω(t))2)1/2.\mathrm{uTPS}(U;M)=\left(\frac{1}{|T(U)|}\sum_{t\in T(U)}\mathrm{wTPS}_{M}(\omega(t))^{2}\right)^{1/2}.相似文章
大语言模型中词汇对齐与偏好阶段转变的全自动识别
本文提出了两种自动化指标:词汇对齐分数(Lexical Alignment Score)和三角化偏好转变(Triangulated Preference Shift),用于识别大语言模型中的词汇过度使用,并将其归因于偏好学习阶段。该方法在六个模型家族上使用PubMed摘要进行测试,无需人工干预即可重复先前的研究发现。
默认极化:LLM 内容策展中的推荐偏差审计
本文对 OpenAI、Anthropic 和 Google 的基于 LLM 的内容策展推荐偏差进行了大规模审计,使用了来自 Twitter/X、Bluesky 和 Reddit 数据的 540,000 次模拟选择。研究发现 LLM 系统性地放大极化现象,在毒性处理方面表现出不同的权衡,并显示出显著的政治倾向偏差,倾向于左倾作者,尽管数据集中右倾作者占多数。
RLearner-LLM:通过混合直接偏好优化平衡大语言模型的逻辑基础与流畅性
本文介绍了RLearner-LLM,一个使用混合直接偏好优化(Hybrid-DPO)的框架,旨在平衡LLM生成解释的逻辑正确性和流畅性。该框架在多个领域和基础模型上实现了显著的NLI蕴含改进,同时减轻了标准偏好信号中的冗长偏差。
MM-JudgeBias:评测 MLLM-as-a-Judge 组合偏差的基准
研究者发布 MM-JudgeBias 基准,揭示多模态大模型在充当自动评判器时的系统性组合偏差,对 26 个 SOTA MLLM 在 1,800 条样本上进行测试。
StylisticBias: 少数人类视觉线索主导多模态大语言模型中的大部分社会偏见
一个新的基准测试StylisticBias系统地评估了多模态大语言模型中的属性级社会偏见,发现时尚风格等少数视觉线索主导了大部分偏见。