基于参考的大型语言模型偏差检测:通过隐藏状态的相对表示

arXiv cs.AI 论文

摘要

本文提出了一种基于参考的方法,通过分析模型变体间隐藏状态的相对表示来检测大型语言模型中的偏差,引入了表示偏差偏移(ΔB),该偏移与输出层面的偏差变化高效相关。

arXiv:2609.10060v1 公告类型:新 摘要:现有的偏差审计方法通常依赖于模型输出,需要昂贵的基准或判断模型,并且可能错过从未在生成文本中出现的内部偏移。我们提出了一种基于参考的方法,通过审计相关模型变体(例如微调前后)的隐藏状态表示中的偏差。由于微调重塑了表示几何,绝对隐藏状态不可直接比较,因此我们通过每个句子与一组固定锚定句子的相似度来编码每个句子,从而在共享的比较空间中生成相对表示。在那里,我们测量目标群体在正负属性关联上的偏移,我们称之为表示偏差偏移 $\Delta B$。在三个模型家族和 WildGuardMix、DecodingTrust 以及 ToxiGen 基准测试中,$\Delta B$ 在我们测试的 18 个设置中有 15 个与输出层面的偏差变化相关,在完全微调下达到 $|r| = 0.84$ ($p < 0.001$),并在参数高效适应下变得更加依赖于模型。$\Delta B$ 的阈值化检测偏差增加的检查点,ROC AUC 在 $0.65$ 到 $0.99$ 之间,并且在 WildGuardMix 和 DecodingTrust 上,对于所有三个家族,它比基于 SEAT 的基线更好地分离这些检查点。$\Delta B$ 在锚定集、属性集和目标模板的变化下也保持稳定。我们的方法无需特定任务的评估数据,大约三分钟内即可审计一个模型,使用比此处考虑的输出层面基准少 $3$-$50\times$ 的计算。我们将其视为与基于输出的审计互补,而非替代。
查看原文
查看缓存全文

缓存时间: 2026/09/11 08:43

# 基于相对隐状态表示的LLM参考偏差检测  
来源:https://arxiv.org/html/2609.10060  
**Jan Dubiński**  
机构:NASK - 波兰国家研究所  
机构:华沙理工大学  
**Maciej Chrabąszcz**  
机构:NASK - 波兰国家研究所  
机构:华沙理工大学  
**Sebastian Cygert**  
机构:NASK - 波兰国家研究所  
机构:格但斯克理工大学  
通讯作者:[[email protected]](mailto:[email protected])  

###### 摘要  
现有的偏差审计方法通常依赖模型输出,需要昂贵的基准测试或裁判模型,并可能遗漏从未在生成文本中显现的内部偏移。我们提出一种基于参考的方法,用于审计相关模型变体(例如微调前后)在隐状态表示中的偏差。由于微调会重塑表示几何结构,绝对隐状态无法直接比较,因此我们通过每个句子与固定锚点句子集的相似度进行编码,从而在共享比较空间中生成相对表示。在此空间中,我们衡量目标群体与正面和负面属性的关联如何变化,我们称此量为表征偏差偏移$\Delta B$。在三个模型族和WildGuardMix、DecodingTrust及ToxiGen基准测试中,$\Delta B$在18个测试设置中的15个与输出级偏差变化相关,在完全微调下达到$|r|=0.84$($p<0.001$),在参数高效适应下则更依赖具体模型。通过设定$\Delta B$阈值,可检测偏差增加的检查点,其ROC AUC介于0.65至0.99之间;在WildGuardMix和DecodingTrust上,该方法在所有三个模型族中均优于基于SEAT的基线方法。$\Delta B$对锚点集、属性集和目标模板的变化也保持稳定。我们的方法无需特定任务的评估数据,约三分钟即可完成模型审计,计算量仅为本文所考虑输出级基准的1/33至1/50。我们认为它是对基于输出审计的补充,而非替代。我们已开源代码(https://github.com/NASK-AISafety/Reference-Based-Bias-Detection)。  
![图1:偏差评估流程概览](caption)  
我们使用相对表示,通过锚点句子将微调模型($\mathcal{M}_{\mathrm{aud}}$)和参考(基础)模型($\mathcal{M}_{\mathrm{ref}}$)的隐空间投影到共享空间。在该共享空间中,我们计算目标表示与正面和负面句子集之间的距离。通过比较这些距离($\Delta B$),例如无需策划数据集,通过判断$\mathcal{M}_{\mathrm{aud}}$是否比$\mathcal{M}_{\mathrm{ref}}$对目标群体表现出更大偏差,我们的方法可检测微调过程中可能引发的副作用。  

## 1 引言  
大语言模型正日益部署于塑造信息生成与解读方式的系统中。当它们通过指令调优、安全调优、领域微调和系统提示进行适配时,其行为可能发生难以预测和审计的变化。一个重要关切是偏差,因为模型可能从预训练数据或微调中继承有害关联,或因定向操纵而显现新的扭曲(Guo et al., 2025; Lu et al., 2025)。  
大多数偏差评估聚焦于模型输出。常用方法包括使用策划基准数据集(Liang et al., 2023; Wang et al., 2023)或LLM-as-a-judge评估(Lin et al., 2024)。这两者虽有用但存在局限:策划基准构建成本高且难以跨危害扩展,而基于裁判的评估可能继承评估者自身偏差(Lin et al., 2025)。更根本的是,基于输出的审计可能遗漏行为变化前出现的内部变化。  
基于近期发现——即使是良性微调也可能损害安全属性(Qi et al., 2024; Betley et al., 2025),我们认识到对齐可能以多种往往不可预测的方式退化,这使得标准行为评估极具挑战性。我们假设模型的隐表征包含指示这些非预期偏移的潜在信号。因此,本工作从内部表征视角研究微调后的行为变化。  
为此,我们扩展句子编码器关联测试(SEAT)(May et al., 2019),该方法测量文本表征中的偏差(Garg et al., 2018; Brunet et al., 2019),用于比较审计模型和参考模型的内部状态(见图1)。然而,直接比较这些内部状态很困难,因为微调重塑潜在几何结构,使得原始隐状态跨模型变体可比性差。  
我们通过使用隐状态的相对表征(Moschella et al., 2023)解决此问题。我们不通过嵌入向量编码句子,而是通过其与固定锚点句子集的相似度进行编码。这将审计和参考模型都映射到共享空间,从而实现直接比较。在该空间中,我们衡量目标概念相对于参考模型向正面或负面属性集偏移的程度,我们称之为表征偏差偏移$\Delta B$。  
我们的方法仅依赖于构建小型的锚点句、正面句和负面句集,这些比策划数据集容易获取得多,因此无需额外数据收集即可扩展到新目标群体。我们在Mistral、Llama和Gemma模型的完全微调和基于LoRA的微调所诱导的行为变化上评估该方法,使用源自先前工作的偏差基准(Han et al., 2024; Wang et al., 2023; Hartvigsen et al., 2022)。  
总体而言,$\Delta B$能跟踪输出级偏差变化,在完全微调下相关性高达$|r|=0.84$($p<0.001$)。虽然在LoRA下关系较弱且更依赖模型,但在大多数设置中仍显著。通过设定$\Delta B$阈值检测偏差增加的检查点,ROC AUC为0.65至0.99。在WildGuardMix和DecodingTrust上,我们的方法在所有三个模型族中始终比基于SEAT的基线更具区分度。广泛的消融实验进一步证明了其对锚点集、属性集和目标模板变化的稳健性。  
表征级指标不能保证预测下游行为(Goldfarb-Tarrant et al., 2021; Gonen and Goldberg, 2019)。因此我们不声称表征几何决定模型行为。我们提出一个更窄的实证问题:当微调改变模型的隐状态关联时,该偏移是否与外部基准测量的输出级偏差变化共变?在我们研究的多数设置中,实验给出了肯定答案,其中Gemma的关联最弱。  
本文贡献如下:  
- 我们引入一个基于参考的审计框架,通过相对隐表征将审计模型和参考模型置于共享比较空间,并定义表征偏差偏移$\Delta B$,用于衡量目标群体相对于参考模型与正面和负面属性关联的变化(第3.3节和3.4节)。  
- 我们在三个模型族和两种微调方案中,针对三个输出级基准验证$\Delta B$,使用渐进合并谱系逐步引入偏差而非单次跳跃。$\Delta B$在18个测试设置中的15个与输出级偏差共变($|r|$最高达0.84),并以0.65至0.99的ROC AUC标记偏差增加的检查点(表1,图2)。  
- 实验验证了相对表征相对于替代方法的有效性(图3),并表明$\Delta B$在锚点集、属性集和目标模板间保持稳定(第4.5节)。  

## 2 相关工作  
**LLM中的偏差**。LLM中的偏差指模型行为中有利于特定群体或观点、复现刻板印象,或基于训练数据中习得的无根据假设的系统性扭曲(Ferrara, 2023; Blodgett et al., 2020)。虽然偏差最常见于对某些社会群体产生负面影响的背景下研究(Beukeboom and Burgers, 2019),但语言模型也可能表现出政治偏差(Rettenberger et al., 2025)或反映地理与文化偏差(Tao et al., 2024)。另一条并行工作直接在表征空间中测量此类关联,始于词嵌入关联测试(WEAT)(Caliskan et al., 2017)以及词嵌入中性别方向的研究(Bolukbasi et al., 2016),May et al. (2019)将其从单词扩展到句子编码器。  

**LLM操纵**。随着LLM能力和影响力增长,它们日益易受对抗性滥用,包括媒体操纵(Lin et al., 2024; Lin et al., 2025; Lu et al., 2025)、政治宣传和隐蔽品牌推广(Guo et al., 2025)。失调也可能无意中产生,例如在有限数据上进行窄微调(Betley et al., 2025; Wang et al., 2025)。这推动了无需为每个新危害策划数据集即可检测行为偏移的方法。我们不直接研究对抗性攻击,而是通过在有害和良性数据微调的模型之间插值来引发不同严重程度的偏移,这为测试表征变化是否跟踪行为变化提供了受控环境。  

**机器学习模型比较**。我们方法的核心是测量机器学习模型间的相似性(Shah et al., 2023),通常依赖于表征(中间激活)或功能(输出)比较(Klabunde et al., 2025)。由于功能相似性需要策划评估数据集,我们提出一种使用句子嵌入评估表征变化的轻量级方法,如我们对大多数研究模型和基准所示,该方法与功能行为相关。  
跨模型比较表征首先需要使其空间可比,可通过拟合显式映射(如正交Procrustes变换)(Schönemann, 1966)或使用对齐不变的相似性度量(如中心核对齐CKA)(Kornblith et al., 2019)。我们基于相对表征(Moschella et al., 2023)进行扩展,该方法避免拟合任何跨模型映射,通过句子与共享锚点集的相似度进行编码,我们在第4节中与替代方法进行比较。  

**内在偏差与外在偏差**。偏差评估文献在内在和外在名称下作此区分(Goldfarb-Tarrant et al., 2021; Cao et al., 2022)。由于我们的框架是比较模型审计而非单模型偏差测量,我们全程使用表征与功能这对术语,但两种词汇指代相同的基本区别。两方面是否相互关联存在争议。  
Goldfarb-Tarrant et al. (2021)比较跨多个训练模型的嵌入空间指标与下游任务指标,发现没有在任务和语言间可靠成立的相关性。Gonen and Goldberg (2019)表明,根据指标自身定义,去偏词嵌入可能隐藏偏差,同时仍可恢复,相关表征的类似张力也有报道(Cao et al., 2022; Delobelle et al., 2022)。其他研究指向相反方向。上游偏差缓解迁移至下游微调模型(Jin et al., 2021),Orgad et al. (2022)发现基于内部表征计算的内在指标比嵌入空间WEAT更能忠实指示去偏。  
因此我们认为证据尚无定论,并注意到最强的负面结果来自静态词嵌入,这些是脱离任何特定模型的固定向量,而我们测量审计模型处理文本时实际计算的隐状态。我们的设置还不同在于我们不进行去偏,而是测量微调引发的偏移。  

## 3 方法  
我们通过测量一组中性目标句子(例如与社会群体相关的句子)在嵌入空间中与表达正面或负面效价的属性句子(例如“此人值得信赖”与“此人不可靠”)的对齐程度,量化大语言模型中的潜在偏差。除非另有说明,我们通过在$\mathcal{T}$中取句子平均值来汇总结果。第3.2节阐述绝对嵌入公式,第3.3节阐述其相对表征对应,第3.4节阐述与参考模型的比较以获得$\Delta B$。  

### 3.1 符号  
设$\mathcal{T}=\{s_1,\dots,s_{n_T}\}$表示目标句子集,$\mathcal{P}=\{p_1,\dots,p_{n_P}\}$表示正面属性句子集,$\mathcal{N}=\{n_1,\dots,n_{n_N}\}$表示负面属性句子集。对于模型$\mathcal{M}$,令$f_{\mathcal{M}}(s)$表示句子$s$的隐状态向量。我们使用余弦相似度$sim(u,v)=\frac{u\cdot v}{\|u\|\|v\|}$。

相似文章

LLM中的条件性认知偏差:有偏见的用户轮次如何调节上下文推理

arXiv cs.CL

本文引入了一个三条件实验框架和一个包含24,300个提示的基准,研究在多轮交互中,有偏见的用户轮次如何调节前沿LLM中的认知偏差表达。研究发现,在大多数模型中,有偏见的对话上下文会放大偏差,而明确的偏差线索可能触发与对齐相关的抑制行为。