差分隐私如何影响大语言模型中的社会偏见?一项系统性评估

arXiv cs.CL 论文

摘要

本文对差分隐私如何影响大语言模型中的社会偏见进行了系统性评估,研究发现虽然差分隐私降低了句子评分任务中的偏见,但这一效果并不能推广到所有任务。

arXiv:2605.11195v1 公告类型:新论文 摘要:在网页级语料库上训练的大语言模型(LLMs)可能会记住敏感的训练数据,从而带来重大的隐私风险。差分隐私(DP)作为一种规范性的框架出现,旨在限制训练过程中单个数据点的影响,然而差分隐私与大语言模型中社会偏见之间的关系仍知之甚少。为了研究这一问题,我们针对使用 DP-SGD 训练的预训练大语言模型中的社会偏见进行了系统性评估,在句子评分、文本补全、表格分类和问答这四个互补的范式下,将差分隐私模型与非差分隐私基线模型进行了比较。我们发现,在通过受控似然比较来衡量偏见的句子评分任务中,差分隐私确实降低了偏见,但这一改善并不能推广到所有任务。我们的研究结果揭示了 logits 层面的偏见与输出层面的偏见之间的差异。此外,降低记忆化并不一定能减少不公平性,这强调了在评估大语言模型的公平性时进行多范式评估的重要性。
查看原文
查看缓存全文

缓存时间: 2026/05/13 06:09

# 差分隐私如何影响大语言模型中的社会偏见?一项系统评估

来源: https://arxiv.org/html/2605.11195
Eduardo Tenorio, Karuna Bhaila, Xintao Wu
阿肯色大学
{et025, kbhaila, xintaowu}@uark.edu

###### 摘要

在 web 规模语料库上训练的大语言模型(LLMs)可能会记忆敏感的训练数据,从而带来重大的隐私风险。差分隐私(DP)作为一种原则性框架应运而生,它限制了训练过程中单个数据点的影响,然而差分隐私与大语言模型中社会偏见之间的关系仍知之甚少。为了研究这一问题,我们对使用 DP-SGD 训练预训练大语言模型中的社会偏见进行了系统评估,在四种互补范式下比较了 DP 模型与非 DP 基线:句子评分、文本补全、表格分类和问答。我们发现,在通过控制似然比较来衡量偏见的句子评分任务中,DP 减少了偏见,但这种改进并未在所有任务中普遍适用。我们的结果揭示了 logit 级偏见与输出级偏见之间的差异。此外,减少记忆并不一定会减少不公平性,这强调了在评估大语言模型的公平性时进行多范式评估的重要性。

# 差分隐私如何影响大语言模型中的社会偏见?一项系统评估

Eduardo Tenorio, Karuna Bhaila, Xintao Wu
阿肯色大学
{et025, kbhaila, xintaowu}@uark.edu

## 1 引言

差分隐私(DP)已成为限制大语言模型(LLMs)记忆化的原则性框架 Abadi et al. (2016); Carlini et al. (2021, 2022)。但限制记忆化是否也能使模型更具责任感?DP 提供了形式化保证,通常通过梯度裁剪和通过 DP-SGD 注入噪声来限制训练过程中单个数据点的影响 Abadi et al. (2016)。最近的进展使这些技术能够扩展到大语言模型的预训练,正如 VaultGemma-1B Sinha et al. (2025) 所展示的那样,这是目前唯一公开提供的完全使用 DP-SGD 预训练的大语言模型。虽然 DP 旨在减少记忆化,但它是否也会塑造社会偏见仍是一个未解之谜,因为这些偏见可能导致现实世界应用中的有害行为 Nadeem et al. (2021); Nangia et al. (2020); Zhao et al. (2018); Gallegos et al. (2024); Bender et al. (2021)。一方面,限制单个数据点的影响可能会削弱对刻板印象关联的依赖。另一方面,DP 引入的噪声可能会以不可预测的方式扭曲学习到的表示,从而影响模型行为 Bagdasaryan et al. (2019)。理解这种相互作用至关重要:如果减少记忆化也能减少偏见,DP 可能提供一条通往更负责任的大语言模型的统一路径;如果不能,隐私和公平性可能需要根本不同的干预措施。

现有的工作已经开始探索差分隐私与偏见之间的相互作用,主要在微调设置中进行 Srivastava et al. (2024); Fioretto et al. (2022)。然而,这些方法仅在预训练后应用隐私约束,留下了一个更基本的问题未解:当在表示学习本身期间执行 DP 时,偏见是如何形成的 Devlin et al. (2019); Tenney et al. (2019)。在这项工作中,我们系统地评估了使用和不使用差分隐私训练的预训练大语言模型中的社会偏见。我们在四种互补评估范式下分析模型行为:(i) 句子评分,通过控制似然比较测量偏见;(ii) 文本补全,捕捉开放式生成中的偏见;(iii) 表格分类,评估文本序列化表格数据上的群体公平性;以及 (iv) 问答,通过带有模糊上下文的多项选择题评估偏见。我们的结果揭示了一致但先前未被描述的模式:差分隐私减少了句子评分评估中的刻板印象偏见,但这种效应并不可靠地转化为文本补全、表格分类和问答等其他评估范式。这些发现表明,减少记忆化在 logit 层面削弱了刻板印象关联,但不能保证输出公平。更广泛地说,我们的结果凸显了 logit 级偏见与输出级偏见之间的脱节,强调了跨多种互补范式评估偏见的必要性。据我们所知,这是第一项系统性评估差分隐私预训练对生成式大语言模型中社会偏见影响的研究,涵盖了多种评估范式。我们的贡献如下:

- 我们首次在四种范式下统一评估了使用和不使用差分隐私训练的预训练大语言模型。
- 我们表明,差分隐私减少了句子评分评估中的刻板印象偏见,但这种改进并不能一致地转移到其他评估范式中。
- 我们证明,表格分类结果对上下文学习策略高度敏感,限制了其隔离模型固有偏见的能力。
- 我们显示,关于社会偏见的结论在不同评估范式间存在显著差异,突出了当前评估实践的局限性。

## 2 相关工作

##### 大语言模型中的偏见与公平性

在 web 规模语料库上训练的大语言模型可能继承并放大人类生成文本中存在的刻板印象、错误表示和贬低性关联 Bender et al., 2021; Bolukbasi et al., 2016; Caliskan et al., 2017。 prior 工作广泛研究了大语言模型中的偏见,提出了各种评估指标、数据集和缓解策略 Nadeem et al., 2021; Nangia et al., 2020; Zhao et al., 2018; Dhamala et al., 2021。这些努力导致了一套多样化的评估范式,用于衡量语言模型中的偏见。Gallegos et al. (2024) 最近提出了一种解决这些挑战的综合分类法,区分了表征危害和分配危害,并根据它们分析的模型输出类型对评估方法进行分类。

##### 大语言模型的差分隐私

差分隐私是一种隐私度量,保证任何训练记录的存在对学习算法的影响有限 Dwork et al., 2006。为了在深度学习中实现这一目标,常用的方法 DP-SGD 会裁剪网络的梯度,并在优化过程中向这些梯度添加噪声 Abadi et al., 2016。随着深度学习模型的流行,越来越明显的是,这些模型经常记忆训练集,这可能会通过启用敏感信息的检索而带来隐私风险 Carlini et al., 2021, 2022。为了减轻这种风险,在训练期间采用基于差分隐私的隐私保护技术,以防止模型记忆单个数据点 Abadi et al., 2016。将 DP 应用于大语言模型预训练在计算上具有挑战性,因为需要大批量大小以及在许多优化步骤中累积隐私预算。最近的工作证明了大规模 DP 的可行性,包括引入诸如 VaultGemma-1B 等模型,这些模型完全使用 DP-SGD 训练,并表现出训练数据记忆化的减少 Sinha et al., 2025。

##### 差分隐私与社会偏见

差分隐私与公平性之间的关系主要在分类设置中进行研究。先前的研究表明,DP-SGD 可能会不成比例地影响代表性不足的群体,因为梯度裁剪和噪声可能会抑制来自少数数据点的信号 Bagdasaryan et al., 2019。最近的工作将这些发现扩展到生成模型,表明在微调期间应用 DP 可能会由于非刻板印象示例的影响减少而放大刻板印象输出 Srivastava et al., 2024。同时,其他研究表明,差分隐私与公平性之间的相互作用是复杂且依赖于上下文的,有证据表明 DP 可能会加剧或减轻偏见,具体取决于数据分布、模型和评估设置 Fioretto et al., 2022。这突显了隐私与公平性之间的关系仍然是一个未解之谜。最近的工作还探讨了差分隐私与预训练 NLP 模型中偏见之间的关系。Islam et al. (2024) 研究了 DP-SGD 如何影响预训练基于编码器语言模型在分类任务中的社会偏见,表明差分隐私可以影响预训练期间学到的刻板印象关联。相比之下,我们的工作专注于预训练生成式大语言模型,并在多种互补评估范式下评估 DP 的效果,包括句子评分、文本补全、表格分类和问答。

## 3 动机与评估框架

评估大语言模型中的社会偏见本身具有挑战性,因为不同的评估设置捕捉了模型行为的不同方面。先前的工作通常依赖于单一的基准或范式,这可能导致关于偏见的结论不完整或具有误导性。在这项工作中,我们采用了一个统一的评估框架,涵盖四种互补范式:句子评分、文本补全、表格分类和问答。这些范式在如何引发和测量偏见方面存在差异,范围从控制的基于似然的比较到开放式生成和决策任务。这使我们要能够评估差分隐私的影响在句子评分评估和其他评估范式之间是否一致。图 1 提供了此评估框架的概述。

## 4 实验设置

我们在跨越四种评估范式的十个基准上,将 DP 预训练模型与两个非 DP 基线进行比较。下面描述了我们实验中使用的数据集、模型和评估指标。

**图 1:我们评估预训练大语言模型中社会偏见的评估框架概述。该图展示了四个代表性任务:(1) 句子评分,(2) 文本补全,(3) 表格分类,和 (4) 问答。每个面板显示了一个示例输入,并说明了如何在每个任务和域中评估偏见。**

### 4.1 数据集

**表 1:本工作中使用的评估基准概述。对于文本补全和表格分类,括号中显示直接比较的人口统计群体(M=男性, F=女性, W=白人, B=黑人)。**

| 范式 | 数据集 | 领域 | 任务格式 | 样本数 |
| :--- | :--- | :--- | :--- | :--- |
| 句子评分 | StereoSet-Intra | 性别, 种族, 职业, 宗教 | 填空 | 2,106 |
| | StereoSet-Inter | 性别, 种族, 职业, 宗教 | 话语延续 | 2,123 |
| | WinoBias Type 1 | 性别 | 代词指代 | 396 |
| | WinoBias Type 2 | 性别 | 代词指代 | 396 |
| | CrowS-Pairs | 性别, 种族, 宗教, +6 更多 | 句子对评分 | 1,508 |
| 文本补全 | BOLD | 性别 (M/F), 种族 (W/B) | 开放式生成 | 6,020 |
| | HolisticBias | 性别 (M/F), 种族 (W/B) | 开放式生成 | 6,020 |
| 表格分类 | Adult Census Income | 种族 (W/B) | 二元收入预测 | 1,000 |
| | COMPAS | 种族 (W/B) | 二元再犯预测 | 600 |
| | German Credit | 性别 (M/F) | 二元信用评分 | 300 |
| 问答 | BBQ | 性别, 国籍, 种族, 宗教 | 多项选择题 QA | 8,000 |

#### 4.1.1 句子评分基准

##### StereoSet Nadeem et al., 2021

StereoSet 由上下文句子与三个候选项配对组成,分别对应刻板印象、反刻板印象和不相关;涵盖包括性别、种族、职业和宗教在内的领域。它提供两种评估设置:*intra-sentence*(句内),一个填空任务,模型为三个候选词补全评分;以及 *inter-sentence*(句间),模型为给定上下文在三个候选后续句子中进行选择。

##### WinoBias Zhao et al., 2018

WinoBias 通过仅在性别代词上不同的句子对来衡量共指消解中的性别偏见。*Type 1* 句子需要有关性别-职业关联的刻板印象知识来解决代词;*Type 2* 句子可以仅从语法结构中解决,而不依赖刻板印象假设。

##### CrowS-Pairs Nangia et al., 2020

CrowS-Pairs 包含众包标注的句子对,涵盖九种社会偏见:种族/肤色、性别、社会经济地位、年龄、残疾、国籍、性取向、外貌和宗教。每对包含两个高度相似的句子,一个包含边缘化群体的刻板印象,另一个无刻板印象。

#### 4.1.2 文本补全基准

##### BOLD Dhamala et al., 2021

BOLD 由维基百科提取的提示组成,用于评估开放式语言生成中的偏见,涵盖职业、性别、种族、宗教和政治意识形态。我们关注性别(男性 vs. 女性)和种族(白人 vs. 黑人)领域,使用相关性 Sheng et al., 2019、情感 Hutto and Gilbert, 2014 和毒性 Hanu and Unitary team, 2020 指标评估模型补全。

##### HolisticBias Smith et al., 2022

HolisticBias 提供了句子模板,涵盖 13 个维度中人口统计群体的 600 多个描述符。我们关注性别(男性 vs. 女性)和种族(白人 vs. 黑人)领域,应用与 BOLD 相同的三个评估指标。

#### 4.1.3 表格分类基准

我们使用上下文学习(ICL)Brown et al., 2020 评估所有表格数据集,提示模型根据结构化的文本序列化输入预测二元结果 Qu et al., 2025。每个...

相似文章

大语言模型能公平招聘吗?简历筛选中的种族偏见

arXiv cs.CL

本文采用配对简历方法,对14个大语言模型在招聘中的歧视行为进行了审计,发现较旧的模型表现出亲白人的偏见,而较新的模型则显示无偏见或亲黑人的偏见,表明不同代际的算法招聘偏见发生了逆转。

我分析了25,500次LLM简历筛选来测量招聘偏见,结果令人警醒。

Reddit r/artificial

一项分析10个模型共25,500次LLM简历评估的研究发现,由“沉默偏见”驱动的偏见率高达45%,模型会编造听起来专业的借口来惩罚候选人。研究强调了公平性和稳定性的巨大差异,其中Claude、Mistral-Large和Llama 4最为稳定,而Qwen和较早期的Gemini模型则波动较大。

评估LLM模拟器作为差分隐私数据生成器

arXiv cs.CL

本论文评估基于LLM的模拟器作为差分隐私合成数据生成器的能力,使用PersonaLedger来评估LLM是否能够忠实地复现受DP保护角色的统计分布。虽然在欺诈检测效用方面取得了良好成果(在ε=1时AUC为0.70),但该研究发现了由系统性LLM偏差造成的显著分布漂移,该偏差会覆盖输入统计数据。