大语言模型能公平招聘吗?简历筛选中的种族偏见

arXiv cs.CL 论文

摘要

本文采用配对简历方法,对14个大语言模型在招聘中的歧视行为进行了审计,发现较旧的模型表现出亲白人的偏见,而较新的模型则显示无偏见或亲黑人的偏见,表明不同代际的算法招聘偏见发生了逆转。

arXiv:2606.28978v1 Announce Type: new Abstract: 我们采用 Kline、Rose 和 Walters (2022) 的配对简历方法,对十四个主流大语言模型(LLMs)在招聘中的歧视行为进行了审计。唯一一个 2023 年版的模型再现了劳动力市场歧视实地实验中记录到的亲白人回调差距($+2.12$ 个百分点,在 $1\%$ 水平上显著)。每个在 2024 年或之后发布的模型要么显示无差距,要么显示显著亲黑人的逆转(高达 $-3.01$ 个百分点)。相同模式在性别维度上也成立。基于对 14 个模型每个进行 24,024 次配对发布的结果,我们的研究记录了跨代际算法招聘偏见方向的逆转。
查看原文
查看缓存全文

缓存时间: 2026/06/30 05:29

大型语言模型(LLMs)能否公正招聘?简历筛选中的种族偏见
来源:https://arxiv.org/html/2606.28978
作者:Zhenyu Gao, Wenxi Jiang, Yutong Yan(Gao, Jiang 和 Yan 任职于香港中文大学商学院金融系)。所有通讯请发送至 [email protected]。

(2026年6月)

###### 摘要

我们采用kline2022systemic的配对简历方法,对十四种主流大型语言模型(LLM)在招聘中的歧视问题进行了审核。唯一的2023年模型复现了劳动力市场歧视现场实验中记录的支持白人的回访差距(+2.12个百分点,在1%水平上显著)。2024年及之后发布的每个模型要么显示无显著差距,要么显示出显著的支持黑人的反转差距(最高达-3.01个百分点)。在性别维度上也观察到相同模式。基于每个模型24,024个配对职位发布(共14个模型)的数据,我们的结果记录了跨模型世代的算法招聘偏见方向的反转。

## 1 引言

随着大型语言模型(LLM)深入嵌入具有重大经济影响的决策中,它们是否延续或重塑现有的歧视模式,已成为研究者和监管者面临的重要问题。2026年6月,加州一位联邦法官裁定,Workday(其AI驱动的筛选软件被几乎所有《财富》500强公司使用)必须面对集体诉讼指控,该指控声称其算法歧视了黑人申请人、女性和年长工人(wiessner2026workday)。此案是首例广泛针对招聘中算法决策的此类案件,然而关于LLM是否以及如何产生歧视的实证证据基础仍然薄弱。我们通过开展大规模的配对简历审核(直接模仿10.1257/0002828042002561和kline2022systemic的影响深远的通信实验设计,覆盖了跨越三年发布的十四个LLM),为这一证据基础做出了贡献。

我们的设计遵循kline2022systemic的方法:我们构建了在除候选人姓名外的所有方面(教育背景、工作经历、年龄、性别)完全相同的候选档案对。姓名选自10.1257/0002828042002561建立并在kline2022systemic附录B中细化的具有显著黑人特征和显著白人特征的姓名列表。每个档案-职位对都呈现给LLM,并附带标准化的系统提示,指示其充当人力资源招聘经理,并仅用一个词“是”或“否”来回应,表明是否将该候选人推进到电话面试环节。温度参数设置为零,使每个决策具有确定性。我们在种族维度上为每个模型评分了24,024个配对职位,在性别维度上为每个模型评分了48,048个配对职位,这些数据来源于Revelio Labs数据库中的6,007个真实美国职位发布,并与kline2022systemic中的《财富》500强公司分布相匹配。

主要发现是一个符号反转。我们面板中的2023年模型,OpenAI的GPT-3.5-turbo,复现了劳动力市场歧视现场实验中记录的支持白人的回访差距:白人名字候选人的回访率比黑人名字候选人高2.12个百分点(在1%水平上显著,使用聚类稳健标准误)。这个幅度超过了kline2022systemic在其对108家《财富》500强公司的现场实验中报告的1.6个百分点的公司内差距。

然而,所有2024年及之后发布的模型要么显示出无显著差距,要么显示出统计上显著的**相反**方向差距,即支持黑人名字的候选人的幅度在0.4到3.0个百分点之间。这种模式并非局限于某个特定的提供商或模型家族:它出现在OpenAI、Anthropic、Meta、Google、xAI、DeepSeek、阿里巴巴和智谱的模型中,并且对基于职位发布层面的聚类自助法推断具有稳健性。

同样的反转在性别维度上也成立:GPT-3.5-turbo支持男性候选人的幅度为1.92个百分点(在1%水平上显著),而所有2024年及之后发布且完成性别数据采集的模型要么支持女性候选人的幅度在0.18到5.80个百分点之间,要么显示无显著差距。跨模型来看,种族和性别差距呈正相关:偏向白人名字的模型通常也偏向男性名字。

在模型家族内部,变化轨迹很有信息量。OpenAI自家的谱系最清晰地展示了这一弧线:GPT-3.5-turbo(2023年5月)强烈偏向白人和男性;GPT-4o-mini(2024年7月)显著偏向黑人;GPT-5.4-mini(2026年3月)在两个维度上均无显著差距。Meta的Llama家族显示出类似模式:Llama-3.1-8B-Instruct(2024年7月)在我们面板中展现出最强的支持黑人的差距(-3.01个百分点,在1%水平上显著),而更大的Llama-3.3-70B(2024年11月)在种族维度上无显著差距,但在性别维度上显著偏向女性。这些家族内部的轨迹表明,符号反转并非我们设计的偶然产物,而是反映了连续发布版本之间模型对齐方式的实际变化。

我们做出了三项贡献。首先,我们提供了首次系统性的多模型LLM招聘歧视审核,规模与确立人类基线的现场实验相当。我们的面板涵盖了种族维度的14个模型(每个模型24,024个配对职位)和性别维度的13个模型(每个模型48,048个配对职位),跨越从GPT-3.5到当前一代前沿模型的时期。其次,我们记录了跨模型世代算法歧视方向的性质转变,这与2023年和2024年模型在训练后对齐程序上的变化一致。第三,我们表明跨模型来看,种族和性别维度是相关的:偏向黑人名字的模型通常也偏向女性名字,而唯一偏向白人名字的模型也偏向男性名字。

#### 相关文献。

我们的工作处于劳动经济学通信审核文献与快速增长的大语言模型偏见研究文献的交汇点。我们依次讨论两者。

#### 通信审核。

配对简历方法由10.1257/0002828042002561开创,他们向波士顿和芝加哥的招聘广告发送虚构简历,发现白人名字获得的回访比黑人名字多50%,相当于在6.5%的回访率基础上约3.2个百分点的差距。kline2022systemic更新并扩展了这一设计,涉及108家《财富》500强公司,约83,000份申请,在控制了雇主-职业固定效应后,记录了持续存在的1.6个百分点的支持白人差距。我们的贡献是将这一成熟的方法论应用于基于LLM的筛选器,保持实验设计不变,同时用语言模型替代人类决策者。

#### 大语言模型偏见与公平性。

大量文献记录了语言模型输出在种族、性别、宗教和政治取向等维度上的偏见(参见blodgett-etal-2020-language;gallegos-etal-2024-bias的综述)。与我们的工作最密切相关的是,veldanda2023emily在少数模型上复制了10.1257/0002828042002561设计的部分要素,并未发现种族或性别上的显著偏见。他们方法的一个关键限制是使用了在不同候选人的教育、经验和技能方面各不相同的抓取简历,这使得难以将种族影响与候选人质量中的未观测异质性分离开。我们采用kline2022systemic的配对简历设计,通过保持每对中所有简历内容完全相同,仅变动候选人的姓名,从而消除了这一混淆因素。

#### 招聘中的人工智能与算法公平性。

更广泛地说,越来越多的文献研究了算法偏见在具有重大经济影响的决策中的作用。fuster2022predictably表明,信贷市场的机器学习模型可以提高预测准确性,但同时可能加剧种族群体之间的差异,因为更好预测带来的收益分配不均。我们的设定不同之处在于,招聘决策是二元的,并且我们记录的偏见方向跨模型世代发生了反转,但核心担忧是相同的:算法工具可能以难以预料的方式重塑经济机会的分配。AI工具在就业筛选中的使用已引起越来越多的监管关注。欧盟的《人工智能法案》将招聘中使用的AI系统归类为“高风险”,要求进行合规评估和持续监控。在美国,纽约市的第144号地方法律(2023年7月生效)要求对自动化就业决策工具进行偏见审核,而Workday诉讼是首个依据现有反歧视法规挑战此类工具的联邦集体诉讼。我们的结果直接针对这些监管努力的实证前提:我们表明,算法偏见的方向和幅度取决于部署了哪个模型、模型何时训练以及如何给予提示。

## 2 方法

### 2.1 实验设计

我们进行了一项配对通信审核,让大语言模型(LLM)为真实的职位发布评估虚构的候选人档案。设计尽可能遵循kline2022systemic,仅调整了LLM设置所必需的元素。本节描述数据构建、评分程序和统计框架。

#### 职位发布。

我们从Revelio Labs职位发布数据库中抽取了6,007个美国入门级职位发布,采样以匹配kline2022systemic中的《财富》500强公司分布。入门级状态通过对原始职位标题进行关键词过滤(例如,“分析员”、“助理”、“协调员”、“助理”)来确定。每条职位发布记录包括公司名称、职位名称、大都市区、州和发布日期。

#### 候选人档案。

对于每个职位发布,我们构建了四个独立的配对简历抽取(pair_id ∈ {0,1,2,3})。每对中生成两个候选人档案,他们在教育背景、工作经历、年龄和性别方面完全相同,仅在候选人的姓名上有所不同。姓名均匀地从10.1257/0002828042002561表A1-A2和kline2022systemic附录B表B1-B2中具有显著黑人特征和显著白人特征的姓名列表中抽取。教育资质(学校、学位、GPA)和工作经历(前雇主、职位名称、任期)按照kline2022systemic附录B中描述的简历构建程序生成,使用了与职位发布地理区域和行业相匹配的参考数据库中的学校和机构名称。在排除少量字段缺失的职位发布后,最终的种族审核样本包含来自6,006个唯一职位发布的24,024个完整的黑人对白人配对(48,048个档案-职位行)。

#### 性别扩展。

为了研究性别歧视,我们通过交叉种族和性别来扩展档案库,每对产生四种条件:黑人-男性、黑人-女性、白人-男性、白人-女性。性别对比在同一职位发布、同一pair_id和同一种族前缀内将男性与女性配对,产生24,024 × 2 = 48,048个性别配对(每个职位-对有两个,每个种族层一个)。姓名在每个种族类别内符合性别特征,遵循kline2022systemic附录B表B1中的性别化姓名列表。

### 2.2 大语言模型评分

#### 提示设计。

每个档案-职位对通过向LLM呈现两条消息的对话进行评分。系统消息如下:

> 你是一位正在筛选求职申请的人力资源招聘经理。给定一份职位发布和一份JSON格式的候选人档案,请决定是否将该候选人推进到回访环节(电话面试)。只用一个单词小写回应:‘是’(回访)或‘否’(不回访)。不要包含标点、解释或任何其他文字。

用户消息以标记化格式呈现职位发布字段(公司、职位、地点、发布日期),后跟作为JSON对象的候选人档案,最后以提示“请用一个词回答:是或否”结束。提示在所有模型和所有档案-职位对中保持不变。

#### 解码参数。

所有模型都在温度 T=0(贪心解码)下评分,产生确定性输出。对于非推理模型,我们设置 max_tokens=200。对于推理类模型(GPT-5.x系列),我们通过提供商的API抑制隐藏的思维链推理,并设置 max_tokens=16(API在禁用推理时允许的最小值)。解析输出文本中首次出现的“是”或“否”;不包含任一令牌的行记录为失败并从分析中排除。

#### 模型面板。

我们的面板包含十四个模型,发布日期从2023年5月到2026年4月。面板包括来自八个提供商(OpenAI、Anthropic、Meta、Google、xAI、DeepSeek、阿里巴巴/通义千问、智谱/GLM)的模型,参数规模从8B到397B不等。模型通过Together AI、OpenRouter和AWS Bedrock推理API访问。每个模型独立地对完整的48,048条种族维度的行(24,024对)和96,096条性别维度的行(48,048对)进行评分。

### 2.3 统计框架

#### 回访差距。

对于每个模型,我们按种族计算回访率:P̂(是|r) = N_r^(-1) Σ_{i=1}^{N_r} y_{ir},其中 y_{ir} ∈ {0,1} 是种族为 r ∈ {黑人, 白人} 的档案 i 的回访决策。种族差距(百分点)为:

Δ_种族 = [P̂(是|白人) − P̂(是|黑人)] × 100。 (1)

正的 Δ_种族 表示支持白人的歧视;负值表示支持黑人的歧视。性别差距 Δ_性别 类似地定义为 [P̂(是|男性) − P̂(是|女性)] × 100,其中配对在职位发布 × pair_id × 种族前缀内形成。

#### McNemar检验。

由于我们的档案在职位发布内配对,只有不一致的配对(即两个档案获得不同决策的配对)包含关于差距的信息。设 b 表示优势群体档案获得“是”而另一档案获得“否”的配对数量(例如,在种族维度上,白人-是、黑人-否),设 c 表示相反情况。使用连续性校正的McNemar双侧检验统计量为:

χ² = (|b − c| − 1)² / (b + c), (2)

在零假设 b = c 下,该统计量服从自由度为1的卡方分布。我们报告在 p < 0.05(*)、p < 0.01(**)和 p < 0.001(***)水平上的显著性。

#### 聚类稳健推断。

由于每个职位发布贡献四个 pair_id,职位发布内的观测值不是独立的。我们通过两种方式处理这一点。首先,我们通过职位发布层面的聚类自助法计算95%置信区间:我们对6,006个职位发布聚类进行有放回的重采样(2,000次),计算每个自助样本上的差距,并报告第2.5和第97.5百分位数。其次,我们通过将每个职位发布的对内平均差视为单个观测值来计算聚类稳健标准误,得到自由度为 G−1 = 6,005 的 t 统计量。在实践中,聚类稳健推断相比未调整的McNemar检验未改变任何定性结论:所有在

相似文章

我分析了25,500次LLM简历筛选来测量招聘偏见,结果令人警醒。

Reddit r/artificial

一项分析10个模型共25,500次LLM简历评估的研究发现,由“沉默偏见”驱动的偏见率高达45%,模型会编造听起来专业的借口来惩罚候选人。研究强调了公平性和稳定性的巨大差异,其中Claude、Mistral-Large和Llama 4最为稳定,而Qwen和较早期的Gemini模型则波动较大。

将LLM性别偏见锚定于人类基线:一项跨语言审计

arXiv cs.CL

本文对六种大型语言模型在英语、韩语、中文和日语中的性别刻板印象进行审计,并以人类基线作为锚定。研究发现,LLM的刻板印象程度往往超过人类跨国差异,且可能跨语言叠加,为此引入了一个四模式框架来表征此类行为。