FairFund-Bench:评估LLM资源分配中的分配偏差

arXiv cs.CL 论文

摘要

介绍了FairFund-Bench,一个用于评估LLM资源分配中分配偏差的基准,表明审计格式会改变偏差的方向和幅度,且因果框架效应显著超过人口统计效应。

arXiv:2607.28934v1 公告类型:新 摘要:大型语言模型(LLM)越来越多地参与稀缺资源的分配,这引发了人们对其基于种族和性别等特征进行有偏分配的担忧。然而,最近的LLM审计结果并不一致,即使对于相同的模型,也发现了对女性和少数族裔既有正向歧视也有负向歧视的证据。我们表明,这种分歧可能源于审计格式的差异,并引入了FairFund-Bench,这是一个基准,系统性地变化了先前审计设计的关键特征:评估任务(评分、排名或分配)、比较情境(单一刺激或多重刺激),以及审计是透明的还是伪装的。该基准包含600个由人类编写的模板生成的财务援助请求(根据130万个真实GoFundMe活动进行校准),涵盖三个领域、四个种族类别和两个性别类别,以及五种源于福利应得性理论的因果需求框架。在14个模型中,审计格式改变了偏差的方向:模型在单独评分申请人时使少数族裔受益,但在并排排名时却会惩罚某些群体。偏差幅度虽然总体较小,但在伪装审计中比透明审计中高出数倍;在透明审计中,面对仅因申请人姓名不同而有所区别的求助请求,模型绝大多数情况下会平均分配资金。相比之下,因果框架效应比人口统计效应大约高出一个数量级,并且在不同模型和审计格式中保持一致,这表明当前的LLM能够稳健地再现人类的应得性评估。该基准在四个标准上对模型进行评分(人口统计偏差、应得性对齐、跨任务一致性和跨情境一致性),可公开获取,并可轻松适配到其他实质性领域。
查看原文
查看缓存全文

缓存时间: 2026/08/03 07:34

# FairFund-Bench:评估LLM资源分配中的分配偏差
来源:https://arxiv.org/html/2607.28934

###### 摘要

大型语言模型(LLMs)越来越多地参与稀缺资源的分配,引发了对基于种族和性别等先天特征进行有偏分配的担忧。然而,近期的LLM审计结果并不一致,即使对于相同的模型,也发现了对女性和少数族裔既存在正向歧视也存在负向歧视的证据。我们表明,这种分歧可能源于审计格式的差异,并引入FairFund-Bench——一个系统性变化先前审计设计关键特征的基准:评估任务(评分、排序或分配)、比较语境(单一或多刺激),以及审计是透明的还是伪装的。该基准包含600个由人工编写的模板生成的财务援助请求(根据130万真实GoFundMe活动进行校准),涵盖三个领域、四个种族类别和两个性别类别,以及源自福利应得性理论的五种需求因果框架。在14个模型中,审计格式改变了偏差的方向:模型在单独评分申请人时对少数族裔有利,但在并排排序时却会对某些群体进行惩罚。偏差幅度虽然总体较小,但在伪装审计中是透明审计的数倍;在面对仅因申请人姓名不同而有所差异的求助请求时,模型绝大多数情况下会平分资金。相比之下,因果框架效应比人口统计学效应大约高一个数量级,并且在不同模型和审计格式中保持一致,表明当前的LLM稳健地再现了人类的应得性评价。该基准在四个标准(人口统计学偏差、应得性对齐、跨任务一致性和跨语境一致性)上对模型进行评分,可公开获取,并可轻松适应其他实质性领域。

Martin Lukk  
University of Toronto  
[email protected]

## 1 引言

大型语言模型(LLMs)越来越多地被用于评估对稀缺资源的竞争性诉求。它们筛选求职申请[An et al.,2024](https://arxiv.org/html/2607.28934#bib.bib1);[Armstrong et al.,2024](https://arxiv.org/html/2607.28934#bib.bib3);[Nghiem et al.,2024](https://arxiv.org/html/2607.28934#bib.bib27),提供财务决策建议[Salinas et al.,2025](https://arxiv.org/html/2607.28934#bib.bib29),并且正被考虑部署到越来越多的关键场景中,包括贷款、住房和福利资格认定[Tamkin et al.,2023](https://arxiv.org/html/2607.28934#bib.bib31)。对这些模型日益增长的依赖引发了对其分配方式可能基于种族和性别等先天特征进行歧视的担忧,从而重现社会偏见并延续有害刻板印象[Gallegos et al.,2024](https://arxiv.org/html/2607.28934#bib.bib17);[Bender et al.,2021](https://arxiv.org/html/2607.28934#bib.bib8)。

参见图注  
图1:FairFund-Bench流水线。基准构建(左)将手写刺激材料(根据GoFundMe语料库校准)与经过验证的姓名相结合,并将其嵌入一个审计工具中,该工具涵盖三个任务(评分、排序、分配)、两种比较语境(单一或多刺激)和两种呈现模式(透明或伪装)。评估(中)将该工具应用于14个LLM。资金分析(右)将模型行为分解为四个支柱。

LLM在这些分配决策中是否存在偏见以及如何存在偏见仍存在争议。最近的评估通常基于对应审计方法[Gaddis,2018](https://arxiv.org/html/2607.28934#bib.bib15),产生了混杂且往往相互矛盾的结果。例如,Gaebler等人(2024)[Gaebler et al.,2024](https://arxiv.org/html/2607.28934#bib.bib16)报告称,在11个模型的就业评估中,存在对女性和少数族裔的正向歧视(即,相较于同等资质的白人候选人,更倾向于他们),而Salinas等人(2025)[Salinas et al.,2025](https://arxiv.org/html/2607.28934#bib.bib29)在类似的评估和重叠的模型集合上报告了对这些群体的负向歧视。即使是针对GPT-3.5的单模型分析[Armstrong et al.,2024](https://arxiv.org/html/2607.28934#bib.bib3);[Lippens,2024](https://arxiv.org/html/2607.28934#bib.bib23);[Nghiem et al.,2024](https://arxiv.org/html/2607.28934#bib.bib27)也得出了不同的结论,报告了既存在正向也存在负向歧视女性和少数族裔的证据。

是什么解释了这种分歧?我们认为,早期评估中相互矛盾的发现是先前未经检验的审计设计选择的结果。每项研究都规定了任务格式、提示结构和刺激呈现的特定组合,而没有考虑其对所观察到偏见的潜在影响。虽然一些研究确实检验了其发现对替代设计选择的稳健性[Nghiem et al.,2024](https://arxiv.org/html/2607.28934#bib.bib27);[Salinas et al.,2025](https://arxiv.org/html/2607.28934#bib.bib29);[Tamkin et al.,2023](https://arxiv.org/html/2607.28934#bib.bib31),但它们倾向于将任何敏感性归因于模型的特有属性(例如,[Gaebler et al.,2024](https://arxiv.org/html/2607.28934#bib.bib16)),而不是审计设计的可预见后果。最近的研究表明,模型查询方式的微小差异可能产生重大影响,有时甚至会反转对同一模型所估计的偏见方向[Bai et al.,2025](https://arxiv.org/html/2607.28934#bib.bib4);[An et al.,2024](https://arxiv.org/html/2607.28934#bib.bib1)。这表明,关于LLM偏见的不一致发现反映了设计空间内未经检验的方法论选择,而非模型本身的属性。

我们引入FairFund-Bench,这是第一个系统性变化这些设计选择的LLM偏见基准。该基准向14个领先的LLM呈现600个由手写模板生成的援助请求,涵盖四个种族类别和两个性别类别,通过经过验证的姓名来标识[Elder and Hayes,2023](https://arxiv.org/html/2607.28934#bib.bib13),以及源自福利应得性理论的五种财务需求因果框架[van Oorschot and Roosma,2017](https://arxiv.org/html/2607.28934#bib.bib34)。每项诉求在三种任务(评分、排序、美元分配)、两种比较语境(单一或多刺激)和两种刺激呈现模式(透明,强调人口统计学差异;或伪装,通过刺激多样性掩盖差异)下进行评估。模型在四个标准(人口统计学偏差、应得性对齐、跨任务一致性和跨语境一致性)上被评分,这些标准共同刻画了LLM如何做出分配决策。图1总结了基准流水线。

出现了几个关键发现。首先,审计格式改变了人口统计学偏差的方向:模型在单独评分少数族裔申请人时对其有利,但在并排排序时却会惩罚某些群体。其次,在美元分配方面,伪装的多刺激提示中的差异大约是透明提示中的3–4倍(种族方面为121美元 vs. 36美元)。第三,模型的分配遵循人类的应得性梯度,即外部原因导致的需求被认为比自身原因导致的需求更值得帮助;这种框架效应比同一任务上的人口统计学差异高出数倍到一个数量级。总体而言,这些发现凸显了关于当前LLM偏见的结论如何对审计设计的微小差异敏感。通过提供一个识别并系统性变化这些选择的框架,我们希望鼓励在未来的LLM偏见审计中更仔细地考虑可用的设计空间。FairFund-Bench在该空间上对模型的性能进行评分,并可轻松适应其他分配情境。代码和数据公开获取,网址为 https://github.com/martinlukk/fairfund-bench。

## 2 相关工作

表1:先前LLM偏见审计按诱发任务、提示结构、模型覆盖范围和所报告的人口统计学偏见进行组织。“Prompt”表示模型是一次评估一个申请人(单一刺激)还是在同一提示中同时评估多个申请人(多刺激)。“Finding”表示所报告的偏见:++ 有利于历史上被边缘化的群体,− − 有利于优势群体,0 表示无效结果,“mixed”表示方向因群体而异。

#### LLM偏见审计

对LLM分配决策中人口统计学偏差的评估产生了混杂且矛盾的结果,即使对于相同的模型也是如此(表1)。几项研究发现,在多个决策情境中,对女性候选人的单独评分或二元评估中存在有利于女性和少数族裔的偏见[Gaebler et al.,2024](https://arxiv.org/html/2607.28934#bib.bib16);[Tamkin et al.,2023](https://arxiv.org/html/2607.28934#bib.bib31)。与此同时,其他研究则在单一候选人情境中的相同任务上发现了对女性和少数族裔的负面歧视[An et al.,2024](https://arxiv.org/html/2607.28934#bib.bib1);[Armstrong et al.,2024](https://arxiv.org/html/2607.28934#bib.bib3);[Lippens,2024](https://arxiv.org/html/2607.28934#bib.bib23);[Salinas et al.,2025](https://arxiv.org/html/2607.28934#bib.bib29)。相比之下,An等人(2025)[An et al.,2025](https://arxiv.org/html/2607.28934#bib.bib2)在使用多候选人方法时报告了正的女性歧视和负的黑人男性歧视。同一模型出现矛盾结果的最清晰例子出现在Nghiem等人(2024)[Nghiem et al.,2024](https://arxiv.org/html/2607.28934#bib.bib27)的研究中,他们使用两种方法审计GPT-3.5和Llama-3-70B。当被提示从一组求职者中进行选择时,模型更喜欢女性名字的候选人。然而,当被提示给个别候选人分配工资时,模型给女性名字的候选人分配的平均工资低于同等资质的男性候选人。这种分歧可能完全是由所使用的不同分配任务驱动的,也可能是基于模型是使用单一还是多候选人提示进行评估。然而,之前没有审计在单一提示结构内改变诱发任务来识别这些设计选择的影响。此外,之前的审计未能考虑一些常见的现实世界评估任务,包括排序和分配美元金额。

#### 对齐与审计检测

有几个发现有助于解释为什么关于偏见的结论对审计设计敏感。首先,模型的公开和隐蔽偏见之间存在显著差距。Hofmann等人(2024)[Hofmann et al.,2024](https://arxiv.org/html/2607.28934#bib.bib21)发现,模型公开表达的对非裔美国人的积极态度,与当种族通过方言隐含传达时他们隐秘关联的高度消极态度之间存在巨大差异。此外,他们发现基于人类反馈的强化学习(RLHF;[Bai et al.,2022](https://arxiv.org/html/2607.28934#bib.bib5))似乎扩大了公开和隐蔽态度之间的差距。Bai等人(2025)[Bai et al.,2025](https://arxiv.org/html/2607.28934#bib.bib4)认为,相对(即多刺激)评估比绝对、单一刺激评估更适合评估内隐偏见,并且前者与模型决策的相关性更强。FairFund-Bench改变了审计设计的这一方面,因为相对和绝对评估应该呈现不同形式的偏见。其次,模型在检测到审计时会调整行为。Needham等人(2025)[Needham et al.,2025](https://arxiv.org/html/2607.28934#bib.bib26)发现模型表现出评估意识,这种意识似乎随着模型规模的增大而增强[Chaudhary et al.,2025](https://arxiv.org/html/2607.28934#bib.bib10)。Gao和Kreiss(2025)[Gao and Kreiss,2025](https://arxiv.org/html/2607.28934#bib.bib18)发现直接证据表明,与模型评估一致的提示会在性别表征偏见评估中引出更理想的反应。这些发现表明,对最小对(除人口统计学群体不同外其余相同的申请人提示)的模型评估将浮现出与对齐训练一致的去偏反应,而较不明显的、类似于部署情境中出现的提示则可以恢复对齐本应抑制的偏见模式。因此,FairFund-Bench同时包含透明和伪装的刺激呈现模式,并将刺激校准为类似现实世界的援助请求而不是评估工具。

#### 分配性伤害 vs. 表征性伤害

相关工作主张在模型评估中更加关注分配性偏见[Barocas et al.,2017](https://arxiv.org/html/2607.28934#bib.bib7);[Gallegos et al.,2024](https://arxiv.org/html/2607.28934#bib.bib17)。Blodgett等人(2020)[Blodgett et al.,2020](https://arxiv.org/html/2607.28934#bib.bib9)发现,NLP研究通常以评估分配性偏见(即资源或机会的不同分配)为动机,但在实践中却常常测量表征性偏见(即对群体的刻板印象或贬低态度)。已有的公平性基准,如BBQ[Parrish et al.,2022](https://arxiv.org/html/2607.28934#bib.bib28)、BOLD[Dhamala et al.,2021](https://arxiv.org/html/2607.28934#bib.bib12)和StereoSet[Nadeem et al.,2020](https://arxiv.org/html/2607.28934#bib.bib25),倾向于关注这种偏见。在LLM的背景下,对分配性偏见的评估确实存在,但强调根据能力规范评估就业结果(例如,[Gaebler et al.,2024](https://arxiv.org/html/2607.28934#bib.bib16);[Lippens,2024](https://arxiv.org/html/2607.28934#bib.bib23)),而忽略了其他重要的分配情境。FairFund-Bench在未被充分研究的财务援助请求情境中评估分配性偏见,并根据应得性规范进行评估,申请人同时竞争资金优先级和稀缺货币资源的份额,而不是二元接受/拒绝决策。这类请求很常见,普通人以及政府和机构代表都会定期评估[Lukk et al.,2025](https://arxiv.org/html/2607.28934#bib.bib24),反映了先前基准所遗漏的广泛分配情境。

#### 人类福利应得性启发式

福利和援助请求中的应得性规范一直是社会科学中长期关注的兴趣。van Oorschot(2000)[van Oorschot,2000](https://arxiv.org/html/2607.28934#bib.bib33)和van Oorschot与Roosma(2017)[van Oorschot and Roosma,2017](https://arxiv.org/html/2607.28934#bib.bib34)将跨国调查证据综合为西方公众判断福利申请人的五个维度(控制、态度、互惠、身份、需求;“CARIN”)。这些代表了人类判断的成熟模式,与认知心理学[Weiner,1985](https://arxiv.org/html/2607.28934#bib.bib36)、社会学[Lamont and Molnár,2002](https://arxiv.org/html/2607.28934#bib.bib22)以及某些伦理理论方法[Cohen,1989](https://arxiv.org/html/2607.28934#bib.bib11)的研究一致。它们也在慈善和公益语境中被广泛观察到[Schneiderhan and Lukk,2023](https://arxiv.org/html/2607.28934#bib.bib30)。FairFund-Bench直接以CARIN为基准对模型行为进行基准测试。对申请人需求因果框架的实验操纵对应于控制(Control,即困境是否由...

相似文章

基于认识论权利的LLM二阶偏见评估

arXiv cs.CL

本文介绍了“二阶偏见”,即LLM在判断有偏见内容时所表现出的偏见,并提出了一种基于认识论权利的推理任务来评估它。实验表明,该任务能够规避安全护栏,并揭示LLM评判者中系统性的群体偏见。

忠实还是虚构?LLM评审中合理化偏见的因果框架

arXiv cs.CL

本文提出了一个因果框架,用于量化LLM评审中的合理化偏见,即判决和解释受非证据性线索而非底层文本的影响。该框架提出了线索干预、锚定度量以及Proof-Before-Preference缓解协议,展示了改进的线索不变性。

金融服务业LLM评估的元基准

arXiv cs.AI

本文提出了一种元基准测试框架,将452个现有的公开基准测试整合为41个工作活动和38个银行业务领域,从而为金融机构实现更精确的LLM评估和治理。