立场:生成模型中的公平性失败是一个评估问题
摘要
这篇立场论文认为,生成模型中的公平性失败主要源于评估问题,并提出了Fairness Cards作为标准化报告工具,以提升可重复性和问责制。
arXiv:2608.16974v1 公告类型:新
摘要:尽管过去十年生成模型取得了突破性进展,但对其缺乏公平性、加剧社会不平等并损害边缘群体的担忧仍未得到充分解决,且难以采取行动。本文认为,尽管生成模型的公平性失败由多种因素驱动,但最终源于评估问题:公平性研究结果很少在不同论文间可比较,或可操作化用于部署决策。本文诊断了当前实践中反复出现的经验性和概念性失败模式,并推动从临时性偏见检查转向标准化的、针对生成模型的评估。我们提出Fairness Cards作为一种最小化的报告工具,明确评估选择(提示族、反事实协议、指标和拒绝处理),以实现可重复性、可比性和问责制。我们最后提出了进一步的建议,以推动评估标准的范式转变。我们的项目页面可在 https://mariiavladimirova.github.io/fairness-cards 找到。
查看缓存全文
缓存时间: 2026/08/19 10:19
# 立场:生成式模型中的公平性失效是一个评估问题 来源:https://arxiv.org/html/2608.16974 **Mariia Vladimirova** 隶属机构:Criteo AI Lab,巴黎,法国 隶属机构:FairPlay联合团队,巴黎,法国 通讯作者:[[email protected]](mailto:[email protected]) **Thibaut Issenhuth** 隶属机构:Criteo AI Lab,巴黎,法国 --- ###### 摘要 尽管过去十年生成式模型取得了突破性进展,但关于其缺乏公平性、强化社会不平等并损害边缘化群体的担忧仍未得到充分解决,且难以有效应对。本文认为,生成式模型中的公平性失效虽由多重因素驱动,但*最终源于一个评估问题*:公平性研究结果在不同论文间极少可比,也难以为部署决策提供有效指导。本文剖析了当前实践中反复出现的经验与概念性失效模式,并推动从临时性偏差检查转向标准化的、针对生成式模型的评估体系。我们提出*公平性卡片*作为一种最小化的报告工具,旨在使评估选择(提示词族、反事实协议、评估指标及拒绝处理方式)明确化,从而实现可重复性、可比性与可问责性。最后,我们提出了推动评估标准范式转变的额外建议。项目主页可访问:https://mariiavladimirova.github.io/fairness-cards。 **关键词**:公平性、生成式人工智能、评估、大语言模型、公平性卡片、审计 --- **图1**:同一模型因评估协议不同而得出相反的公平性结论。 Qwen2.5-7B-Instruct在控制审计网格(4个人口统计切片×4种职业×5种改写方式×2种解码机制×5个随机种子×4种提示词族;完整网格及评分标准见附录B)上的表现。切片为四个交叉组{男性,女性}×{基督教徒,穆斯林}。四种提示词族分别为:F1(求职者描述)、F2(故事续写)、F3(工作场所事件简报)、F4(人力资源备忘录)。两面板中的虚线标记了典型审计规则可能触发的5%阈值。 左图:按指标汇总的四个提示词族的人口统计切片最大-最小差异。所有差异均处于或低于5%阈值,最高为职位提及率上的六个百分点。 右图:按提示词族细分后,在F2下最差切片的刻板印象关键词率在*所有*切片上均超过5%阈值,而在F4下则*无一切片*超过;F1和F3介于两者之间。若评估者孤立选择某一种提示词族,可能发布“所有切片均触发警告”或“无一切片触发警告”的结论,而两者在各自的技术框架下均正确。审计结论由评估者的提示词选择决定,而非模型本身。 --- ## 1 引言 越来越多的研究记录了最先进生成式系统中的公平性失效问题([22](https://arxiv.org/html/2608.16974#bib.bib13);[1](https://arxiv.org/html/2608.16974#bib.bib14);[23](https://arxiv.org/html/2608.16974#bib.bib15);[63](https://arxiv.org/html/2608.16974#bib.bib16);[75](https://arxiv.org/html/2608.16974#bib.bib17);[39](https://arxiv.org/html/2608.16974#bib.bib25))。在生成式场景中,公平性问题超越了决策错误,涉及开放内容和访问权(例如拒绝和回避)。由于输出不受限且依赖上下文,偏见可能通过表征、刻板印象以及信息或创意内容的不同可用性显现。因此,各国政府和监管机构([71](https://arxiv.org/html/2608.16974#bib.bib12);[17](https://arxiv.org/html/2608.16974#bib.bib29))已实施人工智能公平性标准,推动了该领域的研究。然而,尽管近期研究提出了检测和缓解生成式模型偏见的方法([80](https://arxiv.org/html/2608.16974#bib.bib20);[22](https://arxiv.org/html/2608.16974#bib.bib13);[69](https://arxiv.org/html/2608.16974#bib.bib32);[70](https://arxiv.org/html/2608.16974#bib.bib33)),但在实践中,公平性结果往往难以复现、比较或应用,因为它们强烈依赖于*如何*评估模型。关于提示词模板、改写方式、解码/采样设置、随机种子和后处理的小幅选择可能实质性地改变测量的统计偏差和刻板印象得分([68](https://arxiv.org/html/2608.16974#bib.bib36);[82](https://arxiv.org/html/2608.16974#bib.bib59))。这也意味着两个公平性结果可能同时正确但在科学上不兼容。现代部署系统进一步加剧了这种不稳定性:安全层和拒绝策略改变了谁能访问内容,这意味着公平性部分是服务系统及其防护措施的属性,而不仅仅是基础模型([48](https://arxiv.org/html/2608.16974#bib.bib63);[32](https://arxiv.org/html/2608.16974#bib.bib60))。最后,公平性结果对所选指标和标注流水线敏感,包括主观人工标注和不完美的自动评分器([66](https://arxiv.org/html/2608.16974#bib.bib22);[63](https://arxiv.org/html/2608.16974#bib.bib16))。 这些评估不稳定性有助于解释为何公平性常被视为正交约束,而非与生成质量、效率或真实性同等重要的设计目标([68](https://arxiv.org/html/2608.16974#bib.bib36);[2](https://arxiv.org/html/2608.16974#bib.bib44);[76](https://arxiv.org/html/2608.16974#bib.bib1))。为超越临时性偏差检查,必须将公平性视为生成系统的一个关键性能维度,并整合到整个模型生命周期中。然而,实现这一点需要足够明确的评估实践来支持跨论文、版本和部署的比较;否则,难以认可进展、诊断权衡或制定部署决策。只要公平性评估仍缺乏明确规范,该领域就无法可靠判断声称的改进是真正提升了公平性,还是仅仅改变了提示词/指标,或将危害转移到了其他地方。 本文认为,生成式模型中的公平性失效持续存在,主要不是由于缺乏缓解措施,而是因为当前评估实践阻碍了累积性、决策相关证据的产生。特别是,生成式模型的公平性证据系统性地非累积,因为它主要受制于(i)提示词族和生成设置,(ii)系统层行为如拒绝机制,以及(iii)评分和标注流水线。 **改变我们看法的条件**:如果大规模研究显示公平性结论在不同提示词族/解码选择间稳定,拒绝行为未引入系统性访问差异,且评分流水线在合理替代方案下产生一致排名,那么针对公平性的专门披露标准将不那么紧迫。 **概述**:第2节(https://arxiv.org/html/2608.16974#S2)诊断了当前评估实践如何阻碍实质性进展,详细说明了反复出现的经验和结构性障碍。第3节(https://arxiv.org/html/2608.16974#S3)通过识别生成模型公平性评估中的核心失效模式扩展了这一诊断,展示了协议依赖性、安全层效应、反事实不一致性、指标不稳定性和模态转换如何损害可靠性。第4节(https://arxiv.org/html/2608.16974#S4)提供了说明性证据,展示同一模型在不同评估机制下如何得出不同的公平性结论。第5节(https://arxiv.org/html/2608.16974#S5)随后引入公平性卡片作为最小化的生成式专用报告标准,旨在实现可审计、明确且可重复的评估假设。第6节(https://arxiv.org/html/2608.16974#S6)探讨了替代观点,解释了为什么仅改进数据、训练或治理无法替代标准化评估。我们在第7节(https://arxiv.org/html/2608.16974#S7)总结并提出建议,旨在重塑评估标准,使公平性证据在不同模型、版本和部署间可比。 --- ## 2 评估是生成式人工智能公平性进展的核心障碍 当前的公平性方法在实践中很少带来可靠改进。关注度与进展之间的这种不匹配表明,当前的研究轨迹是不够的。我们认为关键障碍在于评估不足。 ### 2.1 当前实践的失败 现有公平性方法常常未能解决现实世界的偏见,即使部署在知名模型中也是如此。它们脆弱、不可泛化,且常与性能权衡。更糟的是,当缺乏上下文或语义依据时应用,它们可能引入新的危害。 #### 有效性有限:尽管使用了缓解措施,偏见依然存在 跨模态审计反复发现,尽管广泛使用缓解技术(数据过滤/平衡、正则化、提示工程、基于人类反馈的强化学习和后处理),现代生成系统仍然复制了表征和刻板印象危害([39](https://arxiv.org/html/2608.16974#bib.bib25);[73](https://arxiv.org/html/2608.16974#bib.bib37);[77](https://arxiv.org/html/2608.16974#bib.bib41);[76](https://arxiv.org/html/2608.16974#bib.bib1))。我们在实验中证实了这一点:我们提供了两个小型控制探针(Stable Diffusion图像生成;Mistral Le Chat角色分配提示词)以说明(i)测量的偏差可能很大,且(ii)即使输出包含免责声明,模型行为仍可能保持刻板印象一致性。完整提示词、定性示例和重复实验见附录A。 #### 与模型效用和表达能力的权衡 公平性干预可能与效用、保真度和可控性相权衡,这创造了优先考虑质量、表达能力和用户满意度而非公平性的动机,尤其是在公平性不是主要评估目标时([67](https://arxiv.org/html/2608.16974#bib.bib42);[72](https://arxiv.org/html/2608.16974#bib.bib21);[78](https://arxiv.org/html/2608.16974#bib.bib19);[81](https://arxiv.org/html/2608.16974#bib.bib46);[33](https://arxiv.org/html/2608.16974#bib.bib47))。 #### 引入新偏见或过度矫正 某些缓解策略可能转移危害而非减少危害(例如,从有偏见内容转向拒绝/回避),或在生成中引入不连贯和上下文错配,从而损害信任并使评估复杂化([39](https://arxiv.org/html/2608.16974#bib.bib25);[31](https://arxiv.org/html/2608.16974#bib.bib50);[30](https://arxiv.org/html/2608.16974#bib.bib51))。如果没有标准化报告聚合偏差分数以及获得这些分数的评估表面(提示词、解码、拒绝处理),这些权衡是不可见的。因此,偏差不仅仅是疏忽的结果,也是现有策略有效性有限的结果。尽管存在这些明显缺陷,用于解决它们的文档和研究工作仍然有限。 ### 2.2 公平性文档记录不足 文档工具提高了机器学习系统的透明度和可问责性,特别是模型卡([43](https://arxiv.org/html/2608.16974#bib.bib34))、数据集说明([19](https://arxiv.org/html/2608.16974#bib.bib61))、数据声明([7](https://arxiv.org/html/2608.16974#bib.bib64))、数据集营养标签([25](https://arxiv.org/html/2608.16974#bib.bib65))、数据卡片([54](https://arxiv.org/html/2608.16974#bib.bib67))以及AI事实表([3](https://arxiv.org/html/2608.16974#bib.bib66)),以及更广泛的基础模型报告提案([10](https://arxiv.org/html/2608.16974#bib.bib62);[48](https://arxiv.org/html/2608.16974#bib.bib63))。然而,当应用于*生成式*系统时,这些工具往往无法使公平性评估具有累积性,因为它们未能充分明确评估协议。因此,现有文档对于生成式模型的公平性是不够的。 #### 公平性披露是可选且不可比的 公平性通常以简短的定性讨论或少量临时基准数字呈现,使得跨模型比较和纵向追踪变得困难([43](https://arxiv.org/html/2608.16974#bib.bib34);[19](https://arxiv.org/html/2608.16974#bib.bib61);[3](https://arxiv.org/html/2608.16974#bib.bib66))。 #### 模型级摘要遗漏了提示词和上下文依赖性 在生成式人工智能中,危害随提示词族、解码/采样设置、安全过滤器和用户群体急剧变化;模型级平均值可能掩盖严重的切片特定故障([68](https://arxiv.org/html/2608.16974#bib.bib36);[39](https://arxiv.org/html/2608.16974#bib.bib25);[82](https://arxiv.org/html/2608.16974#bib.bib59))。 #### 缺失反事实、交叉性和拒绝报告 文档很少要求(i)反事实提示词套件,(ii)交叉切片分析,或(iii)拒绝/回避差异(“访问公平性”),尽管有证据表明安全层和拒绝机制实质性地影响了谁能获取信息、表达声音或获得表征([24](https://arxiv.org/html/2608.16974#bib.bib49);[32](https://arxiv.org/html/2608.16974#bib.bib60))。 #### 来自近期技术报告的例证 近期的技术报告和模型卡越来越多地承认偏见,但它们提供的证据往往难以跨系统比较,因为评估协议不够明确且范围有限。例如,Mixtral技术报告([28](https://arxiv.org/html/2608.16974#bib.bib2))使用BBQ([51](https://arxiv.org/html/2608.16974#bib.bib3))和BOLD([13](https://arxiv.org/html/2608.16974#bib.bib8))数据集报告偏差相关测量,GPT-5技术报告([64](https://arxiv.org/html/2608.16974#bib.bib7))提到了在BBQ上的评估。其他文档则突出安全性和审查流程(例如,Gemini 3 Pro模型卡([20](https://arxiv.org/html/2608.16974#bib.bib4)));或围绕安全风险提出缓解叙事(例如,Llama 3([21](https://arxiv.org/html/2608.16974#bib.bib5)))。一些公开报告几乎未明确讨论潜在偏见(例如,DeepSeek 3([38](https://arxiv.org/html/2608.16974#bib.bib6)))。这种模式反映了*提及或讨论*偏见与提供*可审计、可比较的*公平性证据之间的差距。 #### 与先前文档框架的定位比较 纵观模型卡([43](https://arxiv.org/html/2608.16974#bib.bib34))、数据集说明([19](https://arxiv.org/html/2608.16974#bib.bib61))、数据声明([7](https://arxiv.org/html/2608.16974#bib.bib64))、AI事实表([3](https://arxiv.org/html/2608.16974#bib.bib66))和可重复性检查清单([52](https://arxiv.org/html/2608.16974#bib.bib70)),文档的主要对象是模型、数据集、治理流程或实验设置。子组报告和训练时透明度受到鼓励,但生成系统特有的评估表面——提示词族依赖性、解码和种子敏感性、评分器流水线、拒绝策略以及基础模型与服务系统之间的差距——未在任何系统性方式中得到解决。公平性卡片扩展了这一系列工作,将评估程序本身作为一级披露对象,与数据集和训练文档并列,要求明确报告提示词协议、切片定义、拒绝处理、评分器选择、稳健性检查和版本控制。与先前框架的逐维度比较见附录D。
相似文章
公平崩溃现象:基于合成数据训练的语言模型中的偏见放大
本文介绍了“公平崩溃”现象,表明在标准模型崩溃指标恶化之前,在合成数据上训练语言模型会悄悄放大社会偏见,凸显了人工智能公平性面临的关键风险。
FID 彩票:量化生成模型评估中的隐藏随机性
本文分析了不同训练种子和采样种子下FID分数的方差,揭示了图像生成评估中显著的可重复性问题。它提出了一种新的评估协议,包括误差带和每单元最优引导调整。
有基准却无度量——生成式人工智能应以现实效用为评估标准
本文主张生成式人工智能的评估应从静态基准转向衡量现实效用和人类成果。文章提出了 SCU-GenEval 框架及辅助工具,旨在解决基准表现与部署成功之间的脱节问题。
算法公平性的统计与结构性方法
本博士论文批判了当前机器学习中的公平性度量方法,并提出统计假设检验和结构性分析来解决偏差问题,重点关注网络和层级上下文。
公平模型是否进行公平推理?信用决策中程序公平的反事实解释一致性
本文引入了反事实解释一致性(CEC)框架,通过对齐个体与其反事实对应物之间的特征归因,检测并缓解结果公平模型中的隐藏程序偏差,并在信用和收入数据集上进行了实验。