等等,我是否公平?刻画演绎性刻板印象并用Fair-GCG加以缓解
摘要
本文识别出LLMs中的演绎性刻板印象,并提出了Fair-GCG,一个推理阶段注入框架,用于减轻公平任务中的偏见推理。
arXiv:2606.30989v1 Announce Type: new
摘要:警告:本文包含一些有毒和冒犯性陈述。虽然推理通常能提高近期大型语言模型(LLMs)的公平性,但失败情况仍然存在。在这项工作中,我们识别出一种失败模式——演绎性刻板印象,即模型将总体层面的统计规律应用于个体案例,产生逻辑上连贯但带有社会偏见的推理。我们提供了对这一现象的统计学解释。为了引导模型进行公平意识推理,我们提出了一个推理阶段注入框架。我们进一步引入Fair-GCG来系统性地发现有效的注入短语。Fair-GCG发现的注入短语在多个公平基准测试中提升了性能,从较小模型泛化到较大LLMs,提高了推理层面的公平性,减少了开放式生成中的偏见,并迁移到现实世界中公平敏感的任务。
查看缓存全文
缓存时间: 2026/07/01 05:31
# 等等,我公平吗?表征演绎刻板印象并用 Fair-GCG 加以缓解 来源:https://arxiv.org/abs/2606.30989 查看 PDF (https://arxiv.org/pdf/2606.30989) > 摘要:警告:本文包含若干有毒和冒犯性陈述。尽管推理通常能提升大型语言模型(LLM)的公平性,但失败情况仍存在。在本工作中,我们识别出一种失败模式——演绎刻板印象,即模型将群体层面的统计规律应用于个体案例,产生逻辑上一致但带有社会偏见的推论。我们对此现象提供了统计学解释。为了引导模型进行公平感知推理,我们提出了一种推理时注入框架。我们进一步引入 Fair-GCG 来系统性地发现有效的注入短语。Fair-GCG 发现的注入短语在多个公平性基准上提升了性能,从较小模型泛化到较大模型,改善了推理层面的公平性,减少了开放式生成中的偏见,并迁移到现实世界中公平敏感的任务中。 ## 提交历史 来自:Naihao Deng [查看邮件](https://arxiv.org/show-email/1edcc79b/2606.30989) **[v1]** 2026年6月30日 星期二 00:00:42 UTC (1,143 KB)
相似文章
通过将公平性视为对称操作来检测和缓解偏见
本文提出将公平性视为机器学习分类器中的对称操作,通过基于损失的规范化来实现在固定能力特征的同时,交换敏感属性时的不变性。该框架实现了超过90%的偏见减少,且准确率损失极小,无需因果图知识。
公平输出,偏见内部:大语言模型在高风险决策中潜在偏见的因果效力与非对称性
本文研究了指令微调的大语言模型如何在高风险决策(如抵押贷款承销)中表现出公平输出,同时保留有偏见的内部表征,表明这些隐藏偏见具有因果效力、非对称性,且可通过激活引导加以利用。
GoT-CD: Graph-of-Thoughts 因果发现与事后路径特定公平性审计的脆弱性
本文介绍了 GoT-CD,一种用于因果发现的 Graph-of-Thoughts 方法,它生成有效的 DAG,并表明尽管在结构上与 LLM 基线相当,但仅凭结构保真度并不能保证公平性忠实的路径特定审计,从而凸显了事后路径特定公平性审计的脆弱性。
反事实公平的图像分类器满足群体公平吗?——一项理论与实证研究
本文从理论和实证角度研究了图像分类中反事实公平(CF)与群体公平(GF)之间的关系,引入了新的CF评估数据集(CelebA-CF 和 LFW-CF)。研究发现,由于潜在属性与敏感属性相关,CF并不蕴含图像的GF,并提出了反事实知识蒸馏(CKD)以缓解这一问题。
大型语言模型中的解释公平性:关于LLM在不同人口群体中如何证明决策的实证分析
本文提出了“解释公平性分类法”(Explanation Fairness Taxonomy, EFT),以分析大型语言模型(LLM)在不同人口群体中证明决策时的差异,研究发现尽管决策本身保持平衡,但在解释的质量和语调上仍存在显著偏差。