等等,我是否公平?刻画演绎性刻板印象并用Fair-GCG加以缓解

arXiv cs.CL 论文

摘要

本文识别出LLMs中的演绎性刻板印象,并提出了Fair-GCG,一个推理阶段注入框架,用于减轻公平任务中的偏见推理。

arXiv:2606.30989v1 Announce Type: new 摘要:警告:本文包含一些有毒和冒犯性陈述。虽然推理通常能提高近期大型语言模型(LLMs)的公平性,但失败情况仍然存在。在这项工作中,我们识别出一种失败模式——演绎性刻板印象,即模型将总体层面的统计规律应用于个体案例,产生逻辑上连贯但带有社会偏见的推理。我们提供了对这一现象的统计学解释。为了引导模型进行公平意识推理,我们提出了一个推理阶段注入框架。我们进一步引入Fair-GCG来系统性地发现有效的注入短语。Fair-GCG发现的注入短语在多个公平基准测试中提升了性能,从较小模型泛化到较大LLMs,提高了推理层面的公平性,减少了开放式生成中的偏见,并迁移到现实世界中公平敏感的任务。
查看原文
查看缓存全文

缓存时间: 2026/07/01 05:31

# 等等,我公平吗?表征演绎刻板印象并用 Fair-GCG 加以缓解
来源:https://arxiv.org/abs/2606.30989
查看 PDF (https://arxiv.org/pdf/2606.30989)

> 摘要:警告:本文包含若干有毒和冒犯性陈述。尽管推理通常能提升大型语言模型(LLM)的公平性,但失败情况仍存在。在本工作中,我们识别出一种失败模式——演绎刻板印象,即模型将群体层面的统计规律应用于个体案例,产生逻辑上一致但带有社会偏见的推论。我们对此现象提供了统计学解释。为了引导模型进行公平感知推理,我们提出了一种推理时注入框架。我们进一步引入 Fair-GCG 来系统性地发现有效的注入短语。Fair-GCG 发现的注入短语在多个公平性基准上提升了性能,从较小模型泛化到较大模型,改善了推理层面的公平性,减少了开放式生成中的偏见,并迁移到现实世界中公平敏感的任务中。

## 提交历史

来自:Naihao Deng [查看邮件](https://arxiv.org/show-email/1edcc79b/2606.30989) **[v1]** 2026年6月30日 星期二 00:00:42 UTC (1,143 KB)

相似文章

通过将公平性视为对称操作来检测和缓解偏见

arXiv cs.AI

本文提出将公平性视为机器学习分类器中的对称操作,通过基于损失的规范化来实现在固定能力特征的同时,交换敏感属性时的不变性。该框架实现了超过90%的偏见减少,且准确率损失极小,无需因果图知识。