通过反事实集成解码减轻大型视觉语言模型中的偏见
摘要
本文提出反事实集成解码(CED),通过构建多组反事实视角并在解码过程中集成它们,以减轻大型视觉语言模型中的社会偏见,实现显著的偏见减少同时保持模型能力。
arXiv:2608.21415v1 公告类型:新
摘要:大型视觉语言模型(LVLMs)在广泛任务中取得了显著性能;然而,它们往往从训练数据中继承社会偏见,导致在处理不同社会群体的肖像时表现出偏见行为。现有的去偏方法通常在解码过程中比较原始和偏见生成之间的词元概率,但它们从根本上受限于依赖单一的刻板视角,未能考虑社会视角的多样性。受社会科学中多样性促进公平原则的启发,我们提出反事实集成解码(CED),这是一种新颖的框架,在视觉表示空间内构建多组反事实视角,并在解码过程中集成它们以促进公平的模型行为。CED首先在视觉空间中进行反事实引导,通过识别与每个社会群体相关的语义方向,并沿这些方向生成反事实表示,从而提供打破刻板叙事的多样化视角。在解码过程中,CED定位在这些视角中显示出最大差异的解码器层,并使用不确定性感知权重集成它们的词元分布,优先考虑来自不同群体的高置信度词元,以产生更平衡的概率分布,引导更公平的生成。在三个社会偏见评估基准上的广泛实验表明,\tool相比领先基线取得了显著改进,在涉及职业、描述符和人格特质的场景中,偏见减少了高达47.97%。此外,CED还以最小的性能下降保持了原始模型的核心能力。
查看缓存全文
缓存时间: 2026/08/25 04:11
# 通过反事实集成解码缓解大型视觉语言模型中的偏差 来源:https://arxiv.org/html/2608.21415 IEEE出版技术 本文由IEEE出版技术组制作。他们位于新泽西州皮斯卡塔韦。 稿件收到日期:2021年4月19日;修订日期:2021年8月16日。 肖义松,刘艾珊🖂,黄永鑫,应宗浩,赵世纪,李天林,韩勇🖂,杨健,刘祥龙 Y. 肖、A. 刘、Y. 黄、Z. 应、S. 赵、T. 李、Y. 韩、J. 杨和X. 刘就职于北京航空航天大学软件开发环境国家重点实验室,邮编100191,中国。(🖂通讯作者:刘艾珊,[email protected];韩勇,[email protected]) ###### 摘要 大型视觉语言模型在广泛任务中取得了显著性能;然而,它们常从训练数据中继承社会偏差,导致在处理不同社会群体的肖像时表现出有偏行为。现有的去偏差方法通常在解码过程中比较原始生成与偏差生成之间的token概率,但它们从根本上受限于依赖单一的刻板视角,未能考虑社会视角的多样性。受社会科学中“多样性促进公平”原则的启发,我们提出了**反事实集成解码**这一新框架。该框架在视觉表示空间中构建多群体反事实视角,并在解码过程中整合这些视角,以促进模型的公平行为。CED首先在视觉空间中执行反事实引导:识别与每个社会群体相关的语义方向,并沿这些方向生成反事实表示,从而提供打破刻板叙事的多元视角。在解码过程中,CED定位在这些视角间差异最大的解码器层,并使用不确定性感知权重集成这些视角的token分布,优先考虑来自不同群体的高置信度token,以产生更均衡的概率分布,从而指导更公平的生成。在三个社会偏差评估基准上的大量实验表明,CED相较于领先的基线方法取得了显著改进,在涉及职业、描述符和个人特质的场景中,偏差最多降低了47.97%。此外,CED在保持原始模型核心能力方面也仅有极小的性能下降。我们的代码可在此处找到:https://github.com/xiaoyisong/CED。 ## I 引言 大型视觉语言模型近年来取得了显著进展[56, 35, 37],它们通过整合视觉模态扩展了大语言模型的能力[7, 49],在视觉问答和图像描述等任务中表现出色[24, 54, 51]。尽管取得了巨大成功,LVLMs一直存在的一个担忧是它们可能从训练数据中继承的社会刻板印象和偏差[21, 14],导致对特定社会群体产生有偏且有害的结果,尤其在性别和种族等受保护属性方面。例如,研究表明性别偏差在LVLMs中普遍存在,将特定的情绪、职业和性化内容与女性联系起来[3, 22, 52]。这些偏差会对社会造成巨大伤害,并削弱LVLMs的可信度。因此,解决LVLMs中的偏差对于确保其在敏感应用中的道德和负责任部署至关重要。LVLMs中的社会偏差指的是对个人或群体的差异化对待[31, 14],这源于训练数据中某些社会群体的代表性不足或有偏差的描绘,强化了有害的刻板印象并延续了表征危害[10]。为解决这个问题,已提出了许多偏差缓解方法[12, 13, 53, 18, 45, 30, 46, 38]。先前的工作[53, 18]通常涉及在重新平衡的数据集上微调模型,并常辅以反事实数据。然而,这些训练阶段的方法资源密集,需要昂贵的数据收集和大量的计算资源,限制了其实际可行性。因此,一些方法旨在通过在推理阶段缓解偏差来提高效率,通常利用如解码修改[46, 38]等技术,这些技术比较原始生成与偏差生成之间的token概率以抑制偏差token。然而,这些方法从根本上受限于依赖单一的刻板视角,因为它们未能融入对有效促进公平至关重要的不同社会群体的多元视角。 **图 1**:说明LVLMs在职业场景中的性别偏差。我们引入CED进行去偏差,它集成了多元视角以打破刻板叙事的主导地位。 为解决这一挑战,我们提出了反事实集成解码,这是一种去偏差框架,它在视觉表示空间中构建多群体反事实视角,并在解码过程中整合这些视角,从而促进更公平的token概率分布(如图1所示)。我们的方法受到社会科学中广泛认可的原则的启发,即增加多样性促进公平[9, 28, 11, 6],其中打破刻板叙事的主导地位并整合多元视角有助于有效缓解针对特定社会群体的偏差。值得注意的是,反事实样本[29]在受保护属性(*例如*,性别,容易触发刻板偏差)上与原始输入不同,同时保留其他视觉场景上下文和任务相关信息,为去偏差提供了理想的多元视角来源。因此,CED在视觉表示空间中执行反事实引导,以规避直接修改视觉内容的困难。具体而言,CED识别与每个社会群体相关的语义方向,并应用方向引导来生成反事实表示,这些表示反映了打破刻板叙事的多元社会群体视角。在解码过程中,CED通过检查词汇空间中的token分布差异,定位这些视角之间差异最大的解码器层,因为先前的工作[39, 43]表明偏差常常编码在特定层中。最后,CED使用不确定性感知权重来集成来自不同视角在该层的token分布,优先考虑代表每个群体的高置信度token,从而产生更均衡的token概率分布并促进更公平的行为。 为评估CED的性能,我们在三个广泛使用的LVLMs的偏差评估基准上进行了大量实验。与四种最先进的偏差缓解方法相比,CED展现出显著优越的有效性,实现了:❶ 在GenderBias-VL[52]上职业相关性别偏差平均降低61.21%;❷ 在ModSCAN[26]上覆盖职业、描述符和个人特质场景的种族相关刻板印象偏差平均降低47.97%;❸ 在VisBias[23]上性别化职业描述中的刻板印象词频差异平均降低38.22%,情感差异平均降低65.75%。此外,CED有效保留了LVLM的核心能力,对整体性能影响最小。我们的主要贡献是: - • 我们提出了CED,一种用于LVLMs的推理阶段去偏差框架,它集成了来自不同群体的反事实视角,打破刻板叙事的主导地位并促进公平。 - • 我们开发了一种反事实引导策略,用于在表示空间中生成多元视角,并在解码时在冲突最大的层集成其分布,以实现更公平的输出。 - • 大量实验表明,CED在偏差缓解有效性上显著优于领先的基线方法,同时保留了LVLMs的核心能力。 ## II 相关工作 在本节中,我们回顾了针对LVLMs和LLMs的偏差缓解方法,因为专门为LVLMs开发的方法仍然相对有限[45, 30]。广义上,这些方法可分为两类:训练阶段方法和推理阶段方法。**训练阶段方法**通过修改数据分布或模型学习过程来缓解偏差。反事实数据增强通过生成反事实图像来重新平衡用于微调的训练数据,从而缓解偏差。然而,这些方法依赖于精心策划的数据集和大量的计算资源,导致其实际性和可扩展性有限。 **推理阶段方法**通常分为三类。❶ **提示工程方法**[20, 48, 13, 15]利用模型的指令遵循能力来缓解偏差。Gallegos等人[13]为多选题提出了两种去偏差策略:一种提示模型解释选项中的潜在偏差(解释),另一种则直接要求它从初始响应中去除偏差(重提示)。然而,它们的有效性常常不稳定。❷ **基于投影的方法**[45, 30, 17, 34]通过识别受保护属性子空间并从表示中移除其投影来缓解偏差。例如,PAR[45]从偏差和良性图像-文本对中估计偏差方向,而Lan等人[30]通过残差表示上的干预进一步识别偏差和公平方向。然而,其有效性可能有限,因为中间表示中的偏差并不总是与下游输出中的偏差一致[14, 4]。❸ **基于解码的方法**[46, 8, 38]在解码过程中调整token概率分布以阻止有偏语言生成。Schick等人[46]开发了Self-Debias,它通过添加一个有意鼓励偏差生成的提示前缀,然后比较偏差生成与原始生成的token概率来选择更公平的输出。我们的方法属于基于解码的方法,但在以下方面有其独特之处:❶ **动机**。借鉴了增加多样性促进公平的社会科学原则[9, 28, 11, 6],CED构建多群体反事实视角并在解码过程中整合它们,而先前的方法依赖于单一的刻板视角。❷ **实现**。CED在视觉表示空间中应用方向引导以生成多元视角,然后在冲突最大的层集成其token分布。相比之下,类似的工作[46]比较原始生成与偏差生成之间的token概率。❸ **效果**。通过纳入不同社会群体的视角,CED打破了刻板叙事的主导地位,并始终比现有方法实现更有效的偏差缓解。我们注意到,类似的解码技术[32, 44]已被用于缓解幻觉,但它们在目标和实现上存在根本差异:这些方法通过对比幻觉和忠实生成来提高视觉可信度,而我们的方法通过整合不同社会群体的视角来缓解社会偏差。 ## III 基础知识 在本节中,我们首先简要介绍LVLM的解码过程,然后说明问题定义。 ### III-A LVLM解码 考虑一个参数化的LVLM,它由一个视觉编码器、一个视觉-语言对齐接口和一个具有Ltext层的LLM组成。给定输入图像v和文本查询x,模型首先将v编码为视觉表示hv^{Limg},然后将其与标记化的查询x连接起来并输入LLM进行自回归生成。下一个token yt的概率定义为 p(yt|v,x,y<t)。遵循[18, 55, 14, 52],我们考虑与社会群体相关的受保护属性,如性别(男性/女性)和种族(白人/黑人等)。给定输入对(v,x),LVLM的响应可能包含对特定社会群体的偏差或刻板描述。例如,对于一张医生的图片,模型可能更倾向于将其描述为男性而非女性,从而产生与刻板印象一致的偏差token序列。我们的目标是缓解此类偏差,确保模型的响应在不同社会群体之间更加公平。 ### III-B 问题定义 给定一个LVLM,我们旨在在推理过程中减轻其输出中的社会偏差,而无需修改模型参数或进行额外的训练。偏差通常表现为对受保护群体的代表性不足或刻板描述。因此,我们希望调整token生成过程,使得在给定视觉上下文时,不同社会群体的token概率分布更加平衡。具体来说,对于包含人物图像的输入,我们希望模型在描述他们的职业或特征时,不会仅根据刻板印象将某些职业或特征与特定性别或种族关联起来。通过促进更均衡的token概率,我们旨在使模型生成更公平、更多样化的响应。
相似文章
Evidence-RL:迈向证据密集型视觉推理
本文介绍了反事实证据解耦(CED),这是一种训练时方法,使视觉语言模型依赖具体的图像证据而非语言先验或捷径,从而提升跨基准的视觉推理grounding能力。
超越标记:大型语言模型与视觉语言模型的解码方法综述
本综述论文系统回顾了大型语言模型与视觉语言模型的解码方法,聚焦于推理时方法以提升效率和控制生成过程。文中识别了新兴范式,指出了当前挑战,并探讨了未来研究方向。
解决“打地鼠困境”:一种更智能的 AI 视觉模型去偏方法
来自麻省理工学院(MIT)、伍斯特理工学院(WPI)和 Google 的研究人员提出了 WRING,这是一种用于视觉语言模型(VLM)的新型后处理去偏方法,旨在避免在消除特定偏见时放大其他偏见的“打地鼠困境”。
COFT:面向大型语言模型公平思维链推理的反事实-共形解码
COFT是一种无需训练的解码方法,通过应用令牌级公平控制和共形校准来减少大型语言模型思维链推理中的偏见,以最小的计算开销实现30-55%的偏见降低。
CARGO-VL:面向视觉-语言模型的反事实仲裁与风险约束组优化
介绍了CARGO-VL,一种面向视觉-语言模型的组相对优化框架,通过反事实一致性和风险约束控制,改进对冲突图像-文本证据的处理以及不支持答案的回避,并提供了XMC冲突训练资源。