基于奖励门控的CLIP选择性测试时去偏

arXiv cs.CL 论文

摘要

介绍了奖励门控测试时自适应(RG-TTA),这是一个强化学习框架,根据输入的偏差敏感性选择性地对CLIP模型应用去偏,解决了公平性与效用之间的权衡问题。

arXiv:2607.00423v1 Announce Type: new 摘要:视觉语言模型(VLM)在零样本任务上表现出色,但在涉及人物的查询中常常延续社会刻板印象,导致人口统计分布偏差。当前的去偏方法对所有输入查询都施加统一的偏差校正,而不考虑其偏差敏感性,造成了公平性与效用之间的根本权衡。强去偏会扭曲偏差不敏感查询中的语义信息,而弱去偏则无法缓解偏差敏感查询中的刻板印象。这种一刀切的方法阻碍了同时实现偏差不敏感查询的高效用和偏差敏感查询的公平性。我们提出了奖励门控测试时自适应(RG-TTA),一种基于强化学习的测试时自适应框架,可根据输入敏感性选择性地应用去偏。RG-TTA在测试时策略自适应过程中,根据每个输入的偏差敏感性自适应地触发公平性正则化,同时对于偏差不敏感的输入只专注于优化跨模态对齐。在公平性基准(如FairFace、UTKFace)上的实验表明,该方法在显著减少偏差的同时提高了零样本效用,解决了统一去偏中的权衡问题。
查看原文
查看缓存全文

缓存时间: 2026/07/02 05:37

# 通过奖励门控实现CLIP的选择性测试时去偏
来源: https://arxiv.org/html/2607.00423
Jaeho Han, Jisoo Yang, Hyeondong Woo, Mingyu Jeon, Sunjae Yoon, Junyeong Kim
中央大学人工智能系 \{wogh50, yjs229, hyeondong, smart2557, sunjaeyoon, junyeongkim\}@cau\.ac\.kr

###### 摘要

视觉语言模型(VLMs)展现出强大的零样本性能,但在以人为中心的查询中常常固化了社会刻板印象,导致人口统计分布出现偏差。当前的去偏方法对所有输入查询施加统一的偏差校正,无论其偏差敏感性如何,从而造成了根本的公平性-效用权衡。强去偏会扭曲偏差不敏感查询中语义上有意义的信息,而弱去偏则难以减轻偏差敏感查询中的刻板印象。这种一刀切的方法阻碍了同时在偏差不敏感查询上保持高效用和在偏差敏感查询上实现公平性。我们引入了奖励门控测试时自适应(RG-TTA),这是一种基于强化学习的测试时自适应框架,可根据输入敏感性选择性地应用去偏。RG-TTA在测试时策略自适应过程中,基于每个输入的偏差敏感性自适应地触发公平性正则化,同时对于偏差不敏感的输入则仅专注于优化跨模态对齐。在公平性基准(如 FairFace、UTKFace)上的实验表明,该方法在显著减少偏差的同时提高了零样本效用,解决了统一去偏的权衡问题。

通过奖励门控实现CLIP的选择性测试时去偏

Jaeho Han, Jisoo Yang, Hyeondong Woo, Mingyu Jeon, Sunjae Yoon, Junyeong Kim
中央大学人工智能系
\{wogh50, yjs229, hyeondong, smart2557, sunjaeyoon, junyeongkim\}@cau\.ac\.kr

![[无标题图片]](https://arxiv.org/html/2607.00423v1/x1.png)

图1: (a) 我们将输入分为**偏差敏感**和**偏差不敏感**两类,仅前者需要去偏干预。(b) 现有方法采用**统一缓解**,造成结构性权衡:弱去偏在敏感查询中保留偏差(左),而强去偏扭曲不敏感查询,降低效用(右)。(c) 我们的方法通过**奖励门控**实现**选择性缓解**,仅对偏差敏感输入应用强去偏,同时保留不敏感输入,确保公平性和效用二者兼得。
## 1 引言

视觉语言模型(VLMs)在广泛的多模态任务中展现了卓越的零样本能力 (Deng et al., 2009 (https://arxiv.org/html/2607.00423#bib.bib5); Plummer et al., 2015 (https://arxiv.org/html/2607.00423#bib.bib6)),已达到实际应用阶段。通过从网络规模的图像-文本对中学习联合表征,这些模型无需任务特定的微调即可实现强大的跨模态对齐。然而,同样的训练范式导致VLMs内化了训练数据中存在的社会刻板印象 (Birhane et al., 2021 (https://arxiv.org/html/2607.00423#bib.bib8)),从而产生反映并可能加剧社会偏见的偏差输出 (Hall et al., 2023 (https://arxiv.org/html/2607.00423#bib.bib1); Hamidieh et al., 2024 (https://arxiv.org/html/2607.00423#bib.bib2); Janghorbani and De Melo, 2023 (https://arxiv.org/html/2607.00423#bib.bib3); Zhao et al., 2021 (https://arxiv.org/html/2607.00423#bib.bib4); Wolfe et al., 2023 (https://arxiv.org/html/2607.00423#bib.bib40); Hausladen et al., 2025 (https://arxiv.org/html/2607.00423#bib.bib39))。这些偏差在以人为中心的查询中表现得最为严重,模型会产生扭曲的人口统计分布。例如,查询"一位医生的照片"会不成比例地返回男性图像,或者某些职业会与特定种族群体强烈关联。这种行为存在强化歧视性决策的严重风险。

现有的VLM去偏方法 (Wang et al., 2021b (https://arxiv.org/html/2607.00423#bib.bib31); Chuang et al., 2023 (https://arxiv.org/html/2607.00423#bib.bib32); Zhang et al., 2025 (https://arxiv.org/html/2607.00423#bib.bib9)) 共享共同的设计理念:它们对所有语言查询统一应用固定的偏差校正,无论单个查询是否对人口统计偏差敏感。尽管概念简单,但这种统一缓解策略导致了我们图1 (https://arxiv.org/html/2607.00423#S0.F1)(b) 所示的根本性公平性-效用权衡。此处,我们使用效用指代通用零样本在下游任务(例如图像分类和跨模态检索)上的表现。

对于偏差敏感查询,模型的预测通常与人口统计属性纠缠在一起,需要强去偏才能实现公平结果。相比之下,对于偏差不敏感查询,真实语义在很大程度上与人口统计属性正交,模型原有的预测已经反映了准确的跨模态对齐。当统一的去偏框架应用于这两种类型的查询时,两种失败模式之一将不可避免。如图2 (https://arxiv.org/html/2607.00423#footnote2) 所示,这种不灵活性造成了权衡:现有方法必须在敏感查询的公平性和通用任务效用之间做出取舍,无法同时兼顾二者。

![[无标题图片]](https://arxiv.org/html/2607.00423v1/x2.png)

图2: 种族和年龄的公平性 vs 效用。**准确率**通过ImageNet零样本top-1准确率 (%) 衡量,**公平性**通过1−MaxSkew@1000 衡量(越高越好)。现有的查询无关去偏基线方法 (Chuang et al., 2023 (https://arxiv.org/html/2607.00423#bib.bib32); Wang et al., 2021b (https://arxiv.org/html/2607.00423#bib.bib31); Zhang et al., 2025 (https://arxiv.org/html/2607.00423#bib.bib9)) 表现出公平性-效用的权衡,而我们的方法在提升准确率的同时改善了公平性。

我们认为,上述局限性是查询无关的设计范式所带来的结果。由于统一去偏方法无法区分哪些输入需要缓解、哪些不需要,因此它们被限制在妥协区间内运行。这一观察促使我们转向自适应去偏的范式,即根据每个输入的偏差敏感性选择性激活缓解措施。为此,我们提出了用于CLIP的**奖励门控测试时自适应**(RG-TTA),这是一个基于强化学习(RL)的框架,专为选择性去偏设计。我们的关键见解是,去偏应被视为逐个查询的决策,而非全局变换,使模型能够根据输入特征动态调整其行为。如图3 (https://arxiv.org/html/2607.00423#S1.F3) 所示,RG-TTA通过情节性测试时自适应协议运行。对于每个传入的查询,我们首先通过量化查询语义与一组人口统计属性之间的对齐差异来评估其偏差敏感性。基于此评估,自适应奖励门控策略仅在偏差敏感查询上动态触发公平性正则化目标,确保对中性输入保留原始跨模态对齐。

在多个公平性基准(包括FairFace (Kärkkäinen and Joo, 2021 (https://arxiv.org/html/2607.00423#bib.bib33))、UTKFace (Zhang et al., 2017 (https://arxiv.org/html/2607.00423#bib.bib34)) 以及挑战性数据集FACET (Gustafson et al., 2023 (https://arxiv.org/html/2607.00423#bib.bib35)))上的实证评估表明,RG-TTA在各种人口统计属性上显著减少了社会偏见。值得注意的是,我们的框架有效解决了公平性-效用的权衡,在实现显著偏差减少的同时,在ImageNet-1K (Deng et al., 2009 (https://arxiv.org/html/2607.00423#bib.bib5)) 等任务上取得了比现有查询无关基线更高的准确率。通过利用这种门控奖励进行情节性优化,RG-TTA提供了一种实用的设计原则,能在不大幅破坏视觉语言模型对齐的前提下减轻偏差。

参见说明图3: RG-TTA概览:基于RL的情节性测试时自适应,通过指示器δ(q)实现**奖励门控**。对于每个查询,我们仅对截断的top-K候选集执行少量策略梯度步骤,更新查询模态编码器(文本查询则更新文本编码器;图像查询则更新图像编码器)。指示器δ(q)控制情节奖励:当δ(q)=0时,我们优化纯对齐奖励;当δ(q)=1时,我们添加属性平衡奖励。当top-1匹配y*与属性对齐分布足够接近时(表明属性纠缠程度较高),门控被激活。
## 2 相关工作

#### 视觉语言模型中的社会去偏。

CLIP风格VLM的社会去偏大致分为 (i) **基于训练**的方法 (Alabdulmohsin et al., 2024 (https://arxiv.org/html/2607.00423#bib.bib12); Hirota et al., 2025b (https://arxiv.org/html/2607.00423#bib.bib10); Zhang et al., 2025 (https://arxiv.org/html/2607.00423#bib.bib9)),通过学习过程中引入额外目标或模块来抑制敏感属性信号;以及 (ii) **无需训练**的方法 (Chuang et al., 2023 (https://arxiv.org/html/2607.00423#bib.bib32); Gerych et al., 2024 (https://arxiv.org/html/2607.00423#bib.bib11)),保持基础模型固定,对嵌入或输出进行后处理调整。前者包括联合去偏方法,在对齐和消除跨模态偏差;后者则从属性提示中估计偏差方向,并通过轻量级投影去除偏差。然而,大多数现有方法仍然是**查询无关**的,对所有查询应用单一的全局定义变换。最近一种向查询自适应去偏的尝试是SANER (Hirota et al., 2025a (https://arxiv.org/html/2607.00423#bib.bib41)),它通过将干预限制在属性中性文本描述上来执行选择性去偏;然而其调整局限于训练阶段的文本特征,限制了在部署时适应不同输入分布的能力。因此,这种固定或部分选择性的规则仍然难以同时优化两个目标,迫使在有效的偏差缓解和保持通用模型效用之间做出妥协。

#### 通过强化学习实现CLIP的测试时自适应。

测试时自适应(TTA (Sun et al., 2020 (https://arxiv.org/html/2607.00423#bib.bib16); Wang et al., 2021a (https://arxiv.org/html/2607.00423#bib.bib17)))旨在通过在推理时执行参数更新来提升未标记测试输入上的模型性能,使模型无需重新训练即可适应分布偏移。早期的TTA方法依赖于辅助自监督目标,如熵最小化 (Sun et al., 2020 (https://arxiv.org/html/2607.00423#bib.bib16); Liu et al., 2021 (https://arxiv.org/html/2607.00423#bib.bib18); Wang et al., 2021a (https://arxiv.org/html/2607.00423#bib.bib17))。然而,这些方法常因目标不匹配或预测崩溃导致不稳定 (Park et al., 2025 (https://arxiv.org/html/2607.00423#bib.bib14)),这激发了对利用VLM内部对齐信号作为直接反馈的兴趣。特别是,将CLIP相似性视为显式奖励,并在推理时进行基于RL的优化 (Zancato et al., 2023 (https://arxiv.org/html/2607.00423#bib.bib19); Zhao et al., 2024 (https://arxiv.org/html/2607.00423#bib.bib13)),已被证明能减少基于熵的更新中观察到的崩溃行为,并提升零样本泛化能力。我们建立在反馈驱动的TTA范式之上,并将其扩展到解决VLM中的社会偏见。我们的主要贡献是:(1) 一个偏差敏感性门控,按输入激活去偏;(2) 一个将跨模态对齐与偏差子空间去偏信号结合的奖励。通过情节性测试时更新和选择性奖励门控,RG-TTA缓解了公平性-效用的权衡,同时提升了公平性和通用效用。

## 3 方法

我们提出**奖励门控测试时自适应**(RG-TTA),这是一个基于RL的框架,用于在推理过程中自适应地更新模型参数,实现选择性去偏。RG-TTA基于两个关键组件。首先,**选择性门控策略**评估查询敏感性,仅在必要时触发**公平性正则化**。其次,**自适应奖励函数**平衡CLIP对齐与**属性平衡奖励**,该奖励通过偏好表示不足的属性来鼓励均匀表示。我们使用REINFORCE算法 (Williams, 1992 (https://arxiv.org/html/2607.00423#bib.bib15)) 的可处理近似来更新模型。通过top-K截断将更新集中在最相关的候选上,该方法确保优化保持以查询特定语义为中心,并通过情节重置限制漂移。

### 3.1 预备知识

#### CLIP。

预训练的视觉语言模型(VLM)由图像编码器f(·)和文本编码器g(·)组成,它们将两种模态投影到共享嵌入空间中 (Radford et al., 2021 (https://arxiv.org/html/2607.00423#bib.bib7))。对于给定查询q和从相反模态选择的候选y∈Y,我们定义对齐分数S(q,y)为它们嵌入之间的余弦相似度。具体地,在文本到图像设置中,我们使用S(q,y)=cos(g(q),f(y)),而在图像到文本设置中,我们使用S(q,y)=cos(f(q),g(y))。我们使用策略分数S_θ(q,y)进行候选排序和策略参数化。我们仅使用参考分数S_ref(q,y)来计算CLIP奖励;S_ref来自所有实验中固定的CLIP ViT-L/14模型。

#### 视觉语言任务中的测试时自适应。

测试时自适应(TTA (Sun et al., 2020 (https://arxiv.org/html/2607.00423#bib.bib16); Wang et al., 2021a (https://arxiv.org/html/2607.00423#bib.bib17)))在推理时使用少量无标签步骤更新已训练的模型。我们采用**情节性**协议:每个查询q独立自适应,参数在下一个查询之前重置,这减轻了负迁移。对于视觉语言检索(q可以是文本或图像),我们仅自适应查询模态编码器,并保持相反模态编码器固定。

### 3.2 选择性门控策略

对所有查询统一应用去偏是不必要的,并可能在偏差不敏感查询上引起参数漂移。为了缓解结构性的公平性-效用权衡,我们引入了一种门控机制,该机制衡量查询语义与人口统计属性之间的对齐差异。对于每个查询q,我们选择top-1候选y*=argmax_y S_θ(q,y)作为**锚点**,并通过将y*与预定义属性集A(受保护群体示例)上的平均属性相似度进行比较,来评估查询-候选对齐是否不成比例地由人口统计关联驱动

相似文章

CLAP:领域智能体后训练的闭环训练、评估与发布控制

arXiv cs.AI

CLAP提出了一种面向领域智能体后训练的闭环方法,将含噪业务数据转化为结构化的SFT和偏好样本,并结合奖励/KL诊断、离线门控以及应用链路重放来决定适配器是否发布。在五个制造批次上的实验显示平均增益适度,并强调回归和高KL风险需要集成的数据-训练-评估-发布循环,而非依赖单一评分。

通过改变理性度来缓解RLHF中的认知偏差

arXiv cs.AI

本文提出了一种通过基于大型语言模型(LLM)对标注者可靠性的评估来动态调整理性度参数,从而缓解人类反馈强化学习(RLHF)中认知偏差的方法。