RPAM:一种评估语言模型关联的原则性度量方法,在下游输出中具有高预测有效性

arXiv cs.CL 论文

摘要

介绍RPAM,一种评估语言模型关联的原则性度量方法,该方法在下游输出中展现出高预测有效性,并在Mistral-7B-Instruct、Mistral-7B和GPT-2上进行了测试。

arXiv:2607.05679v1 Announce Type: new 摘要:语言模型(LM)会表现出有问题的偏见,例如刻板印象。有效分析和缓解此类偏见需要对潜在关联进行准确且可泛化的评估方法。一些现有方法侧重于分析生成文本中关联的下游指标。由于不同语言模型生成的文本内容可能差异很大,这类指标通常需要专门的评估数据集,这限制了下游指标的泛化性。相比之下,上游指标在嵌入或延续概率的基本层面上检查语言模型,从而能够对不同语言模型进行原则性的关联分析。然而,迄今为止,尚无针对生成式语言模型的上游指标发现与真实世界关联(包括在生成文本中测量的关联)之间的强关系。为填补这一空白,我们引入了相对概率关联度量(RPAM),这是一种针对生成式语言模型的关联评估指标。对于三种不同语言生成质量和目的的语言模型(Mistral-7B-Instruct、Mistral-7B和GPT-2)以及经过充分研究的评估数据集(WEAT-WS、Bellezza、WS-353和SST2),我们发现上游RPAM测量值与人类观察到的相应内隐和外显关联之间存在强关系,并且与使用特定语言模型任务在下游测量的偏见也存在强关系,在适用情况下超越了以往的记录值。
查看原文
查看缓存全文

缓存时间: 2026/07/08 04:41

# RPAM:一种用于评估语言模型中关联性的原则性度量指标,对下游输出具有高预测效度  
来源:https://arxiv.org/html/2607.05679  
Damian Hodel¹, Jevin West¹, Aylin Caliskan¹, ¹华盛顿大学,西雅图,美国 \{hodeld, jevinw, aylin\}@uw\.edu  

###### 摘要  
语言模型(LM)表现出有问题的偏见,例如刻板印象。有效分析和缓解此类偏见需要对底层关联性进行准确且可泛化的评估方法。一些现有方法侧重于分析生成文本中关联性的下游指标。由于生成文本内容在不同LM之间可能差异显著,此类指标通常需要专门的评估数据集,这限制了下游指标的泛化能力。相比之下,上游指标在嵌入或延续概率的基本层面检视LM,从而能够对不同LM进行原则性的关联性分析。然而,迄今为止,尚无针对生成式LM的上游指标能够揭示与真实世界关联性(包括在生成文本中测量的关联性)之间的强关系。为填补这一空白,我们引入了相对概率关联度量(RPAM),一种针对生成式LM的关联性评估指标。针对三种不同语言生成质量和用途的LM(Mistral-7B-Instruct、Mistral-7B和GPT-2)以及经过充分研究的评估数据集(WEAT-WS、Bellezza、WS-353和SST2),我们发现上游RPAM测量值与人类中观察到的相应隐性和显性关联性,以及通过LM特定任务在下游测量的偏见之间存在强关系,在适用情况下优于先前记录值。  

## 1 引言  
生成式语言模型(如聊天机器人)在概念之间表现出关联性,例如女性与艺术之间的关联。虽然关联性在语言中是必要的,但当LM生成涉及刻板印象和针对特定社会群体的负面态度(Ghosh and Caliskan,2023 (https://arxiv.org/html/2607.05679#bib.bib46))的文本,或当基于这些LM的系统被用于医疗(Apell and Eriksson,2023 (https://arxiv.org/html/2607.05679#bib.bib74))、内容审核(Boicel,2024 (https://arxiv.org/html/2607.05679#bib.bib75))等高风险场景的自动决策时,关联性可能是有害的。在社会语境中,此类有问题的关联性常被称为社会偏见(Bender et al.,2021 (https://arxiv.org/html/2607.05679#bib.bib34);An et al.,2023 (https://arxiv.org/html/2607.05679#bib.bib48);Rudinger et al.,2018 (https://arxiv.org/html/2607.05679#bib.bib82);Hofmann et al.,2024 (https://arxiv.org/html/2607.05679#bib.bib124))。有效缓解这些风险(如人工智能法规)的策略需要准确且可泛化的关联性测量方法,通常包括一个评估度量和一个提供给LM的数据集(Gallegos et al.,2024 (https://arxiv.org/html/2607.05679#bib.bib106))。  

对于生成式LM,现有方法倾向于关注旨在直接测量LM生成文本中关联性的下游指标(例如 Kotek et al.,2023 (https://arxiv.org/html/2607.05679#bib.bib58);Wan et al.,2023 (https://arxiv.org/html/2607.05679#bib.bib67);Dhamala et al.,2021 (https://arxiv.org/html/2607.05679#bib.bib91))。由于语言生成质量取决于LM的类型(例如架构、规模、微调目的等,如附录中图4 (https://arxiv.org/html/2607.05679#A3.F4)所示),下游指标通常依赖针对特定概念和LM的专用评估数据集,这限制了下游指标的泛化能力(Gallegos et al.,2024 (https://arxiv.org/html/2607.05679#bib.bib106))。相比之下,大多数上游指标在嵌入(Wolfe and Caliskan,2022 (https://arxiv.org/html/2607.05679#bib.bib8);May et al.,2019 (https://arxiv.org/html/2607.05679#bib.bib17);Tan and Celis,2019 (https://arxiv.org/html/2607.05679#bib.bib35))或延续概率¹¹¹指给定提示文本时LM以特定词继续的概率(Goldfarb-Tarrant et al.,2023 (https://arxiv.org/html/2607.05679#bib.bib50))(Nadeem et al.,2021 (https://arxiv.org/html/2607.05679#bib.bib10);Kurita et al.,2019 (https://arxiv.org/html/2607.05679#bib.bib18);Hofmann et al.,2024 (https://arxiv.org/html/2607.05679#bib.bib124))的基本层面检视LM。独立于文本生成和解码,上游指标能够实现原则性的关联性评估,涉及基于社会科学的大规模系统分析,并可应用于各种LM类型,从而在设计上解决专用方法的关键局限。然而,一些使用先前指标的评估表明,上游测量可能无法完全捕捉LM在现实应用中的有害行为(Cao et al.,2022 (https://arxiv.org/html/2607.05679#bib.bib31);Steed et al.,2022 (https://arxiv.org/html/2607.05679#bib.bib115))。具体而言,目前尚无上游指标证明与下游生成文本中观察到的关联性存在强关系(Goldfarb-Tarrant et al.,2023 (https://arxiv.org/html/2607.05679#bib.bib50))。为填补这一空白,我们引入了相对概率关联度量(RPAM)。据我们所知,RPAM是首个针对生成式LM的上游关联性评估指标,其测量值在各种LM类型中均与真实世界关联性(包括人类的隐性和显性关联性(实验1和2),以及下游生成文本中的关联性(实验3))表现出强关系。受认知科学中相对比较测量关联性的发现启发(Bai et al.,2024 (https://arxiv.org/html/2607.05679#bib.bib85);Crosby et al.,1980 (https://arxiv.org/html/2607.05679#bib.bib116)),RPAM采用评估数据集中两个文本输入之间的相对关联性测量,并针对该数据集中剩余文本输入与这些输入的关联性进行归一化。  

为评估RPAM,我们选择了三种语言生成质量不同的LM:两个最先进的大型LM,Mistral的Mistral-7B-Instruct和Mistral-7B(Jiang et al.,2023 (https://arxiv.org/html/2607.05679#bib.bib78)),以及一个较小的LM,OpenAI的GPT-2(Radford et al.,2019 (https://arxiv.org/html/2607.05679#bib.bib21)),以便与先前工作的验证结果进行比较。在三个实验中,我们评估了RPAM与真实世界关联性之间的关系,采用对齐设置,即使用与量化相应真实世界关联性相同的文本数据集来通过RPAM测量上游关联性。在实验1中,RPAM使用一个经过充分研究的包含十个与年龄、性别、种族和心理健康相关的关联性测试的数据集(WEAT-WS),根据词嵌入关联性测试(WEAT)(Caliskan et al.,2017 (https://arxiv.org/html/2607.05679#bib.bib3))复制了人类中存在的十个隐式关联性。实验2将RPAM与人类显性非社会关联性进行比较,涵盖四个不同任务,包括人类评定的词关联性(WS-353)、词的愉悦度(Bellezza)以及电影评论中句子的情感(SST2)。对于这两个实验,RPAM与人类关联性的关系强度均优于之前在GPT-2上的最高结果(Wolfe and Caliskan,2022 (https://arxiv.org/html/2607.05679#bib.bib8))。使用与实验2相同的数据集,实验3评估了RPAM与LM生成文本下游关联性的一致性,采用LM特定的下游任务:Mistral-7B-Instruct评定词的愉悦度,而Mistral-7B和GPT-2对电影评论短语进行情感分类。上下游测量在同一模型版本上进行,以确保受控设置。我们观察到399个词的愉悦度具有0.73的斯皮尔曼ρ,超过800个情感分类的F1分数≥0.74。我们特别关注测试效价(即愉悦度、情感、态度)的数据集,因为它是自然语言和人工语言中最强烈的情感信号(Osgood,1964 (https://arxiv.org/html/2607.05679#bib.bib109))。此外,尽管实验2和3中使用的数据集主要涉及非社会刺激,但我们使用它们是因为它们能够在刺激层面进行比较性关联性测量,比基于WEAT(Wolfe et al.,2024 (https://arxiv.org/html/2607.05679#bib.bib123))等聚合层面的测量具有更高的评估精度和可解释性。  

我们的主要贡献是:  
- •我们引入了RPAM:一种用于生成式LM原则性关联性评估的度量,优于先前度量,并可跨LM和概念应用。  
- •我们引入了一个基于比较性测量人类隐性和显性关联性以及生成文本中关联性的LM关联性度量验证框架。  
- •使用RPAM和我们的验证框架,我们证明了真实世界关联性可以在上游LM中测量。  
- •使用基于相对关联性的关联性度量RPAM,我们首次证明人类中存在的隐性和显性关联性,以及生成文本中的关联性,可以在上游LM中测量。  
本项目的所有代码将公开提供。  

## 2 背景与相关工作  
我们回顾了评估生成式LM关联性的度量²²²全面综述请参阅Gallegos et al. (2024) (https://arxiv.org/html/2607.05679#bib.bib106),将关联性概念化为可能导致表征性或分配性危害的统计关联性。在人类中,关联性可大致分为隐性和显性形式,分别指无意识和有意识的关联性(Greenwald and Banaji,1995 (https://arxiv.org/html/2607.05679#bib.bib89); Bargh et al.,1996 (https://arxiv.org/html/2607.05679#bib.bib88))。在LM中,类似人类的关联性可通过下游和上游测量进行评估。下游指标侧重于生成文本,它们不评估整个模型。此外,由于LM生成的响应可能变化,它们通常需要专门的评估数据集。例如,最近的LM可能拒绝涉及公然关联性的提示(Bai et al.,2024 (https://arxiv.org/html/2607.05679#bib.bib85); Kenthapadi et al.,2024 (https://arxiv.org/html/2607.05679#bib.bib111)),而测试聊天机器人关联性的数据集(例如Kotek et al.,2023 (https://arxiv.org/html/2607.05679#bib.bib58))可能不适用于未经过指令微调或语言生成质量较低的LM(Onorati et al.,2023 (https://arxiv.org/html/2607.05679#bib.bib119))。相比之下,许多上游指标建立在词嵌入关联性测试(WEAT)(Caliskan et al.,2017 (https://arxiv.org/html/2607.05679#bib.bib3))之上,该测试本身基于隐式关联性测试(IAT)(Greenwald et al.,1998 (https://arxiv.org/html/2607.05679#bib.bib39))。IAT和WEAT都测量两个目标和两个属性之间的标准化差异关联性,返回效应量(d)作为关联性幅度的度量。通常,目标代表两个社会群体(如女性和男性),而属性代表态度或刻板印象(如艺术和数学)。目标和属性由八个或更多所谓的刺激表示,这些刺激通常是单个词。Toney-Wails and Caliskan (2021 (https://arxiv.org/html/2607.05679#bib.bib28)) 引入了单类别WEAT(SC-WEAT),使得效价测量成为可能。几项工作提出了针对生成式LM的WEAT变体,采用不同的方法来操作化关联性,通常基于余弦相似度(Guo and Caliskan,2021 (https://arxiv.org/html/2607.05679#bib.bib11); Wolfe and Caliskan,2022 (https://arxiv.org/html/2607.05679#bib.bib8))或延续概率(Kurita et al.,2019 (https://arxiv.org/html/2607.05679#bib.bib18); Nangia et al.,2020 (https://arxiv.org/html/2607.05679#bib.bib24))。然而,先前研究表明上游测量与真实世界关联性之间的关系较弱。与RPAM不同,先前的上游指标通常使用两个给定刺激之间的绝对关联性(无归一化)(例如Kurita et al.,2019 (https://arxiv.org/html/2607.05679#bib.bib18); Wolfe and Caliskan,2022 (https://arxiv.org/html/2607.05679#bib.bib8); Hofmann et al.,2024 (https://arxiv.org/html/2607.05679#bib.bib124))。归一化基于先前的方法(Schick et al.,2021 (https://arxiv.org/html/2607.05679#bib.bib13))。然而,与Schick et al. (2021 (https://arxiv.org/html/2607.05679#bib.bib13)) 为二分类评估(评估输入文本是否包含有毒内容)开发的方法不同,RPAM比较输入文本与一系列属性(例如数学、代数、艺术、诗歌等)之间的关联性。此外,我们通过与真实世界关联性的比较来验证我们的度量,并在更近期的语言模型(如Mistral-7B)上进行测试。  

## 3 数据  
使用反映人类隐性和显性关联性的数据集,RPAM能够评估开源LM中类似人类的关联性。这些数据集有两个用途:数据集的文本数据既作为上游使用RPAM进行关联性测量和下游使用专用方法进行关联性测量的输入,包含的关联性值也允许在RPAM关联性测量与人类中观察到的关联性之间进行比较。  

### 语言模型  
Mistral-7B-Instruct、Mistral-7B和GPT-2是三个经过充分研究的、不同类型的开源模型,此处记为Mistral-Instruct、Mistral和GPT-2。Mistral被广泛使用,因为它在几个评估语言生成质量的基准上优于类似模型(Jiang et al.,2023 (https://arxiv.org/html/2607.05679#bib.bib78))。Mistral-Instruct是在Mistral上微调的,代表类似于ChatGPT的聊天机器人。两者都是最先进的模型,而GPT-2是OpenAI最后一个开源的语言模型。模型大小分别为Mistral模型的70亿参数和GPT-2的1.24亿参数。所有实验均使用HuggingFace Transformers库³³³根据HuggingFace库的名称:"mistralai/Mistral-7B-Instruct-v0.2."、"mistralai/Mistral-7B-v0.1"和"openai-community/gpt2"(wolf2019huggingface)。  

### WEAT-WS:人类隐式关联性  
经过充分研究的WEAT数据集(WEAT-WS,Caliskan et al.,2017 (https://arxiv.org/html/2607.05679#bib.bib3))反映了人类中观察到的隐式关联性,并允许根据WEAT/IAT进行关联性测量。十个测试涉及性别、种族、能力、年龄以及关于花/昆虫和乐器/武器的广泛共享的非社会关联性。我们将其记为C1, C2, C3, ..., C10,完整词集见附录B (https://arxiv.org/html/2607.05679#A2)。缩写EA和AA对应欧裔美国人和非裔美国人目标,P和U对应效价属性的愉快和不愉快词。我们在实验1中使用该数据集。  

### WS-353、Bellezza和SST2:人类显式关联性  
反映显式关联性的数据集包含主要由人类评定或分类的非社会词和句子的效价和相似性。词相似性数据集WordSim-353 (WS-353, finkelstein2001placing) 包含353个词对的相似性分数。Bellezza的效价规范 le

相似文章

无监督过程奖励模型

Hugging Face Daily Papers

本文提出无监督过程奖励模型(uPRM),通过利用LLM的下一个令牌概率识别错误推理步骤,从而消除人工标注需求,在准确率上相比LLM-as-a-Judge提升高达15%,并且作为验证器和奖励信号时表现与有监督PRM相当。

大规模语言模型的概率归因

arXiv cs.CL

本文提出了一种与模型无关的基于概率的令牌归因度量,利用贝叶斯规则反转下一个令牌的对数概率,捕捉模型对令牌序列的内部表示,并通过熵分析提高可解释性。