针对各向异性校准WEAT:ZCA白化作为嵌入关联测试的几何预处理步骤
摘要
本文提出将ZCA白化作为WEAT的几何预处理步骤,以解决嵌入各向异性问题,结果表明校准会改变超过30%结果的显著性状态,未经校准的偏差测量可能不可靠。
arXiv:2608.06908v1 公告类型:新
摘要:我们提出将零相位成分分析(ZCA)白化作为词嵌入关联测试(WEAT)的几何预处理步骤。WEAT是一种在计算社会科学和AI公平性研究中广泛使用的偏差测量方法。它依赖余弦相似度作为语义关联的度量,这假设嵌入空间近似各向同性。然而,先前的研究报告指出,许多广泛使用的语言模型并不满足这一假设,引发了对偏差测量可靠性的担忧。ZCA白化在最小化对原始向量扰动的同时,将嵌入空间的协方差变换为单位矩阵。这一变换恢复了WEAT所依赖的各向同性条件。我们在十个标准WEAT测试套件和跨越三个架构家族的七个模型上评估了我们的方法,共产生70个模型-任务组合。结果表明,ZCA白化显著降低了所有模型嵌入空间的各向异性。特别是对于高度各向异性的模型,我们进一步观察到在标准语义相似性基准上的改进,表明校准后的空间能更好地捕捉语义关联。校准后,超过30%的WEAT结果的显著性状态发生变化,效应大小根据偏差类别在不同方向上发生偏移。这些偏移表明,未经校准的测量可能既高估又低估嵌入空间中编码的关联。这些发现表明,先前在各向异性嵌入空间中报告的偏差测量结果应谨慎解读,并可能受益于使用校准方法重新评估。我们的方法有助于恢复WEAT在计算社会科学和AI公平性研究中的测量基础。
查看缓存全文
缓存时间: 2026/08/10 08:04
# 针对各向异性校准WEAT:ZCA白化作为嵌入关联测试的几何预处理步骤
来源:https://arxiv.org/html/2608.06908
###### 摘要
我们提出将零相位分量分析(ZCA)白化作为词嵌入关联测试(WEAT)的几何预处理步骤。WEAT是一种在计算社会科学和AI公平性研究中广泛使用的偏差测量方法。它依赖余弦相似度作为语义关联的度量,这假设嵌入空间近似各向同性。然而,先前的研究报告指出,许多广泛使用的语言模型并不满足这一假设,从而引发了对偏差测量可靠性的担忧。ZCA白化将嵌入空间的协方差变换为单位矩阵,同时最小化对原始向量的扰动。这一变换恢复了WEAT所依赖的各向同性条件。我们在十个标准WEAT测试套件和涵盖三个架构家族的七个模型上评估了我们的方法,共产生70个模型–任务组合。结果表明,ZCA白化显著降低了所有模型嵌入空间的各向异性。特别是在高度各向异性的模型上,我们进一步观察到标准语义相似度基准的改进,表明校准后的空间能更好地捕捉语义关联。校准后,超过30%的WEAT结果改变了显著性状态,效应量根据偏差类别在两个方向上发生移动。这些移动表明,未校准的测量可能同时高估和低估嵌入空间中编码的关联。这些发现表明,先前在各向异性嵌入空间中报告的偏差测量应谨慎解释,并可能受益于使用校准方法重新评估。我们的方法有助于恢复WEAT在计算社会科学和AI公平性研究中的测量基础。代码——https://github.com/seigit/zca-weat 被第9届AAAI/ACM人工智能、伦理与社会会议(AIES 2026)接收。这是包含附录的扩展版本;最终出版版本将出现在AAAI数字图书馆中。
图1:来自WikiText-103的2,000个随机采样嵌入向量在ZCA白化前(左列)后(右列)的成对余弦相似度矩阵。上:GPT-2,其极端各向异性(平均余弦相似度=0.997=0.997)使矩阵呈现均匀红色区域。下:GloVe(平均=0.192=0.192),在白化前表现出中等各向异性。校准后,两个模型都收敛到接近零的平均相似度,并恢复了有意义的成对变化。
## 1 引言
词嵌入(Mikolov等人,2013;Pennington等人,2014)编码了语言的统计规律,包括可能传播到下游应用的社会偏见(Bolukbasi等人,2016;Caliskan等人,2017;Garg等人,2018)。准确测量这些偏见对于开发公平的NLP系统是必要的。词嵌入关联测试(WEAT;Caliskan等人,2017)将内隐联想测试(IAT;Greenwald等人,1998)的逻辑从人类反应时研究移植到词嵌入空间的几何结构中,测量目标概念(如欧裔美国人与非裔美国人姓名)和属性概念(如愉快与不愉快词汇)之间的差异余弦相似度关联。WEAT在计算社会科学和AI公平性研究中引起了广泛关注,并已被大量研究应用于测量不同模型和模态中的种族、性别、年龄及其他偏见。
然而,任何测量指标的有效性取决于其运行的假设。WEAT假设余弦相似度能够忠实地捕捉词间的语义关联。这一假设在嵌入空间近似各向同性时成立(Ethayarajh,2019;Timkey和Van Schijndel,2021;Rudman等人,2022)。在各向同性空间中,向量在各个方向上大致均匀地分布方差。在此条件下,两个向量之间的角度反映的是它们的语义关系,而非几何伪影。
近期研究表明,这种各向同性假设在许多语言模型中并不成立:静态嵌入表现出占主导地位的均值方向(Mu和Viswanath,2018),上下文表示占据狭窄的锥形区域,具有接近1的成对相似度(Ethayarajh,2019),并且少数“异常维度”主导了Transformer中的余弦相似度(Timkey和Van Schijndel,2021)。尽管证据不断积累,各向异性对偏差测量的后果却出人意料地很少受到直接关注。
Wolfe等人(2024)最近引入了ML-EAT,它提供了一个全面的多层次评估框架,并正确地将各向异性视为基于余弦的偏差测试有效性的威胁。然而,ML-EAT的目的是提高EAT测量的可解释性,提出针对各向异性的校正方案不在其范围内。一种能够恢复基于余弦的偏差测量可靠性的几何条件的校准方法仍然是一个重大挑战。
在本文中,我们引入了一个校准步骤,从语言模型嵌入空间中移除各向异性,恢复基于余弦的偏差测量有效的各向同性假设。具体来说,我们提出ZCA(零相位分量分析)白化作为嵌入关联测试的预处理校准。ZCA白化将嵌入空间变换为具有单位协方差,同时最小化对原始向量的扰动,使其非常适合有效降低各向异性。此外,研究表明白化能够提升嵌入在标准语义相似度基准上的质量(Huang等人,2021;Su等人,2021),这表明校准后的嵌入空间可能更好地捕捉偏差测量所依赖的语义关联。
我们使用Caliskan等人(2017)的十个标准WEAT测试套件,在涵盖三个架构家族(静态、上下文和对比无监督模型)的七个嵌入模型上评估了我们的方法。我们做出以下贡献:
1. 我们提出ZCA白化作为一种新颖的嵌入关联测试预处理校准方法,并证明它能显著降低所有七个模型嵌入空间中的各向异性。
2. 我们证明校准空间中的余弦相似度在标准相似度基准上更忠实地捕捉语义关联,支持校准空间中偏差测量的有效性。
3. 我们系统地证明校准会在70个模型–任务组合上双向改变WEAT结果,在某些配置中降低测量到的关联,在其他配置中则增加关联。
## 2 相关工作
### 2.1 嵌入关联测试
Caliskan等人(2017)引入了词嵌入关联测试(WEAT),这是一种基于IAT设计(Greenwald等人,1998)的词嵌入内在偏差测量方法。WEAT量化了两个目标群体(如欧裔美国人和非裔美国人姓名)与两个属性群体(如愉快和不愉快词汇)之间的相对关联。给定目标集合X和Y以及属性集合A和B,每个目标词w的个体关联为:
s(w,A,B)=1|A|∑a∈Acos(w→,a→)−1|B|∑b∈Bcos(w→,b→)(1)
测试统计量聚合两个目标集合的个体关联:
S(X,Y,A,B)=∑x∈Xs(x,A,B)−∑y∈Ys(y,A,B)(2)
效应量d对该差异进行归一化:
d=meanx∈Xs(x,A,B)−meany∈Ys(y,A,B)stdw∈X∪Ys(w,A,B)(3)
该效应量类似于Cohen's d(Cohen,1992),其中0.2、0.5和0.8的值通常被解释为小、中、大效应。统计显著性通过单侧置换检验评估,其p值计算如下:
p=Pri[S(Xi,Yi,A,B)>S(X,Y,A,B)](4)
其中{(Xi,Yi)}表示X∪Y的所有等大小分区的集合。
自提出以来,WEAT已被扩展到各种模态和架构,以测量AI系统中的社会偏见。基于文本的变体包括用于单目标关联的SC-WEAT(Caliskan等人,2017)、用于句子级嵌入的SEAT(May等人,2019)、基于预训练目标的适配(Kurita等人,2019),以及将上下文化视为词级随机效应的CEAT(Guo和Caliskan,2021)。该框架还被扩展到文本之外,涵盖图像编码器(iEAT;Steed和Caliskan,2021)、基于视觉-语言模型(Grounded-WEAT;Ross等人,2021)、CLIP(Wolfe和Caliskan,2022;Wolfe等人,2022a;Radford等人,2021)、语音模型(SpEAT;Slaughter等人,2023)以及文本到视频生成器(VEAT;Sun等人,2026)。最近,Wolfe等人(2024)提出了ML-EAT,它提供了多层次可解释的偏差测量,并包含各向异性诊断。所有这些变体都依赖余弦相似度,因此都受到本文所讨论的相同几何伪影的影响。它们在NLP、计算机视觉和语音处理中的广泛采用,凸显了确保其测量在几何上可靠的重要性。
### 2.2 EAT在社会科学中的应用
嵌入关联测试已被社会科学界广泛采用,作为大规模研究社会现象的工具。越来越多的研究使用EAT来探究大型语料库中的当代文化模式,包括互联网英语中的性别默认和刻板印象(Caliskan等人,2022;Bailey等人,2022)、性别偏见与社会结构之间的关系(Napp,2023),以及维基百科中的时间变化(Schmahl等人,2020)。跨文化和跨语言研究已将其扩展到数十种语言(Lewis和Lupyan,2020;Charlesworth等人,2021;Mukherjee等人,2023)。历史语料库使得研究这些关联如何随时间演变成为可能,包括一个世纪的性别和种族刻板印象(Garg等人,2018)、200年的社会群体刻板印象(Charlesworth等人,2022)、交叉性刻板印象(Charlesworth等人,2024b;Borenstein等人,2023)、19至20世纪旅行文学中的仇外心理(Sunsay,2023),以及社会“道德圈”的扩展(Leach等人,2023)。总体而言,这些应用表明EAT不仅可以作为当代关联的度量,还可以作为追踪长期社会变迁的工具。
在应用领域,EAT已被用于测量生物医学研究(Rios等人,2020)、临床记录(Cobert等人,2024)、法律意见(Matthews等人,2022)和法庭程序(Dutta等人,2023)中的偏见。Gray和Wu(2025)进一步提出了SD-WEAT,这是一种处理多层次属性组的变体,用于医疗保健偏差基准测试。近期的研究还将基于嵌入的测量与人类层面的内隐关联联系起来,证明嵌入偏见与社会刻板印象之间存在有意义的对应关系(Charlesworth等人,2024a;Morehouse等人,2023;Manzini等人,2019)。这些多样的应用强调了EAT测量的有效性不仅仅是一个狭隘的技术问题,而是关乎多个学科科学诚信的问题。然而,一些研究已经识别出依赖嵌入向量间余弦相似度的方法的潜在问题,表明嵌入空间的几何性质可能影响此类测量的可靠性。
### 2.3 嵌入各向异性及其对WEAT的影响
词嵌入中的各向异性描述了一种几何性质,即向量聚集在嵌入空间的狭窄区域中(Cai等人,2021),导致任意词对之间的余弦相似度系统性偏高。Ethayarajh(2019)证明,来自BERT、ELMo和GPT-2的上下文表示占据狭窄的锥形区域,在上层中平均余弦相似度接近1.0,而Mu和Viswanath(2018)识别出word2vec和GloVe中的主导主成分,Timkey和Van Schijndel(2021)则表明少数“异常维度”主导了Transformer中的余弦计算。进一步的工作还记录了其他影响(Zhou等人,2022;Godey等人,2024;Machina和Mercer,2024;Rajaee和Pilehvar,2022)。相似文章
面向UWB感知与工作区域重建的几何感知基础设施锚定去噪器
本文提出了GAIA,一种面向UWB去噪与工作区域重建的几何感知学习框架,该框架将时序距离建模与潜在锚点布局估计相结合。在真实户外数据上的评估表明,GAIA将距离MSE降低了18.4%,并将多边形IoU相较于基线提高了15.5%,展示了在非视距条件下的有效边界级重建。
Zeta:基于坐标自适应预条件的矩阵优化双白化方法
Zeta 提出了一种双白化优化器,它首先应用坐标白化,再进行谱白化,以解决动量矩阵中的尺度异质性,从而降低正交化误差,并在大规模神经网络训练中改善收敛速度和泛化性能。
为何对齐评估需要校准(8分钟阅读)
本文认为,对齐评估(evals)需要进行适当的校准才能有意义,讨论了常见的陷阱和改进校准的技术。
从几何恢复到因果验证:稀疏自编码器特征的可重现审计,从叠加几何到因果惰性
本文使用因果干预对稀疏自编码器特征进行审计,发现在退化的SAE中最多77%的相关性恢复特征以及良好训练的SAE中9%的特征是因果惰性的。作者引入了sae-causal-audit工具用于可重现评估。
超越输出空间校准:时间序列分类中选择性可靠性估计的频谱证据捆绑
本文介绍SEB-Cal,一种通过频谱特征(频带能量、熵、峰值主导性、相位稳定性)增强输出空间校准的方法,以改善时间序列分类中的选择性可靠性估计,在多个数据集上实现更高的Corr-AUROC和更低的[email protected]。