基于认识论权利的LLM二阶偏见评估
摘要
本文介绍了“二阶偏见”,即LLM在判断有偏见内容时所表现出的偏见,并提出了一种基于认识论权利的推理任务来评估它。实验表明,该任务能够规避安全护栏,并揭示LLM评判者中系统性的群体偏见。
查看缓存全文
缓存时间: 2026/06/17 05:41
# 通过认知权利评估大语言模型的二阶偏见 来源:https://arxiv.org/html/2606.17506 Ramaravind Kommiya Mothilal¹、Terry Jingchen Zhang¹,²,³、Raiyan Ahmed¹、Zhijing Jin¹,²,³,⁴、Shion Guha¹、Syed Ishtiaque Ahmed¹ ¹多伦多大学 ²向量研究所 ³EuroSafeAI ⁴马克斯·普朗克智能系统研究所,德国蒂宾根 通讯作者:[email protected](https://arxiv.org/html/2606.17506v1/mailto:[email protected]) ###### 摘要 **警告:本文包含可能具有冒犯性或令人不安的偏见或有害文本。** 对LLM社会偏见的评估主要关注模型是否生成或暗示有偏见的内容。然而,随着LLM越来越多地被用作偏见的“评判者”,它们可能以更微妙的方式在其评估偏见内容时表现出社会偏见,而现有方法无法系统性地捕捉这一点。我们称之为**二阶偏见**:LLM在评判社会偏见时表现出的社会偏见。我们通过一项新颖的、具有哲学基础的推理任务来评估这种偏见。借鉴认识权利(Entitlement Epistemology),我们将偏见概念化为一种错位的基础知识,这种知识塑造了主体的理性探究,并推导出一个逻辑推理任务,让LLM判断一篇有偏见的文本对谁是可接受的或不可接受的。我们开发了两个简单的指标来衡量:LLM在推断人口统计特征以判断可接受性时,在没有充分支持的情况下表现出的偏见程度;以及这些推断如何因偏见文本所针对的群体而变化。通过评估开源和闭源模型,我们发现我们的任务通过揭示模型判断中的偏见,规避了安全护栏。这种偏见针对不同目标群体呈现出系统性变化,反映了隐含的社会认知图景,并展示了模型如何仍然被人口统计标签触发。我们的工作指出了在判断任务中评估LLM偏见的必要性,并广泛呼吁采用更具理论基础的方法来进行NLP中的偏见评估。我们在github.com/uofthcdslab/second-order-bias (https://github.com/uofthcdslab/second-order-bias) 上发布了我们的代码和模型响应。 # 通过认知权利评估LLM的二阶偏见 Ramaravind Kommiya Mothilal¹, Terry Jingchen Zhang¹,²,³, Raiyan Ahmed¹, Zhijing Jin¹,²,³,⁴, Shion Guha¹, Syed Ishtiaque Ahmed¹ ¹多伦多大学 ²向量研究所 ³EuroSafeAI ⁴马克斯·普朗克智能系统研究所,德国蒂宾根 通讯作者:[email protected] (https://arxiv.org/html/2606.17506v1/mailto:[email protected]) ## 1 引言 “LLM-as-a-judge”(LLM作为评判者)已成为评估LLM在开放式任务中表现的标准方法,尤其是在基于参考的指标不充分的情况下(Liet al. 2025 (https://arxiv.org/html/2606.17506#bib.bib54))。然而,LLM评判者并非中立的评估者,因为它们的判断可能受到与任务无关的特征的影响,例如措辞、呈现方式或顺序(Chenet al. 2024 (https://arxiv.org/html/2606.17506#bib.bib44); Shiet al. 2025 (https://arxiv.org/html/2606.17506#bib.bib46); Zhouet al. 2026 (https://arxiv.org/html/2606.17506#bib.bib16); Yeet al. 2025 (https://arxiv.org/html/2606.17506#bib.bib49))。当评估对象是**社会偏见**时,这引发了进一步的担忧:LLM评判者也可能在评判偏见内容的过程中再现社会偏见。 参见图注 图1:我们的**二阶偏见**评估任务。我们询问一篇有偏见的文本,在基于认知权利(Entitlement Epistemology)的逻辑条件下,对谁是可接受的或不可接受的。由于没有提供任何人口统计信息,认知上有保证且无偏见的响应是“未知”(左图)。任何人口统计特征的归因都反映了模型推断谁将接受或拒绝偏见文本的**错位权利**,表明模型判断中存在偏见(右图)。 我们将这种现象称为**二阶偏见**(second-order bias, sob):社会偏见并非出现在LLM直接生成偏见内容时,而是出现在其对这类内容的**判断**中。现有的偏见评估主要将LLM视为偏见的**主体**,检查模型是否生成或再现偏见(Gallegoset al. 2024 (https://arxiv.org/html/2606.17506#bib.bib52); Kumaret al. 2025 (https://arxiv.org/html/2606.17506#bib.bib53))。相比之下,sob关注的是LLM作为偏见评判者的角色:它们如何评估偏见内容,以及这些评估背后隐含了哪些社会假设。如果评判者本身依赖于有偏见的假设,它可能会掩盖、错误归因或合法化它本应评估的偏见(图1 (https://arxiv.org/html/2606.17506#S1.F1))。此后,我们使用**偏见**特指社会偏见,并广泛使用**社会偏见**指代关于社会群体的、会产生社会危害的无根据推断。 检测sob需要一项任务,要求LLM对社会偏见做出**判断**,并且该判断背后的社会假设是可观察的。然而,“评判偏见”的含义可能有所不同:可能涉及检测文本是否有偏见、识别其目标或类型、评估严重程度等。我们并不声称任何单一任务都能证明LLM在所有与偏见相关的判断中都是可靠的。相反,我们开发了一项诊断性任务,旨在使sob**可测量**。具体来说,给定一篇有偏见的文本,我们要求LLM评判者根据一组逻辑条件确定该文本对谁将是**可接受的**或**不可接受的**,如果它识别出一个人,则使用一组固定的人口统计变量来描述该人。该任务明确了一组社会假设,这些假设在基于LLM的偏见评估中可能仍然隐含:模型想象的接受或拒绝偏见内容的人是谁。图1 (https://arxiv.org/html/2606.17506#S1.F1) 说明了我们的任务。 我们通过一种新颖的哲学概念重构来得出这个任务。现有的NLP方法通常将偏见视为模型输出、关联或性能差异的属性;我们则开发了一个更适合评估关于偏见的**判断**的框架。借鉴认知权利(Entitlement Epistemology)(Wright and Davies 2004 (https://arxiv.org/html/2606.17506#bib.bib50); Greenough 2020 (https://arxiv.org/html/2606.17506#bib.bib17)),我们将社会偏见概念化为**错位的**认知权利,这些是“被接受”为给定的基础性假设,构成主体推理的基础,但它们是可以废除的,且缺乏认知基础。由于我们在输入中没有提供任何人口统计信息,我们任务中认知上理性的响应是“未知”;任何非“未知”的响应都表明模型对人口统计群体进行了无根据的推断。我们开发了两个简单的指标来捕捉这些逻辑归因谬误:针对无根据的可接受性和不可接受性。 实验表明,我们的评估任务通过揭示模型判断中的偏见,而非通过公然的偏见生成,规避了安全护栏。在多个模型中,出现了三种模式: - • **归因因目标而异**。某些目标群体比其他群体获得更多的人口统计归因,这可能导致针对特定群体的伤害被重新解读为更具社会意义的观点。 - • **模型依赖隐含的社会认知图景**。模型经常将目标群体与特定的主导群体进行对比,隐含地将这些关系作为评价偏见文本可接受性时未陈述的前提。 - • **关联性触发导致认知排斥**。模型有时会推断目标群体是针对自身偏见的接受者,或主导群体是主要的拒绝者,这表明目标群体并未被视为有理由拒绝指向他们自身偏见的理性认知主体。 论文的其余部分组织如下。我们首先回顾相关工作(§2 (https://arxiv.org/html/2606.17506#S2)),并介绍我们用于论证sob的理论框架(§3 (https://arxiv.org/html/2606.17506#S3))。接下来描述实验设置(§4 (https://arxiv.org/html/2606.17506#S4)),展示主要结果和分析(§5 (https://arxiv.org/html/2606.17506#S5)),最后总结对NLP中偏见评估的启示(§6 (https://arxiv.org/html/2606.17506#S6))。 ## 2 相关工作 | 认知权利 | 错位的认知权利 | |---|---| | “人们通常是值得信赖的” | “只有来自群体A的人通常是值得信赖的” | | 可观察证据 | 看起来主体S信守了承诺 | 看起来来自群体A的主体S信守了承诺 | | 普通经验主张 | 主体S是值得信赖的 | 来自群体A的主体S是值得信赖的 | | 基石命题 | 人们通常是值得信赖的 | 只有来自群体A的人通常是值得信赖的 | 表1:认知权利与错位权利的比较。在前者中,从可观察证据到经验主张的移动预设了基石命题;在后者中,同样的移动并不要求或证明错位命题,该命题仍然是可废除的。 **评估判断偏见**。关于LLM作为评判者的先前工作表明,模型判断可能对与任务无关的因素敏感,例如提示措辞(Hwanget al. 2026 (https://arxiv.org/html/2606.17506#bib.bib21))、顺序(Shiet al. 2025 (https://arxiv.org/html/2606.17506#bib.bib46); Wanget al. 2025a (https://arxiv.org/html/2606.17506#bib.bib45))、呈现方式(Chenet al. 2024 (https://arxiv.org/html/2606.17506#bib.bib44))、角色(Donget al. 2024 (https://arxiv.org/html/2606.17506#bib.bib43))或人口统计线索(Zhouet al. 2026 (https://arxiv.org/html/2606.17506#bib.bib16); Cantiniet al. 2025 (https://arxiv.org/html/2606.17506#bib.bib42))等(Parket al. 2024 (https://arxiv.org/html/2606.17506#bib.bib41); Yeet al. 2025 (https://arxiv.org/html/2606.17506#bib.bib49))。这些研究通常通过评估当提示中无关方面改变时评判者的决定是否发生变化来衡量判断偏见。相比之下,我们的工作考察一种**判断错误**的形式,侧重于评判者关于任务相关信息推理中的失败(Zhouet al. 2026 (https://arxiv.org/html/2606.17506#bib.bib16))。具体而言,我们测试模型在推理偏见内容时是否推断出无根据的人口统计归因。 **评估社会偏见**。大多数社会偏见评估研究将LLM视为偏见的主体(Goldfarb-Tarrantet al. 2023 (https://arxiv.org/html/2606.17506#bib.bib40); Gallegoset al. 2024 (https://arxiv.org/html/2606.17506#bib.bib52); Kumaret al. 2025 (https://arxiv.org/html/2606.17506#bib.bib53))。它们测试模型是否生成(Parrishet al. 2022 (https://arxiv.org/html/2606.17506#bib.bib39); Manerbaet al. 2024 (https://arxiv.org/html/2606.17506#bib.bib38))、关联(Nadeemet al. 2021 (https://arxiv.org/html/2606.17506#bib.bib37); Wanget al. 2025b (https://arxiv.org/html/2606.17506#bib.bib22))或暗示(Jaharaet al. 2025 (https://arxiv.org/html/2606.17506#bib.bib13); Guptaet al. 2024 (https://arxiv.org/html/2606.17506#bib.bib36))有偏见的内容,通常通过有害的生成、有偏见的补全或人口统计关联。我们的工作在三个方面有所不同。首先,这些文献中大部分借鉴了心理学对偏见的解释,特别是内隐联想测验(Greenwaldet al. 1998 (https://arxiv.org/html/2606.17506#bib.bib35)),并将偏见主要视为一种联想现象。我们则发展了一种认识论的解释,将偏见视为错位权利(§3 (https://arxiv.org/html/2606.17506#S3))。其次,我们评估LLM不是作为偏见内容的产生者,而是作为偏见内容的**评判者**,通过询问一篇有偏见的文本对谁是可接受的或不可接受的,这建立在最近评估LLM关于偏见和针对性毒性的判断的工作之上(Mothilalet al. 2026 (https://arxiv.org/html/2606.17506#bib.bib19); Liu and Chu 2025 (https://arxiv.org/html/2606.17506#bib.bib47); Kohet al. 2024 (https://arxiv.org/html/2606.17506#bib.bib18))。第三,与具有高阶结构的先前工作(例如Linet al. 2025 (https://arxiv.org/html/2606.17506#bib.bib51) 关于LLM偏见检测中的偏见)不同,我们的任务在评估偏见文本的可接受性时不依赖于真实标签。与我们的设置最接近的是Kumaret al. 2025 (https://arxiv.org/html/2606.17506#bib.bib53) 的研究,他们考察LLM将哪些群体与有毒文本的发言者相关联。然而,模型将群体与发言者“关联”意味着什么并不明确。在我们的任务中,归因与特定的认知判断相关联,我们接下来将对此进行解释。 ## 3 偏见作为错位的认知权利 认识论是哲学的一个分支,研究知识:它是什么,如何获取,以及它的局限是什么。在认识论内部,**权利**理论研究塑造知识和理性探究的基础性假设(Wright and Davies 2004 (https://arxiv.org/html/2606.17506#bib.bib50); Dretske 2000 (https://arxiv.org/html/2606.17506#bib.bib32); Burge and Peacocke 1996 (https://arxiv.org/html/2606.17506#bib.bib33); Peacocke 2004 (https://arxiv.org/html/2606.17506#bib.bib34))。我们借鉴Wright and Davies 2004 (https://arxiv.org/html/2606.17506#bib.bib50) 对权利的阐述和Greenough 2020 (https://arxiv.org/html/2606.17506#bib.bib17) 对其的系统发展,以区分认知权利与无根据的接受。这种区分为我们重新概念化社会偏见奠定了基础。§A (https://arxiv.org/html/2606.17506#A1) 提供了认识论术语的词汇表。 ### 3.1 认知权利 考虑表1中的命题“人们通常是值得信赖的”。Wright and Davies 2004 (https://arxiv.org/html/2606.17506#bib.bib50) 认为,这类作为普通社会推理基础的命题无法通过证据自圆其说地得到证明。为了在经验上证明这个命题,就需要证明可信性的可观察证据能够可靠地支持关于实际可信性的普通主张。但做出这一举动——从可观察的表象到经验主张——已经预设了可信行为的表象能够追踪实际的可信性。这正是我们试图证明的基础性命题。Wright and Davies 2004 (https://arxiv.org/html/2606.17506#bib.bib50) 将这种基础性命题称为“基石”:通过**权利**(entitlement)被“接受”的命题,这是一种不需要证据支持的理性保证。¹¹¹ 参见§B (https://arxiv.org/html/2606.17506#A2) 关于为何并非任何命题都能作为权利被接受的讨论。Greenough 2020 (https://arxiv.org/html/2606.17506#bib.bib17) 扩展了这一阐述,认为当外部世界以某种方式配合时——例如,当人们在社交环境中通常是可靠的时——权利不仅能产生保证,甚至能产生**知识**。因此,主体可以通过其内在状态以及世界的配合来“知道”这类命题。 ### 3.2 错位权利 在Greenough 2020 (https://arxiv.org/html/2606.17506#bib.bib17) 的扩展阐述中,权利不仅要求在没有证据工作的情况下接受基础性命题,还要求主体**缺乏**对相关对立命题的证明。²²²我们改编了Greenough 2020 (https://arxiv.org/html/2606.17506#bib.bib17) 的原始定义以推动我们对偏见的构想。详见§C (https://arxiv.org/html/2606.17506#A3)。基于此,我们通过两个属性来定义**错位的**认知权利。首先,对于持有它的人来说,它在内在上是有效的:它作为基础性命题发挥作用,并能够像认知权利一样支持社会推理。其次,与认知权利不同,它在认知理性探究下是可废除的,因为可用证据可以证明对立的命题。 因此,我们将社会偏见解释为这种错位权利。
相似文章
公平输出,偏见内部:大语言模型在高风险决策中潜在偏见的因果效力与非对称性
本文研究了指令微调的大语言模型如何在高风险决策(如抵押贷款承销)中表现出公平输出,同时保留有偏见的内部表征,表明这些隐藏偏见具有因果效力、非对称性,且可通过激活引导加以利用。
LLM中的条件性认知偏差:有偏见的用户轮次如何调节上下文推理
本文引入了一个三条件实验框架和一个包含24,300个提示的基准,研究在多轮交互中,有偏见的用户轮次如何调节前沿LLM中的认知偏差表达。研究发现,在大多数模型中,有偏见的对话上下文会放大偏差,而明确的偏差线索可能触发与对齐相关的抑制行为。
Chain-of-Models: Cross-Model Auditing for Bias-Robust LLM Judges
A research paper introducing Chain-of-Models (CoM), an automated pipeline where a second LLM audits a first model's reasoning trace to correct cognitive biases. It finds that auditor effectiveness depends on model family and bias type, and proposes a bias-specific auditor selection rule that improves judgment accuracy.
评估大语言模型中的区域偏见:从抽象刻板印象到具体社会决策
本文介绍了S2D,一个从抽象刻板印象到具体社会决策系统评估大语言模型中区域偏见的框架,涵盖中国全部34个省级行政区。结果表明,区域偏见普遍存在、系统化且影响深远,其模式与区域经济指标相关。
不透明的认知中介:LLM部署配置如何影响伪科学的验证
本文测试了不同LLM系列在不同时间和界面上如何评估族裔民族主义伪科学,发现认知立场取决于部署配置而非稳定的模型属性,引发了关于认知问责性的关切。