自我与他者标签在LLM评审中引发双向偏见
摘要
本文研究了由自我与他者标签在LLM评审中引发的双向偏见,表明仅标签就能改变评估分数,无论实际来源如何,这对理解作者归属和受控评估任务有贡献。
arXiv:2608.18091v1 公告类型:新
摘要:随着LLM作为评审系统的日益普及,LLM中的自我偏好——倾向于偏爱自己的输出——引发了对评估可靠性的日益关注。然而,这主要是在生成文本上研究的,其中风格特征和响应质量不可避免地混杂。因此,现有测量无法将真正的自我偏好与这些混淆因素分开。我们通过改变评估对象来解决这个问题:不判断生成文本,而是让十个LLM评估叙事约束选择,这些选择没有模型特定的风格指纹,但保留了可恢复的模型特定签名。我们进行了两个实验,得出不同发现。在盲评下,一旦控制选择质量和评估者严格性,自我偏好基本消失。它在四个评分标准维度中的三个上消失,并在第四个上反转,评审者认为自己的选择原创性较低。然而,在匹配质量下,仅自我与他者标签——不命名任何模型——就能双向改变分数:LLM评审者为自我标签的选择提高分数,为他者标签的选择降低分数,无论选择的实际来源如何。我们做出两个贡献:1)作者归属是评估偏见的一个独特驱动因素,2)开放式、无真实标准的任务可作为研究LLM评审行为的受控工具。
查看缓存全文
缓存时间: 2026/08/20 09:53
# 自我标签与他者标签在LLM评审中引发双向偏差
来源: https://arxiv.org/html/2608.18091
Songeun Chae, Min Kim, Donghoon Jung, Seojin Choi, Seohyon Jung
韩国KAIST数字人文与计算社会科学学院
\{songeun, mk, donghoon\.jung, seojin64, seohyon\.jung\}@kaist\.ac\.kr
###### 摘要
随着“大语言模型即评审员”系统的日益普及,LLM的自我偏好——倾向于偏爱自身输出的倾向——引发了对评估可靠性的日益关注。然而,现有研究主要聚焦于生成的文本,其中文体特征与响应质量不可避免地相互交织。因此,当前的测量方法无法将真正的自我偏好与这些混杂因素区分开来。我们通过改变评估对象来解决这个问题:不评判生成的文本,而是让10个LLM评估叙事约束选择——这些选择没有特定模型的文体指纹,但保留了可恢复的模型特定签名。我们进行了两项实验,得出了不同的发现。在盲评条件下,一旦控制了选择质量和评审员的严格程度,自我偏好基本消失。在四个评分标准维度中的三个上它消失了,并在第四个维度上发生了逆转——评审员将自己的选择评为原创性较低。然而,在匹配质量的条件下,仅凭自我标签和他者标签——无需指明任何模型名称——就使分数发生了双向偏移:LLM评审员对自我标签的选择会提高分数,对他者标签的选择则降低分数,而不论选择的实际来源如何。我们做出了两项贡献:1)作者归属是评估偏差的一个独立驱动因素;2)开放式的、无标准答案的任务可作为研究LLM评审员行为的受控工具。
自我标签与他者标签在LLM评审中引发双向偏差
Songeun Chae, Min Kim, Donghoon Jung, Seojin Choi, Seohyon Jung††thanks:通讯作者。韩国KAIST数字人文与计算社会科学学院\{songeun, mk, donghoon\.jung, seojin64, seohyon\.jung\}@kaist\.ac\.kr
## 1引言
“大语言模型即评审员”已成为一种广泛采用的范式,用于在各种任务中进行可扩展的评估,使用大语言模型(LLMs)作为自动评估者(Guet al., 2026 (https://arxiv.org/html/2608.18091#bib.bib24))。尽管应用广泛,但最近的研究表明LLM评审员表现出系统性偏差(Shi et al., 2025 (https://arxiv.org/html/2608.18091#bib.bib17); Ye et al., 2025 (https://arxiv.org/html/2608.18091#bib.bib8))。一个尤其令人担忧的偏差是自我偏好,即LLM评审员对自己的输出给予比其他模型输出更高的评价(Wataoka et al., 2024 (https://arxiv.org/html/2608.18091#bib.bib12); Panickssery et al., 2024 (https://arxiv.org/html/2608.18091#bib.bib18))。先前的工作研究了自我偏好的隐含来源,包括低困惑度(Wataoka et al., 2024 (https://arxiv.org/html/2608.18091#bib.bib12))和自我识别(Panickssery et al., 2024 (https://arxiv.org/html/2608.18091#bib.bib18))。Saraf等人(2025 (https://arxiv.org/html/2608.18091#bib.bib26))研究了一个显式因素——作者标签——通过操纵三个商业LLM的标签,发现Claude标签加剧了自我偏好。参见标题图1:实验设计。十个LLM参与双重角色:作为**选择者**,通过约束选择任务构建评估目标;作为**评审员**,根据四轴标准评估这些选择。每个选择在两种条件下接受评审:盲评(无来源标签)和标签评,其中来源归属在2×2设计中被实验性地操纵,交叉组合了标签真实性(TL = 真,FL = 假)和声称来源(自我 vs. 他者)。最近的研究进一步揭示了测量自我偏好时的方法学混杂因素。例如,Chen等人(2025a (https://arxiv.org/html/2608.18091#bib.bib2), b (https://arxiv.org/html/2608.18091#bib.bib14))认为,现有测量将响应质量与真正的自我偏好混为一谈。Roytburg等人(2026 (https://arxiv.org/html/2608.18091#bib.bib21))将观察到的自我偏好中近90%归因于评审员的不确定性——即评审员可靠评估响应质量的能力有限。这引发了两个问题:首先,一旦控制了表面线索和混杂因素,自我偏好是否仍然存在?其次,在相同控制下,仅凭自我/他者标签能否诱发自我偏好?为了解决这些问题,我们引入了一种基于创造性选择任务的新型实验设计。十个LLM评审员评估从预构建的200个叙事约束池中选择的约束集合,而非评估模型生成的文本,并在盲评和标签评两种条件下进行。我们的结果显示,尽管大多数LLM对其自身选择的平均评分更高,但一旦控制了输出质量和评审员严格程度,这种表面上的自我偏好基本消失。此外,仅凭作者标签就能使评估发生双向偏移——评审员在自我标签下提高分数,同时在他者标签下降低分数——即使评估目标完全相同。我们的贡献是双重的。首先,我们提供了直接证据,表明仅凭自我/他者标签就能在LLM评审员中诱发双向评估偏差。由于我们的设计消除了文体混杂因素并控制了输出质量,我们可以展示表面上的自我偏好基本消失,这表明先前的工作夸大了其影响。其次,通过利用创造性任务作为评估LLM偏差的试验场,我们表明开放式的、无标准答案的任务可作为研究LLM评审员行为的受控工具。
## 2相关工作
### 2.1大语言模型即评审员与评估偏差
LLMs越来越多地被部署为各种评估任务中的评估者,例如成对比较和直接评分(Saunders et al., 2022 (https://arxiv.org/html/2608.18091#bib.bib10); Liu et al., 2023 (https://arxiv.org/html/2608.18091#bib.bib5); Bai et al., 2023 (https://arxiv.org/html/2608.18091#bib.bib6); Li et al., 2025 (https://arxiv.org/html/2608.18091#bib.bib4))。然而,先前的工作已经确定了系统性偏差,这些偏差损害了“大语言模型即评审员”的可靠性。位置偏差——评审员倾向于根据响应的顺序而非质量来偏好某个响应——是研究最为广泛的偏差之一(Zheng et al., 2023 (https://arxiv.org/html/2608.18091#bib.bib1); Wang et al., 2024 (https://arxiv.org/html/2608.18091#bib.bib9); Shi et al., 2025 (https://arxiv.org/html/2608.18091#bib.bib17))。Koo等人(2024 (https://arxiv.org/html/2608.18091#bib.bib7))考察了LLM评估者的六种认知偏差,包括注意力偏差和从众效应,而Ye等人(2025 (https://arxiv.org/html/2608.18091#bib.bib8))记录了更广泛的偏差,表明评审员还偏好基于冗长度和情感倾向的响应。在这些偏差中,*自我偏好*(Panickssery et al., 2024 (https://arxiv.org/html/2608.18091#bib.bib18); Liu et al., 2024 (https://arxiv.org/html/2608.18091#bib.bib16); Pombe et al., 2026 (https://arxiv.org/html/2608.18091#bib.bib13))——也称为自我增强偏差(Zheng et al., 2023 (https://arxiv.org/html/2608.18091#bib.bib1))——指的是LLM评审员倾向于偏好自己的输出而非其他模型的输出。这种偏差尤其令人担忧,因为它可能直接影响基于LLM的评估的有效性,从而推动了对其的深入研究。
### 2.2LLM自我偏好的来源与混杂因素
尽管自我偏好已在不同的评估领域得到证实(Mahbub and Feng, 2026 (https://arxiv.org/html/2608.18091#bib.bib15); Pombe et al., 2026 (https://arxiv.org/html/2608.18091#bib.bib13)),但其根本来源仍存在争议。Panickssery等人(2024 (https://arxiv.org/html/2608.18091#bib.bib18))发现自我识别能力与自我偏好强度之间存在正相关,而Wataoka等人(2024 (https://arxiv.org/html/2608.18091#bib.bib12))将自我偏好归因于熟悉效应,即评审员偏好低困惑度的输出。最近的研究提出了一个更根本的问题:这种效应是否反映了真正的偏差。Chen等人(2025b (https://arxiv.org/html/2608.18091#bib.bib14))表明,现有测量将自我偏好与响应质量混为一谈;Chen等人(2025a (https://arxiv.org/html/2608.18091#bib.bib2))认为,虽然更强的模型表现出更强的自我偏好,但这种偏好在很大程度上反映了它们客观上更优的输出质量。值得注意的是,Roytburg等人(2026 (https://arxiv.org/html/2608.18091#bib.bib21))将测量到的自我偏好中约90%归因于评审员的不确定性,表明评审员评估更困难查询的难度夸大了表面上的自我偏好率。综上所述,大多数报告的自我偏好可能源于测量混杂因素,但任何残余偏差背后的机制仍存在争议。
### 2.3作者标签与自我偏好
另一条研究思路考察了作者标签是否能改变基于LLM的评估。Sun等人(2026 (https://arxiv.org/html/2608.18091#bib.bib22))揭示LLM评审员更关注作者标签而非内容本身,将其用作评估的快捷方式。Marioriyade等人(2025 (https://arxiv.org/html/2608.18091#bib.bib23))发现作者标签存在偏好层级(专家 >> 人类 > LLM > 未知)。与我们的工作最相关的是,Saraf等人(2025 (https://arxiv.org/html/2608.18091#bib.bib26))在三个商业LLM评审员中测试了标签诱发的偏差,条件包括无归属、真实归属和两种虚假归属。Claude标签提升了分数,而Gemini标签降低了分数,导致Claude出现明显的自我偏好,而Gemini出现自我贬低。然而,由于评估内容是由LLM生成的博客文章,这些效应仍然与文体指纹、困惑度和输出质量混杂在一起,使得自我识别成为自我偏好的潜在驱动因素。更关键的是,由于标签是真实的模型名称,目前尚不清楚观察到的偏移反映的是自我偏好还是模型声誉效应。
## 3方法论
为了解决先前工作的局限性,我们采用叙事选择任务来生成评估目标。然后我们提示LLM评审员在盲评和标签评两种设置下,根据四维度标准评估这些选择。十个LLM同时担任选择者和评审员:五个商业模型(Claude Opus 4.7, Gemini 3.1 Pro, GPT-5.5, Grok 4.3, 和 Qwen3.6-Plus)和五个开源模型(DeepSeek-V4-Pro, Kimi K2.6, Llama 4 Maverick, Mistral Large 3, 和 Qwen3.6-35B-A3B)(见附录A (https://arxiv.org/html/2608.18091#A1))。
### 3.1叙事约束选择任务
我们不依赖基于文本的评估和事后风格控制,而是通过改变评估目标的类型来消除模型特定的文体特征:LLM评审员评估结构化的叙事选择。为了生成这些输出,我们提示每个LLM执行30次选择任务,为每个模型提供足够的跨次运行覆盖。在每次运行中,LLM从一组精心策划的200个叙事约束(Jung et al., 2025 (https://arxiv.org/html/2608.18091#bib.bib27))中选择20个它认为对构建单个故事最有用的项目——每个约束都是预先写好的、关于事件、风格、角色或场景的单句描述(见图2 (https://arxiv.org/html/2608.18091#S3.F2))。这种设计有两个优点。首先,用词、句子结构和措辞保持恒定,防止模型特定的文体特征影响评估。其次,创造性任务为检测LLM评审偏差提供了一个敏感的试验场,因为这种偏差在主观、开放的领域往往更为突出(Marioriyade et al., 2025 (https://arxiv.org/html/2608.18091#bib.bib23); Fein et al., 2026 (https://arxiv.org/html/2608.18091#bib.bib25))。参见标题图2:叙事约束选择任务,改编自Jung等人(2025 (https://arxiv.org/html/2608.18091#bib.bib27))。该池包含来自该工作的200个单句约束,分为四类。在每次运行中,LLM可以自由地从完整池中选择任何20个约束,没有类别配额限制。所有十个模型各执行30次运行,总共产生300个约束集,作为评估目标。分析选择结果表明,每个模型都从约束池的特定区域进行抽取。模型内Jaccard相似度(Broder, 1997 (https://arxiv.org/html/2608.18091#bib.bib29))在所有十个模型中都超过偶然水平,表明每个LLM都表现出一致的选择模式(见图3 (https://arxiv.org/html/2608.18091#S3.F3); 附录E (https://arxiv.org/html/2608.18091#A5)获取数值)。此外,留一法k-NN分类器(k=5k=5)以50.7%的准确率识别源模型——这是10%偶然基线(在k∈{1,3,5,7}k\\in\\\{1,3,5,7\\\}下稳定在46.7–50.7%)的五倍多(见附录D (https://arxiv.org/html/2608.18091#A4))。综合这些分析表明,当模型特定的文体线索被设计消除后,LLMs仍保持不同的选择模式,这为有意义的自我与他者比较提供了必要的变异。
参见标题图3:按模型划分的选择模式(300个选择),通过多维尺度分析(MDS)投影(Borg and Groenen, 2005 (https://arxiv.org/html/2608.18091#bib.bib28))。每个子图突出显示一个模型的选择与完整集合的对比;模型按模型内Jaccard相似度(降序)排列。
### 3.2评估程序
#### 3.2.1评分标准
每个选择集在四个维度上以7点李克特量表进行评估:原创性、维度性、连贯性和可叙述性。该标准并非作为叙事质量的详尽或验证性测量,而是一个结构化的解释性框架。通过引导每位评审员评估特定的、基于理论的属性,而非自行选择关注哪些方面,该框架减少了评估的随意性,并使得评审员行为可以在概念上不同的维度上进行分解(完整的评分标准及锚点描述和理论依据见附录B (https://arxiv.org/html/2608.18091#A2))。
#### 3.2.2实验一:盲评
##### 设置。 在实验一中,每个模型作为评审员,在无标签条件下评估所有300个选择。每位评审员返回一个JSON对象,其中包含每个维度的1-7整数分数和2-3句理由。为了减少LLM评分中的随机变异性,每位评审员评估每个选择三次,产生10位评审员×300个选择×3次重复=9,00010\\text\{ 评审员\}\\times 300\\text\{ 选择\}\\times 3\\text\{ 重复\}=9\{,\}000次运行。在每次运行中,选择中20个约束的顺序和四个评分标准维度的顺序都通过每次运行的种子独立打乱,以减轻潜在的排序偏差。完整的评估提示和响应格式见附录C (https://arxiv.org/html/2608.18091#A3)。
##### 原始自我-他者比较。 对于每位评审员,我们比较其赋予自身选择与其他模型产生的选择的平均分,并报告平均分和每个评分标准维度的差异。这种简单比较既未控制选择者的质量,也未控制评审员的严格程度;它作为基线,用于解释后续控制了混杂因素的分析。
##### 控制混杂因素的估计。 为了检验在控制测量混杂因素后自我偏好是否仍然存在,我们拟合了一个混合...相似文章
基于认识论权利的LLM二阶偏见评估
本文介绍了“二阶偏见”,即LLM在判断有偏见内容时所表现出的偏见,并提出了一种基于认识论权利的推理任务来评估它。实验表明,该任务能够规避安全护栏,并揭示LLM评判者中系统性的群体偏见。
LLMs判断能力是否强于生成能力?评估上下文问答中的任务不对称性、机制可解释性与可迁移性
本文测试了LLMs在上下文问答中判断能力优于生成能力的假设,发现在大多数基准上生成准确率超过自我评估,且评估过程对上下文的关注较少。这些发现挑战了自我评估流程中的核心假设。
MM-JudgeBias:评测 MLLM-as-a-Judge 组合偏差的基准
研究者发布 MM-JudgeBias 基准,揭示多模态大模型在充当自动评判器时的系统性组合偏差,对 26 个 SOTA MLLM 在 1,800 条样本上进行测试。
LLM作为评判者在16次评估中有10次固定在一个置信值上。要求提供标签解决了这个问题。
一个LLM评判者在评估中持续返回固定的置信分数0.72,但切换到分类标签改善了分数分布,表明模型在分类方面比数值估计更适合评估。
公平输出,偏见内部:大语言模型在高风险决策中潜在偏见的因果效力与非对称性
本文研究了指令微调的大语言模型如何在高风险决策(如抵押贷款承销)中表现出公平输出,同时保留有偏见的内部表征,表明这些隐藏偏见具有因果效力、非对称性,且可通过激活引导加以利用。