评判者身份的重要性:衡量LLM评审团中的家族条件偏好

arXiv cs.CL 论文

摘要

本文衡量了LLM作为法官面板中的家族条件偏好,发现与候选模型同族的评审者表现出显著的正向偏差,并引入了一个校正估计器来量化四个模型家族的这种效应。

arXiv:2609.17857v1 公告类型:新 摘要:谁是法官会影响LLM作为法官的结果,但在不与候选质量混淆的情况下衡量这种效应很困难。我们研究了四个开源权重家族(Llama 3.1, Qwen 2.5, Gemma 2, 和 Yi 1.5),采用完全交叉的成对设计,包含9,312次判断。一个常见的每族统计量与候选质量强烈混淆,并与Bradley-Terry能力的相关系数为r = 0.95。我们推导出一个校正估计器,该估计器固定候选家族并比较法官。所有四个家族都显示出正向的同族提升(3.4-8.4个百分点),全局FPS为0.067(95%置信区间[0.053, 0.084],排列p值=0.0002)。该效应在基于面板的质量控制、独立人类共识锚点和float16判断复制下仍然存在。法官侧的似然与该效应密切相关:添加似然优势使控制系数降低了61%,我们将其视为描述性衰减而非因果中介。位置是一个单独的失败模式。在整个面板中,55.4%的AB/BA对发生反转,且反转率超过50%与简单的独立内容噪声模型不兼容。相对于家族平衡参考,面板组成改变了18.5%的成对结果。一个完整的可重复性档案已准备好公开发布。
查看原文
查看缓存全文

缓存时间: 2026/09/17 09:01

# 谁担任评审重要:测量大语言模型评审组中的家族条件偏好
来源:https://arxiv.org/html/2609.17857
Luke E\. K\. Achenie††注:通讯作者\.Benjamin Tei Partey单位:Elvis Gyasi OwusuNii\-Nai Derrick Sowah

###### 摘要

评审者的身份可能影响大语言模型评审结果,但如何在不混淆候选人质量的情况下衡量这一效应是困难的。我们研究了四个开放权重家族(Llama 3\.1、Qwen 2\.5、Gemma 2 和 Yi 1\.5),采用完全交叉的两两设计,共进行了 9,312 次评审。一个常见的按家族统计量与候选人质量高度混淆,且与布拉德利-特里能力相关性达 r=0.95r=0.95。我们推导出一种修正估计量,将候选人家族固定以比较评审者。随后,所有四个家族都显示出正向的同家族提升(3\.4–8\.4 个百分点),全局 FPS 为 0.067(95% 置信区间 [0.053, 0.084],置换检验 p=0.0002p=0.0002)。该效应在基于面板的质量控制、独立的人类共识锚点和 float16 评审复现中依然存在。评审侧的可能性与效应密切相关:添加可能性优势使受控系数降低了 61%,我们认为这是一种描述性的衰减而非因果中介。位置是另一个失效模式。在整个评审组中,55\.4% 的 AB/BA 配对结果发生逆转,超过 50% 的逆转率与简单的内容噪声独立模型不符。相对于家族平衡的参考,面板组成改变了 18\.5% 的配对结果。完整的可复现性档案已准备公开发布。

## 1引言

大语言模型评审现已用于排序模型、选择偏好数据以及支持模型开发决策。这一用法假设在考虑了常规质量差异后,更换评审者不应系统性地改变哪个响应获胜。一个 Qwen 评审者和一个 Yi 评审者会在某些示例上产生分歧;关键问题在于是否一个评审家族会持续地为一个候选人家族提供额外支持。

我们在一个完全交叉的开放权重模型面板中测试这种模式。我们称之为*家族条件偏好*:当评审者来自同一模型家族时,对候选人的额外支持。没有评审者评估自己的生成内容,因此这不是普通的自我偏好,且评估环境是固定的评审面板,而非可能偏好泄露的训练流程。

已知评审者身份会影响评估结果。大语言模型评审表现出位置、冗长和自我增强偏差(Zheng 等人,2023 (https://arxiv.org/html/2609.17857#bib.bib25);Wang 等人,2024 (https://arxiv.org/html/2609.17857#bib.bib21);Shi 等人,2025 (https://arxiv.org/html/2609.17857#bib.bib15));有些评审者偏好自己的输出(Panickssery 等人,2024 (https://arxiv.org/html/2609.17857#bib.bib13);Liu 等人,2024 (https://arxiv.org/html/2609.17857#bib.bib10);Wataoka 等人,2024 (https://arxiv.org/html/2609.17857#bib.bib22))。家族亲和力也出现在逐点评分和基于评分标准的环境中(Spiliopoulou 等人,2025 (https://arxiv.org/html/2609.17857#bib.bib17);Pombal 等人,2026 (https://arxiv.org/html/2609.17857#bib.bib14)),而评审者与候选人之间的功能相似性可能改变分数(Goel 等人,2025 (https://arxiv.org/html/2609.17857#bib.bib4))。因此,我们专注于三个测量问题,而不是声称发现了家族相关的偏好本身。

#### 首先,在零和两两评审面板中应如何衡量家族偏好?

一个明显的统计量是比较评审者对自己家族的支持程度与其他候选人家族的支持程度。在零和两两面板中,这种比较将候选人质量与评审者-候选人交互作用混合在一起。这在我们的数据中问题很大:按行统计量与布拉德利-特里能力相关性达 r=0.95r=0.95。它使 Qwen 看起来偏差很强(+0.160+0.160),而 Yi 几乎无偏差(−0.004−0.004)。相反,我们固定候选人家族并比较评审者:*相同的候选人是否从其同家族评审者那里获得了比其他评审者更多的支持?*这种按列比较消除了候选人主要效应。由此产生的提升对所有四个家族均为正,范围从 0\.034 到 0.084。

#### 其次,该效应是否在质量控制后依然存在?

我们接下来测试测量到的质量差异是否解释了该结果。一个嵌套的分数对数分析添加了布拉德利-特里质量、风格相似性、响应长度、候选人侧取向和家族固定效应,同家族系数变化不大;一个独立的拟二项 GEE 提供了相关结构稳健性检查。由于几个控制来自审核的面板,我们还使用盲审人类共识作为独立锚点;在匹配子集上,添加人类标签使系数从 0.370 变为 0.382。一个独立的 float16 评审运行给出全局系数 0.066,而主量化栈为 0.067。

#### 第三,评审者-候选人对的哪些可测量属性与该效应相关?

一个合理的解释是熟悉度:评审者可能偏好他们觉得更容易预测的文本(Wataoka 等人,2024 (https://arxiv.org/html/2609.17857#bib.bib22);Stureborg 等人,2024 (https://arxiv.org/html/2609.17857#bib.bib18);Oi 等人,2024 (https://arxiv.org/html/2609.17857#bib.bib12))。同家族响应的平均每个令牌对数概率比跨家族响应高 0\.69 自然对数单位。在完全控制模型中添加评审侧的可能性优势,使同家族系数从 0\.299 降至 0.116,衰减了 61%,同时可能性优势强烈预测支持度(β=0.144β=0.144,p=7×10−6p=7\times 10^{-6})。我们认为这是描述性的而非因果的,并且一个较小的显著家族效应仍然存在。

位置不稳定性是另一个问题。在整个面板中,55\.4% 的 AB/BA 配对选择了不同的获胜者,其中 Gemma 为 78.8%。一个简单的独立对称内容噪声模型无法产生超过 50% 的逆转率,因此更高的比率表明存在系统性的顺序依赖性。平衡抵消可以取消纯粹的位置跟随,但逆转的配对会变为平局,并且这些配对上的任何真实家族偏好信号都会丢失。因此,位置偏差和家族偏好需要不同的诊断方法。

该效应在实践中也足够重要。6\.7 个百分点的全局提升超过了此处使用的 AlpacaEval 2\.0 快照前 10 名中 9 个相邻长度控制胜率差距中的 8 个,其中位数相邻差距为 1.09 个百分点。用于此比较的确切参考表包含在准备好的可复现性档案中。这只是一个尺度比较,并非声称我们的面板复现或重新排序 AlpacaEval。相对于家族平衡的参考,面板组成改变了 18\.5% 的配对结果。

#### 贡献。

本文贡献了五项证据和方法:

- • 我们展示了为什么自然的按行家族对比与候选人质量混淆,并给出一个隔离评审者-候选人家族交互的按列估计量。
- • 使用修正后的估计量,每个测试家族都具有正向且单独显著的同家族提升。所有四个家族在独立的 float16 评审栈下也正向复现。
- • 我们使用面板推导的控制、非对角线布拉德利-特里估计和独立的人类共识锚点检查质量。
- • 我们测量了一个可能性-熟悉度通道。评审侧的可能性优势与支持度密切相关,并使受控同家族系数降低了 61%,同时显著的残余仍然存在。
- • 我们将位置不稳定性视为一个单独的问题,并展示了为什么平衡抵消可以移除位置跟随,同时也会衰减逆转配对上的真实偏好信号。

## 2相关工作

#### 大语言模型评审作为测量工具。

早期的大语言模型评审工作报告了与位置、冗长和自我增强偏差并存的高人类一致性(Zheng 等人,2023 (https://arxiv.org/html/2609.17857#bib.bib25))。后续研究表明,响应顺序可能改变两两排序(Wang 等人,2024 (https://arxiv.org/html/2609.17857#bib.bib21)),并开发了更直接的位置偏差诊断方法(Shi 等人,2025 (https://arxiv.org/html/2609.17857#bib.bib15))。近期工作将评审者本身视为需要审计的测量系统的一部分(Yang 等人,2026b (https://arxiv.org/html/2609.17857#bib.bib24);Usami 等人,2026 (https://arxiv.org/html/2609.17857#bib.bib19));JudgeArena 同样使评审者和后端可替换,同时保留详细元数据(Lushtaku 等人,2026 (https://arxiv.org/html/2609.17857#bib.bib11))。我们的完全交叉设计遵循这一观点,将评审者来源视为实验因素。

#### 自我偏好、家族偏好与质量混淆。

自我偏好研究探讨评审者是否偏好自己的生成内容(Panickssery 等人,2024 (https://arxiv.org/html/2609.17857#bib.bib13);Liu 等人,2024 (https://arxiv.org/html/2609.17857#bib.bib10);Wataoka 等人,2024 (https://arxiv.org/html/2609.17857#bib.bib22);Yang 等人,2026a (https://arxiv.org/html/2609.17857#bib.bib23));我们的评审者从不评分自己的输出,因此相关的重叠是家族层面的。质量调整也很关键。Chen 等人 (2025a) (https://arxiv.org/html/2609.17857#bib.bib1) 使用可验证任务将有害的自我偏好与真正更好的同家族输出区分开来,而 Chen 等人 (2025b) (https://arxiv.org/html/2609.17857#bib.bib2) 表明,简单的差异可能将偏差与响应质量混合。Spiliopoulou 等人 (2025) (https://arxiv.org/html/2609.17857#bib.bib17) 调整了完成质量并报告了家族偏差,而 Pombal 等人 (2026) (https://arxiv.org/html/2609.17857#bib.bib14) 在基于评分标准的评估中发现了同家族偏好。在我们完全交叉的零和两两面板中,这个问题表现为一个特定的按家族识别错误,无需为每个响应提供黄金分数即可修正。

#### 相似性、熟悉度与可能性。

相似性提供了一种可能的解释。Goel 等人 (2025) (https://arxiv.org/html/2609.17857#bib.bib4) 发现评审者偏好功能相似的模型,将关注点扩展到了精确的自我偏好之外。其他工作将自我偏好与困惑度联系起来(Wataoka 等人,2024 (https://arxiv.org/html/2609.17857#bib.bib22)),将熟悉度与评审者不一致性联系起来(Stureborg 等人,2024 (https://arxiv.org/html/2609.17857#bib.bib18)),以及将可能性与有偏评估联系起来(Oi 等人,2024 (https://arxiv.org/html/2609.17857#bib.bib12))。因此,我们记录每个候选人响应的评审侧令牌可能性,并衡量当添加此信号时受控家族系数的变化。

#### 面板、相关误差与流程效应。

面板可以减少单一评审者误差,但无法消除评审者之间的依赖性。多样化的评审团可以优于单个评审者(Verga 等人,2024 (https://arxiv.org/html/2609.17857#bib.bib20)),但相关误差会降低面板的有效多样性(Kohli,2026 (https://arxiv.org/html/2609.17857#bib.bib6))。当评估者和合成数据源重叠时,偏好泄露在训练期间会产生相关的来源问题(Li 等人,2026 (https://arxiv.org/html/2609.17857#bib.bib8))。我们研究的是评估:相对于家族平衡的参考,面板组成如何改变两两决策。同期的缓解工作同样发现,可靠性取决于评审者、提示和偏差控制策略(Yang 等人,2026a (https://arxiv.org/html/2609.17857#bib.bib23);Soumik,2026 (https://arxiv.org/html/2609.17857#bib.bib16))。

#### 定位。

先前的工作确立了评估者来源重要的几条路径。我们的主张更窄:在完全交叉的零和两两面板中,我们修正了一个按家族的测量错误,展示了所有四个测试家族的正向修正提升,将大部分受控系数与评审侧可能性联系起来,并将该结果与位置不稳定性区分开来。

## 3实验设计

#### 面板。

面板包含四个开放权重家族,每个家族有两个规模:Llama 3\.1 (70B/8B)、Qwen 2.5 (72B/7B)、Gemma 2 (27B/9B) 和 Yi 1.5 (34B/9B)。主栈使用 GGUF Q4\_K\_M 模型和llama\-cpp\-python,没有专有 API。Falcon 40B 进行了试点,但在 FPS 计算前根据预设标准被排除在主四模型之外:其评审者平局率为 88.5%,而保留面板平均值为 3.4%;其平均候选人支持度为 0.063,而其他为 0.56–0.65。因此包含 Falcon 会将主要响应健康/质量问题与偏好量混合。完整五模型结果仅作为规格曲线敏感性证据出现(附录A (https://arxiv.org/html/2609.17857#A1))。

#### 提示。

一个带时间戳的分层划分在分析前将 200 个提示分配为 134 个探索性和 66 个确认性项目。六个提示,两个探索性和四个确认性,未能通过预设的响应健康检查,因为至少一个候选人响应未满足所需的长度/质量条件。主集合包含 194 个提示:132 个探索性和 62 个确认性,来自 MT\-Bench(78)、AlpacaEval 2\.0(68)和 WildBench(48),涵盖 12 个任务类别(Zheng 等人,2023 (https://arxiv.org/html/2609.17857#bib.bib25);Dubois 等人,2024 (https://arxiv.org/html/2609.17857#bib.bib3);Lin 等人,2025 (https://arxiv.org/html/2609.17857#bib.bib9))。划分和健康过滤文件包含在发布中。

#### 完全交叉试验。

每个评审家族在两种响应顺序下评估每个无序候选人家族对。该设计包含

194提示×6对×2顺序×4评审者=9,312
这产生了 9,312 个原始试验和 4,656 个协调后的评审者-提示-配对观测值。16 个评审者×候选人单元格中的每一个恰好有 582 个观测值。因此,矩阵估计器不依赖于不等的单元格计数。

#### AB/BA 协调。

对于每个焦点候选人,一个特定顺序的判决编码为 w∈{0,0\.5,1}w∈\{0,0.5,1\},之后将 AB 和 BA 对齐到相同焦点方向并取平均值。如果两个顺序指定了不同的获胜者,则协调后的分数为 s=0.5s=0.5。原始顺序依赖性很显著:首位 A 的率为 0.778,AB/BA 一致性为 0.446。因此,我们不使用单次呈现估计作为主要证据;第8节 (https://arxiv.org/html/2609.17857#S8) 解释了协调移除了什么以及它可能丢弃什么信号。

#### 评审侧可能性。

对于每个试验,我们使用前 400 个字符计算评审者对每个候选人响应的教师强制平均每个令牌对数概率。这为每个响应添加了一次前向传播,并给出了第7节 (https://arxiv.org/html/2609.17857#S7) 中使用的熟悉度度量。

#### 人类参考集。

三位研究生级别的自然语言处理研究员对 400 个盲审两两项目进行了 A/B/平局 标注,置信度为 1–5,按所有六个候选人家族对分层,来源隐藏。在 FPS 分析前,根据预设质量标准排除了一位标注者(附录B (https://arxiv.org/html/2609.17857#A2))。两位保留的标注者在 266 个项目上达成共识(Cohen’s κ=0.482κ=0.482;66.5% 精确一致)。在这些项目上,面板在 57.1% 的情况下与人类共识匹配,比 42.1% 的多数

相似文章

我让55个LLM互相盲评(22k条评价,全部公开)。每个有足够数据的模型家族都偏向自家兄弟。Qwen的评委给Qwen加分约0.9分。Mistral给自己的扣分约1.0分。

Reddit r/LocalLLaMA

一个包含55个LLM互相盲评的公开评估设置揭示了8个模型家族中统计显著的同类家族评分偏差,其中Mistral对自己模型的扣分最为严重。该研究指出了聚合排行榜的问题,并提出了改进方法,如使用响应内混合效应模型。

换一个裁判,分数就变了:审计大模型作为裁判的可靠性

arXiv cs.CL

本文审计了大模型作为裁判(LLM-as-judge)评估的可靠性,表明即使候选回复固定不变,更换评估模型也可能改变评分。论文考察了Qwen3和MiniMax模型的扩展与升级路径,得出结论:裁判升级不可互换,并提出了最佳报告实践。

评判电路

arXiv cs.CL

本文研究了LLM-as-a-judge的内部机制,发现模型在中期到后期的多层感知机(MLP)中共享一个稀疏的潜在评估器子图,该子图处理抽象评判,而格式特定的终端分支将评判映射到输出令牌,揭示了格式导致的不一致性的原因。