通过随机数生成缓解 LLM-as-a-Judge 中的评分偏差

arXiv cs.CL 论文

摘要

本文提出了一种新方法,通过让 LLM 随机生成数字来测量其潜在的数字偏差,并据此修正 token 生成概率,从而缓解 LLM-as-a-Judge 中的评分偏差。在四个任务上的实验表明,该方法优于基线方法,并揭示了评分偏差在不同模型、任务和分数区间上的差异。

arXiv:2608.05726v1 公告类型:新论文 摘要:大型语言模型(LLM)常被用作文本质量的评估器,即 LLM-as-a-Judge,其表现可优于依赖参考文本的传统自动评估指标。然而,LLM 评估器往往倾向于生成特定分数,而不考虑被评估文本的上下文,这被称为评分偏差。本研究提出了一种缓解该评分偏差的新方法。通过指示 LLM 随机生成数字 token,并测量数字观测分布与均匀分布之间的偏差,可以识别 LLM 潜在的数值偏差。为了测量特定任务下的潜在数字偏差,在随机数生成的提示中加入了使用 LLM 评估器的下游任务定义。在 LLM 评估过程中,针对给定输入的 token 生成概率会根据 LLM 的潜在数字偏差进行修正。在四个不同任务(LLM 对齐评估、摘要评估、语义文本相似度和语义文本相关性)上的实验结果表明,我们提出的方法优于基线方法,包括未去偏的 LLM 和先前的校准方法。此外,研究还证实评分偏差因 LLM、任务和分数区间而异,这表明按具体情况测量潜在数字偏差具有重要意义。
查看原文
查看缓存全文

缓存时间: 2026/08/07 07:51

# 通过随机数生成缓解 LLM-as-a-Judge 中的评分偏差
来源:https://arxiv.org/html/2608.05726
11日本先端科学技術大学院大学
11email:\{yumaasato, kshirai, natt\}@jaist\.ac\.jp###### 摘要

大型语言模型(LLMs)常被用作文本质量的评估器,即 LLM-as-a-Judge,其性能可以超越依赖参考文本的传统自动评估指标。然而,LLM 评估器倾向于生成特定的分数,而不管被评估文本的上下文,这被称为评分偏差。本研究提出了一种缓解这种评分偏差的新方法。通过指示 LLM 随机生成数字标记,并测量观察到的数字分布与均匀分布之间的偏差,来识别 LLM 的潜在数值偏差。在随机数生成的提示中加入 LLM 评估器所服务的下游任务定义,用以测量任务特定的潜在数字偏差。在 LLM 评估中,针对给定输入的标记生成概率会考虑 LLM 的潜在数字偏差进行修正。在四个不同任务上的实验结果表明,我们提出的方法优于基线方法,包括未经消偏的 LLM 以及先前的校准方法。此外,研究还证实评分偏差会因 LLM、任务和分数范围的不同而变化,这表明按情况测量潜在数字偏差非常重要。

## 1 引言

大型语言模型(LLMs)在包括机器翻译和摘要生成在内的广泛自然语言处理任务中取得了强劲的性能。近年来,LLMs 也被用于评估文本质量,这种范式被称为 LLM-as-a-Judge。传统的自然语言生成(NLG)自动评估标准主要依赖衡量生成文本与参考文本相似度的方法,如 BLEU[18](https://arxiv.org/html/2608.05726#bib.bib1)、ROUGE[14](https://arxiv.org/html/2608.05726#bib.bib2) 和 BERTScore[24](https://arxiv.org/html/2608.05726#bib.bib5)。相比之下,使用 LLM 作为评估器不仅能够减少准备大量参考文本的人力成本,而且有时比基于参考的自动评估更合适[15](https://arxiv.org/html/2608.05726#bib.bib24)。然而,众所周知,LLM 评估器会表现出各种偏差。尤其是评分偏差会降低 LLM 评估的性能。在 LLM-as-a-Judge 的背景下,评分偏差被定义为:无论被评估文本的上下文如何,都倾向于偏好特定的数值[19](https://arxiv.org/html/2608.05726#bib.bib3)。

此外,已有几项研究调查了 LLM 的随机生成能力[25](https://arxiv.org/html/2608.05726#bib.bib6)、[23](https://arxiv.org/html/2608.05726#bib.bib7)、[8](https://arxiv.org/html/2608.05726#bib.bib8)、[10](https://arxiv.org/html/2608.05726#bib.bib30)。这里的“随机生成能力”是指 LLM 在需要不可预测性的任务(如随机数生成)中生成真正随机输出的行为。这些研究表明,LLM 并未表现出足够的随机性;尤其是经过指令微调的 LLM,在随机数生成时往往无法产生符合均匀分布的输出。随机性的缺乏表明存在对特定数字的不当偏好,这可能导致 LLM-as-a-Judge 中的评分偏差。然而,以往的研究忽略了一种从 LLM 随机生成能力的角度来识别评分偏差并进行纠正的方法。

本文提出了一种新颖的方法,通过考虑 LLM 与真正随机生成之间的偏差来缓解评分偏差,从而提高 LLM 评估器的性能。我们执行随机数生成,以测量在预测目标文本分数时的固有偏差,即无论输入如何,某些数字被生成得更频繁或不频繁的趋势。此外,考虑到 LLM 的固有偏差可能因下游评估任务而异,我们在随机数生成的提示中提供了任务定义。然后,修改 LLM 的标记生成概率,使正向(或负向)偏差的数字的概率降低(或提高)。通过在四个不同评估任务上的实验验证了所提方法的有效性。结果表明,我们的方法优于先前的消偏方法。

我们的主要贡献总结如下。<sup>1</sup>代码将在论文被接收后公开。

- •我们提出了一种消偏方法,该方法估计 LLM 的固有评分偏差,并在 LLM 评估过程中对其进行缓解。
- •我们提出了一种任务相关的消偏方法,用于缓解 LLM-as-a-Judge 各下游任务中的固有评分偏差。
- •我们通过综合实验证明了所提方法的有效性,包括四个评估任务、五个 LLM,以及与具有代表性的先前校准方法的比较。

## 2 相关工作

### 2.1 LLM-as-a-Judge

如第 1 节所述,LLM-as-a-Judge 近年来已被广泛使用。与传统的基于参考的指标(如 BLEU[18](https://arxiv.org/html/2608.05726#bib.bib1)、ROUGE[14](https://arxiv.org/html/2608.05726#bib.bib2) 和 BERTScore[24](https://arxiv.org/html/2608.05726#bib.bib5))不同,LLM 评估器可以在没有参考文本的情况下评估文本质量。Fu 等人提出了 GPTScore,这是一个使生成式预训练模型能够从多个方面评估文本质量的框架,并证明了其有效性[5](https://arxiv.org/html/2608.05726#bib.bib25)。Liu 等人提出了 G-Eval,这是一个评估 NLG 任务质量的框架,例如文本摘要和对话系统中的回复生成[15](https://arxiv.org/html/2608.05726#bib.bib24)。G-Eval 在与人类判断的 Spearman 相关性方面优于传统的基于参考和免参考的自动评估指标。Prometheus 2 是一个开源的、专门用于评估的 LLM,它使用反馈数据集针对两种评估格式进行微调:通过生成分数进行直接评估和通过成对排序进行相对评估[12](https://arxiv.org/html/2608.05726#bib.bib17)。其评估性能可与 GPT-4[1](https://arxiv.org/html/2608.05726#bib.bib27) 相媲美。Zheng 等人引入了 MT-Bench,一个多轮对话基准,以及 Chatbot Arena,一个众包基准平台[27](https://arxiv.org/html/2608.05726#bib.bib26)。他们证明了强大的 LLM 与人类偏好具有较高的一致性率,同时也揭示了 LLM-as-a-Judge 中存在位置偏差和冗长偏差等偏差。

### 2.2 LLM 评估器的偏差

已有研究报道了 LLM 评估器的几种评分偏差。Sato 等人指出了评分偏差的问题(在论文中称为“数值偏差”),并研究了三种缓解方法:修改温度、分布校准和调整分数范围[19](https://arxiv.org/html/2608.05726#bib.bib3)。Li 等人报告说,LLM 评估器产生的分数对微小的提示变化非常敏感,包括评分标准的顺序、分数 ID 的表示方式以及附带参考答案的分数[13](https://arxiv.org/html/2608.05726#bib.bib4)。Fujinuma 提出了一种缓解分数范围偏差的方法,这是一种 LLM 输出对预定义分数范围高度敏感的现象[6](https://arxiv.org/html/2608.05726#bib.bib9)。与 Sato 的工作[19](https://arxiv.org/html/2608.05726#bib.bib3) 类似,本研究关注评分偏差,即 LLM 固有的、不论输入如何都倾向于频繁生成特定分数的趋势,并提出一种缓解该偏差的方法。

### 2.3 LLM 的校准方法

已有大量工作致力于 LLM 的偏差缓解或校准。本小节介绍两种具有代表性的校准方法,它们将在我们的实验中与所提方法进行比较。Contextual Calibration[26](https://arxiv.org/html/2608.05726#bib.bib23) 是一种用于 LLM 的校准方法。它根据无上下文输入(如 N/A

相似文章

面向LLM-as-a-Judge的动态评估准则生成与优化

arXiv cs.CL

本文提出了一种无需训练的方法,可以在无需人工标注的情况下自动生成细粒度的评估准则用于LLM-as-a-Judge,并进一步介绍了一种迭代微调策略,使准则生成器的性能超过更大的专有模型。

换一个裁判,分数就变了:审计大模型作为裁判的可靠性

arXiv cs.CL

本文审计了大模型作为裁判(LLM-as-judge)评估的可靠性,表明即使候选回复固定不变,更换评估模型也可能改变评分。论文考察了Qwen3和MiniMax模型的扩展与升级路径,得出结论:裁判升级不可互换,并提出了最佳报告实践。