基于共识的大型语言模型相对偏好评估框架

arXiv cs.CL 论文

摘要

本文介绍了一种基于共识的评估框架,通过一组模型对匿名输出进行排名,生成相对智能指数(RII),作为跨领域相对质量的代理指标。

arXiv:2607.21632v1 公告类型:新 摘要:传统的大型语言模型基准测试主要依赖静态数据集和客观评分指标,当存在多个可接受的答案时,这些方法往往无法捕捉响应质量上的差异。在这种情况下,仅凭正确性不足以区分在清晰度、完整性和有用性方面各不相同的响应。 本文提出了一种基于共识的评估框架,该框架衡量模型生成响应之间的相对偏好,而非绝对正确性。我们不将输出与固定真实答案进行对比,而是评估一组多样化的 LLM 如何对同一提示的匿名候选响应进行排序。这种方法将模型间的聚合一致性视为盲条件下感知响应质量的代理指标。 我们进行了一项受控研究,使用了五个前沿 LLM,涵盖编程、常识、安全、逻辑推理和数学等多个领域。每个模型生成响应,并通过结构化投票过程独立对同行输出进行排名。分数被聚合为相对智能指数(RII),表示一个模型的响应被其他模型偏好的频率。 我们的研究结果揭示了跨领域一致的偏好模式,某些模型更频繁地获得同行的高排名。然而,我们强调这些结果反映的是模型间偏好对齐,而非客观正确性或人类判断。该框架提供了一种可扩展的、由模型驱动的比较评估方法,在存在多个有效答案的场景中为响应质量提供了另一种视角。虽然与人类评估并不直接一致,但先前的研究表明,聚合的模型偏好可能与人类判断部分相关,这促使我们将其作为代理信号。
查看原文
查看缓存全文

缓存时间: 2026/07/27 07:38

# 基于共识的大型语言模型相对偏好评估框架
来源:https://arxiv.org/html/2607.21632
(2026年4月)

###### 摘要

传统的大型语言模型基准测试主要依赖静态数据集和客观评分指标,当多个答案都可接受时,这些方法往往无法捕捉响应质量的差异。在此类场景中,仅凭正确性不足以区分在清晰度、完整性和有用性上各不相同的响应。本文提出一种基于共识的评估框架,用于衡量模型生成响应之间的相对偏好,而非绝对正确性。我们不再将输出与固定真实答案对比,而是让一组多样化的 LLM 对相同提示下的匿名候选响应进行排名。该方法将汇总的模型间一致性视为盲评条件下感知响应质量的代理指标。我们使用五个最先进的 LLM 在编程、常识、安全、逻辑推理和数学等多个领域进行受控研究。每个模型生成响应,并通过结构化投票过程独立对其他模型的输出进行排名。分数汇总为“相对智能指数 (RII)”,反映某个模型的响应被其他模型偏好的频率。我们的研究结果揭示了跨领域的稳定偏好模式,某些模型更常被其他模型评为高位。然而,我们强调这些结果反映的是模型间的偏好对齐,而非客观正确性或人类判断。该框架提供了一种可扩展的、模型驱动的比较评估方法,在存在多个有效答案的场景中为响应质量提供了另一种视角。尽管与人类评估并非直接一致,但先前研究表明,聚合的模型偏好可能部分与人类判断相关,这为此处作为代理信号提供了依据。

## 1 引言

LLM 的快速发展在编程、推理和常识问答等广泛任务上带来了显著提升。随着这些系统在既有基准测试中达到高水平,评估其输出变得越来越具有挑战性。传统的评估框架通常基于静态数据集和预定义的正确答案,在多个响应可能都正确但在清晰度、完整性和有用性上各有差异的场景中往往不足。

在许多实际应用中,响应之间的区别并非严格二值(正确 vs. 错误),而是位于相对质量的谱系上。例如,同一问题的两个回答可能都事实正确,但其中一个可能更简洁、结构更清晰或对用户更有帮助。传统基准测试难以捕捉这些质量差异,因为它们设计用来奖励正确性而非偏好。为应对这一局限,近期工作探索了使用 LLM 本身作为评估者,从而实现对生成输出进行可扩展的自动评估。成对比较、多智能体辩论和基于共识的评判等方法表明,在某些条件下,模型可以近似人类偏好。然而,这些方法往往依赖直接比较或迭代交互,可能通过暴露于竞争响应或对话动态而引入偏差。

本文中,我们提出一种基于盲评同行排名的共识式评估框架,旨在衡量模型生成响应之间的相对偏好。我们不是将输出与固定真实答案对比,而是向一组 LLM 裁判展示多个匿名候选响应,每个裁判根据标准化评分标准独立对响应进行排名。通过跨模型和多次运行的聚合排名,我们推导出一个“相对智能指数 (RII)”,反映某个模型的响应被其同行偏好的频率。RII 对排名分数的线性缩放具有不变性,反映的是序数偏好而非绝对幅度。

该框架的动机是观察到:在许多情况下,最实用的响应并非仅由正确性唯一确定,而是取决于相对于替代方案的感知质量。通过关注盲评条件下的模型间一致性,我们旨在捕捉感知响应质量的代理信号,以补充传统的基于准确性的指标。我们强调,该方法并不试图衡量客观正确性或与人类判断的对齐。相反,它评估的是模型在共享评估背景下如何对彼此的输出进行排名。因此,所得分数应被解释为模型相关的偏好指标,可能受共同训练数据、风格倾向和提示敏感性影响。

为评估该框架,我们进行了一项受控研究,涉及五个最先进的 LLM,涵盖编程、常识、安全、逻辑推理和数学等多个领域。每个模型既作为生成者也作为裁判参与,从而实现完全自包含的评估流水线。我们的分析侧重于聚合偏好模式、多次运行的稳定性以及一致性与排名性能之间的权衡。

通过将关注点从绝对正确性转移到比较偏好,本文引入了 LLM 评估的另一种视角——特别是在多个答案可能被接受、“最佳”概念本质上是相对的场景中尤为相关。

## 2 相关工作

随着模型能力的提升,LLM 的评估方法已显著演变。早期基准测试主要依赖具有预定义真实答案的静态数据集,如 MMLU 和 GSM8K,它们衡量特定任务的准确性。尽管这些基准测试在评估正确性方面仍然有用,但在多个响应可能都正确但质量、清晰度或有用性各异的场景中受到限制。这推动了能够更好捕捉模型输出质量方面的替代评估范式的发展。

### 2.1 LLM 作为裁判框架

近期工作探索了使用 LLM 本身作为评估者,从而实现对生成响应进行可扩展的自动评估。然而,越来越多的文献指出,这类评估者表现出系统性偏差,包括位置偏差、冗长偏好和风格偏好[5 (https://arxiv.org/html/2607.21632#bib.bib8)]。这些局限性引发了对单一模型评估流水线可靠性的担忧,并推动了聚合或校准策略的使用。此外,大规模实证研究表明,LLM 裁判与人类注释的一致性差异很大,这意味着基于 LLM 的评估必须谨慎解读,并在可能的情况下通过外部信号进行验证[1 (https://arxiv.org/html/2607.21632#bib.bib6)]。

### 2.2 基于共识和独立聚合的方法

另一条工作路线侧重于聚合独立判断,而非让评估者之间进行交互。基于共识的方法将每个模型视为独立投票者,并结合排名或分数以获得更稳定的信号。这种设计减少了对话动态引入的偏差,但依赖于聚合一致性近似感知质量的假设。然而,先前工作也指出,模型间一致性可能反映共享的训练分布或风格偏差而非客观质量,使得共识信号的解读变得复杂。

### 2.3 多智能体和基于共识的评估

为提升评估质量,几项工作提出了多智能体方法,其中多个 LLM 进行交互以产生更稳健的判断。例如,ChatEval 引入了一个多智能体辩论框架,由一组 LLM 协作讨论和评估候选响应,模仿人类评估动态并提高评估可靠性[2 (https://arxiv.org/html/2607.21632#bib.bib2)]。在此基础上,CollabEval 提出了一种结构化的多阶段协作过程,将独立评估与迭代讨论和共识优化相结合。该方法在单裁判系统的基础上展现出更强的鲁棒性,特别是在个体模型表现出不一致或偏颇判断的情况下[4 (https://arxiv.org/html/2607.21632#bib.bib3)]。尽管这些方法提升了评估质量,但它们引入了交互效应,即暴露于其他响应或中间推理可能会影响判断。

### 2.4 裁判的可靠性、校准与元评估

越来越多的研究关注 LLM 评估者本身的可靠性。《评判裁判:构建可信赖的 LLM 评估》等研究强调了在使用 LLM 作为评估者时需要进行校准、偏差修正和一致性分析。类似地,关于裁判基准测试的近期工作表明,仅与人类分数的相关性是不够的,还必须考虑一致性结构和稳定性来评估裁判质量[3 (https://arxiv.org/html/2607.21632#bib.bib7)]。更近期的元评估努力,如《递归评估:AI 裁判性能的元分析》,进一步探索了当裁判本身被评估时评估流水线的行为,突显了基于 LLM 的基准测试框架的递归性质和潜在不稳定性。

### 2.5 人类锚定与纵向评估

补充方法将人类判断作为锚定机制。例如,《生成式 AI 的人类锚定纵向比较》结合了基于 LLM 的评估与校准后的人类评分来追踪模型随时间变化的性能,解决了漂移和偏差累积等问题。这些方法强调,尽管基于 LLM 的评估具有可扩展性,但人类锚定对于验证评估信号仍然重要[5 (https://arxiv.org/html/2607.21632#bib.bib8)]。

表1:基于结构属性对 LLM 评估范式进行定性比较。注:偏差风险是概念性的,反映对已知问题(如位置偏差和交互效应)的敏感程度。

表1 (https://arxiv.org/html/2607.21632#S2.T1) 提供了评估范式的定性比较,突出了交互结构、偏差敏感性和可扩展性特征的差异。

### 2.6 本文的定位

本文在这些先前方向的基础上,引入了一个盲评、基于共识的排名框架,结合了多模型评估和偏好聚合的元素,同时尽量减少评估者之间的交互效应。与成对比较方法不同,我们的方法同时评估多个候选响应,允许每个模型对匿名输出产生完整排名。与基于辩论的系统不同,判断是独立做出的,减少了跨模型交互的影响。

我们的主要贡献不在于改进正确性估计,而是在受控条件下提供一种可扩展的方法来测量模型间偏好对齐。通过跨多个模型和多次运行聚合排名,我们旨在捕捉稳定的相对偏好模式,为传统的基于准确性的基准测试提供补充视角。

## 3 方法

本研究的目的是在受控盲评环境下衡量模型生成响应之间的相对偏好。我们不再根据固定真实答案评估正确性,而是评估一组大型语言模型 (LLM) 如何对同一提示的同行生成答案进行排名。本节描述用于计算相对智能指数 (RII) 的实验设计、评估流水线和聚合方法。

### 3.1 评估框架概述

所提出的框架基于三个核心原则:

1. 盲评,以最小化品牌和风格偏差;
2. 独立判断,以避免评估者之间的交互效应;
3. 共识聚合,以跨多个模型和运行获得稳定的偏好信号。

每个模型扮演两个角色:

- **生成者**:对给定提示生成候选响应
- **裁判**:独立对所有模型生成的匿名响应进行排名

评估过程包括五个连续阶段:

1. 响应生成,
2. 匿名化和随机化,
3. 模型裁判独立排名,
4. 去匿名化,
5. 分数聚合。

### 3.2 模型选择与配置

我们评估了五个最先进的 LLM,代表不同的架构和提供商。所有模型均通过各自的 API 使用实验时可用的最新版本访问。

- **评估的模型**:Anthropic Claude (Opus 4.6 系列)、OpenAI GPT-5.2、Google Gemini Pro 3.1、Grok-fast 4.1 和 Mistral Large (2512)。

为减少采样带来的变异性,所有模型配置温度为 0.3,这提供了适度的随机性同时保持响应多样性。我们注意到,此设置并未消除随机性,并且模型对温度的敏感性可能因提供商而异。

### 3.3 提示设计与响应生成

每个模型都接受一组相同的提示,涵盖编程、常识、安全、逻辑推理和数学等多个领域。提示使用标准化模板格式化,以确保跨模型的一致性。

为减少评估过程中的风格偏差,响应被限制为纯文本,并鼓励简洁。尽管这种标准化提高了可比性,但也可能影响不同模型表达其答案的方式,因此被视为潜在的偏差来源。

对于每个提示,所有模型各生成一个响应,从而产生每个提示的候选响应集。

### 3.4 匿名化与随机化

为确保盲评,所有生成的响应均去除识别信息,包括尽可能去除模型特定的格式和风格标记。每个响应被分配一个匿名标签(例如“答案 1”、“答案 2”等)。

为减轻位置偏差,响应的顺序对每个裁判独立随机化。匿名标签与原始模型之间的映射单独存储,在评估阶段不可访问。

如果某个模型未对给定提示生成响应,则从该提示的评估中排除该实例。这避免了不完整的排名集,但引入了潜在的选择偏差来源,我们将其视为一个局限。

### 3.5 模型裁判独立排名

在评估阶段,每个模型被呈现:

- 原始提示,以及
- 完整的匿名候选响应集。

每个模型使用预定义的评分标准对所有响应独立分配完整排名,评分标准强调:

- 与提示的相关性,
- 正确性(如适用),以及
- 清晰度和简洁性。

排名表示为严格排序(无并列),排名越高表示偏好越强。为确保结构化输出,模型被指示以标准 JSON 格式返回排名,并在支持的情况下进行程序化验证。

重要的是,裁判之间互不交互,也没有迭代

相似文章

大型语言模型响应的全面评估:多因素评分系统

arXiv cs.CL

本文提出了一种用于评估大型语言模型(LLM)响应的多因素评分系统,综合了准确性、简洁性、事实一致性、可读性和连贯性。应用于TruthfulQA数据集,揭示了主流模型的优势与局限,提供了一个透明的评估框架。

一些大型语言模型表现出一致的风险态度

arXiv cs.AI

本文介绍了一个框架,用于测试大型语言模型是否在不同领域表现出一致的风险态度。研究发现,大多数大型语言模型在风险态度上表现出任务内和跨领域的稳定性,并趋近于比人类更窄的分布。

大型语言模型有多像人类?一个关注语域的语言评估框架

arXiv cs.CL

本文提出了一种关注语域的语言评估框架,通过使用最大均值差异(MMD)比较人类与LLM生成文本中67个词汇语法特征的分布,来评估大型语言模型(LLM)的人类相似度。在七个经过指令微调的开源模型和五个语域上的实验表明,没有模型能完美匹配人类基线,且与人类语言的接近程度因语域而异,而非模型规模。