(迈向)使用大型语言模型的可扩展可靠自动化评估

arXiv cs.CL 论文

摘要

本文提出了一种可扩展、领域无关的自动化 LLM 评估框架,该框架利用多个 LLM 的成对比较和 Elo 评分系统来近似专家判断,从而减少人工干预的需求。

arXiv:2607.28282v1 公告类型:新 摘要:评估大型语言模型(LLM)生成的文本输出的质量和相关性仍然具有挑战性且耗费资源。现有的自动化指标往往无法捕捉 LLM 生成输出中固有的复杂性和可变性。此外,这些指标通常依赖明确的参考标准,限制了它们在具有客观基准的领域中的使用。本文介绍了一种新颖的评估框架,旨在近似评估 LLM 生成内容的专家级水平。所提方法使用多个 LLM 对输出进行成对比较,减少单个模型带来的偏差。采用 Elo 评分系统生成稳定且可解释的排名。可调的协议阈值(从完全一致到多数投票)允许灵活控制评估置信度和覆盖率。通过评估从科学摘要中提取的能力档案,证明了该方法的有效性。初步结果表明,自动派生的排名与专家判断具有良好的相关性,显著减少了对大量人工干预的需求。通过提供可扩展、一致且领域无关的评估层,该框架支持对不同应用中 LLM 输出的更高效、更可靠的质量评估。
查看原文
查看缓存全文

缓存时间: 2026/07/31 10:04

# (迈向)基于大语言模型的可扩展可靠自动化评估
来源:https://arxiv.org/html/2607.28282

###### 摘要

评估大语言模型(LLMs)生成的文本输出的质量和相关性仍然是一项具有挑战性且资源密集型的工作。现有的自动评估指标往往无法捕捉LLM生成输出中固有的复杂性和多样性。此外,这些指标通常依赖明确的参考标准,限制了它们在大多数具有客观基准的领域中的应用。本文提出了一种新颖的评估框架,旨在近似专家级评估LLM生成的内容。该方法采用多个LLM对输出进行两两比较,从而减少单一模型带来的偏差。使用Elo评分系统生成稳定且可解释的排名。可调的共识阈值——从完全一致到多数投票——允许灵活控制评估置信度和覆盖率。通过评估从科学摘要中提取的能力概况,证明了该方法的有效性。初步结果表明,自动推导的排名与专家判断具有良好相关性,显著减少了对大量人工干预的需求。通过提供可扩展、一致且领域无关的评估层,该框架能够在不同应用中支持更高效、更可靠的LLM输出质量评估。

AI人工智能
API应用程序编程接口
DQ数据质量
ML机器学习
LLM大语言模型
LMM大型多模态模型
LPM大型过程模型
NLP自然语言处理
GPT生成式预训练变换器
GPT模型生成式预训练变换器模型
RNN循环神经网络
LSTM长短期记忆网络
GRU门控循环单元
BPM业务流程管理
BPMN业务流程建模与标注
OCR光学字符识别
GPU图形处理器
RAG检索增强生成
SFT监督微调
HITL人在回路
RLHF基于人类反馈的强化学习
DPO直接偏好优化
PEFT参数高效微调
LoRA低秩适配
QLoRA量化低秩适配
SOTA最先进技术
CoT思维链
MMLU大规模多任务语言理解

(迈向)基于大语言模型的可扩展可靠自动化评估

Bertil Braun(卡尔斯鲁厄理工学院)[email protected]
Martin Forell(卡尔斯鲁厄理工学院)[email protected]

## 1 引言

大语言模型(https://arxiv.org/html/2607.28282#id5.5.id5)是基于机器学习、能够理解、分析和生成人类语言的模型(Jarrahi 等,2023(https://arxiv.org/html/2607.28282#bib.bib51))。其先进能力源于在大规模数据集上的广泛训练,使它们能够深刻理解语法、语义和上下文语言方面(Chang 等,2024(https://arxiv.org/html/2607.28282#bib.bib90))。因此,自然语言处理已成为LLM(https://arxiv.org/html/2607.28282#id5.5.id5)的核心组成部分。最近的进展显著提升了它们在语义分析和文本数据理解方面的能力(Deutsch 等,2021(https://arxiv.org/html/2607.28282#bib.bib38);Wu 等,2023(https://arxiv.org/html/2607.28282#bib.bib58))。其结果是,LLM(https://arxiv.org/html/2607.28282#id5.5.id5)被广泛用于众多领域,包括软件测试生成(Schäfer 等,2024(https://arxiv.org/html/2607.28282#bib.bib73))、问答(Liang 等,2023(https://arxiv.org/html/2607.28282#bib.bib67))和文本摘要(Deutsch 等,2021(https://arxiv.org/html/2607.28282#bib.bib38);Pu 等,2023(https://arxiv.org/html/2607.28282#bib.bib70))。

然而,评估LLM(https://arxiv.org/html/2607.28282#id5.5.id5)生成的文本输出的质量带来了重大的方法论挑战,主要原因是文本评估本质上具有主观性和任务特定性(Anwar 等,2024(https://arxiv.org/html/2607.28282#bib.bib76);Chang 等,2024(https://arxiv.org/html/2607.28282#bib.bib90))。传统评估方法通常依赖人工判断——这在资源上昂贵、不一致且难以扩展——或者依赖预定义指标,而这些指标往往不足以捕捉不同任务中质量上的细微差异(Chiang 和 Lee,2023(https://arxiv.org/html/2607.28282#bib.bib52))。这些局限性凸显了当前评估方法论中的关键空白,强调了开发更稳健、可扩展替代方案的必要性。

为了应对这些评估挑战,本文提出了一种稳健且可扩展的评估框架,利用LLM(https://arxiv.org/html/2607.28282#id5.5.id5)自身进行系统的两两比较。与依赖单一LLM(https://arxiv.org/html/2607.28282#id5.5.id5)判断或固定指标的传统方法不同,所提出的方法整合了多个LLM(https://arxiv.org/html/2607.28282#id5.5.id5)的判断,并使用Elo评分系统进行聚合。这种聚合方法产生可靠且一致的排名,显著减少了对广泛人工评估的需求。因此,所提出的方法可以有效地作为适用于涉及自由文本生成的广泛任务的通用评估层。

本文其余部分结构如下:第2节(https://arxiv.org/html/2607.28282#S2)介绍基础概念,包括LLM(https://arxiv.org/html/2607.28282#id5.5.id5)、Elo评分系统和相关性指标。第3节(https://arxiv.org/html/2607.28282#S3)概述相关工作。第4节(https://arxiv.org/html/2607.28282#S4)详细描述所提出的评估框架,随后在第5节(https://arxiv.org/html/2607.28282#S5)中进行原型实现。第6节(https://arxiv.org/html/2607.28282#S6)通过评估框架在从科学摘要中提取能力概况的性能来展示其适用性,并讨论结果。第7节(https://arxiv.org/html/2607.28282#S7)总结主要贡献并结束全文。最后,第8节(https://arxiv.org/html/2607.28282#S8)强调所提出方法的局限性。

## 2 背景

本节简要介绍LLM(https://arxiv.org/html/2607.28282#id5.5.id5)、Elo评分系统和相关性指标的基本概念,这些对于理解随后提出的评估框架至关重要。

### 2.1 大语言模型

LLM(https://arxiv.org/html/2607.28282#id5.5.id5)通过先进的机器学习方法(尤其是Transformer架构)改变了自然语言处理(NLP(https://arxiv.org/html/2607.28282#id8.8.id8)),该架构通过自注意力机制有效捕捉长距离依赖(Vaswani 等,2023(https://arxiv.org/html/2607.28282#bib.bib66))。现代LLM(https://arxiv.org/html/2607.28282#id5.5.id5),如GPT-4o(OpenAI 等,2024(https://arxiv.org/html/2607.28282#bib.bib84))、Llama 3(Meta AI,2024(https://arxiv.org/html/2607.28282#bib.bib79))、Mistral(Jiang 等,2023(https://arxiv.org/html/2607.28282#bib.bib69))和Phi 3(Abdin 等,2024(https://arxiv.org/html/2607.28282#bib.bib80)),代表了各种NLP(https://arxiv.org/html/2607.28282#id8.8.id8)任务的最先进水平,利用在大型文本数据集上的广泛预训练。

为了进一步提升输出的质量和上下文适当性,涌现了各种提示工程方法,特别是角色提示(Wang 等,2024(https://arxiv.org/html/2607.28282#bib.bib82))、知识注入(Martino 等,2023(https://arxiv.org/html/2607.28282#bib.bib57))和思维链(https://arxiv.org/html/2607.28282#id27.27.id27)(CoT(https://arxiv.org/html/2607.28282#id27.27.id27))(Wei 等,2023(https://arxiv.org/html/2607.28282#bib.bib53))。此外,检索增强生成(https://arxiv.org/html/2607.28282#id18.18.id18)(RAG(https://arxiv.org/html/2607.28282#id18.18.id18))方法(Lewis 等,2021(https://arxiv.org/html/2607.28282#bib.bib37))将检索机制集成到文本生成中,使LLM(https://arxiv.org/html/2607.28282#id5.5.id5)能够动态整合外部领域特定知识,从而无需大量再训练即可提高准确性和相关性。

### 2.2 用于项目排名的Elo评分系统

Elo评分系统(Elo,1986(https://arxiv.org/html/2607.28282#bib.bib13))最初为根据国际象棋选手的相对技能水平进行排名而开发,是一种通过两两比较动态更新项目排名的方法。每个项目从初始评分(例如1000分)开始,每次比较后进行调整。

Elo系统使用以下公式计算项目的期望得分:

E=11+10(Ratingopponent−Ratingplayer)/400

其中EE表示一个项目击败对手的期望概率。在一次比较后,评分更新为:

Ratingnew=Ratingcurrent+K×(Score−E)

其中KK是一个常数(通常为4至32),决定评分调整的幅度,Score对于获胜为1.01.0,失败为0.00.0,平局为0.50.5。

通过在所有两两结果上迭代这一过程,Elo系统最终生成项目的排名列表。表现持续强劲的项目排名上升,频繁失败的项目排名下降。这种动态排名方法确保最终排名既稳健又反映项目的相对质量。

### 2.3 相关性指标

为了评估自动评估与专家判断之间的一致性,需要适用于有序数据的相关性指标。Spearman秩相关系数(Spearman’s ρ\rho)通过比较秩次而非绝对值,衡量两个排序变量之间单调关系的强度和方向(Spearman,2010(https://arxiv.org/html/2607.28282#bib.bib26))。Kendall’s tau(τ\tau)类似地评估秩相关,但依赖两两比较,量化一致秩对与不一致秩对的比例(Kendall,1938(https://arxiv.org/html/2607.28282#bib.bib12))。这两个指标的范围均为−1-1到+1+1,其中接近+1+1的值表示强正一致性,接近−1-1表示强不一致,接近0的值表示几乎没有相关性。它们不假设线性关系或正态分布,因此特别适用于实验环境中评估排序数据。

## 3 相关工作

由于LLM(https://arxiv.org/html/2607.28282#id5.5.id5)的广泛应用,对其评估变得越来越重要。可靠的评估方法对于确保输出满足质量标准至关重要,这推动了各种评估策略的发展。现有方法通常分为两类:基于参考的指标和无参考方法。

基于参考的指标,如BLEU(Papineni 等,2002(https://arxiv.org/html/2607.28282#bib.bib17))、ROUGE(Lin,2004(https://arxiv.org/html/2607.28282#bib.bib18))和BERTScore(Zhang 等,2020(https://arxiv.org/html/2607.28282#bib.bib32)),通过将输出与预定义参考文本进行比较来评估输出。然而,它们对静态参考的依赖限制了其适用性,尤其是在创造性或开放式任务中(Chang 等,2024(https://arxiv.org/html/2607.28282#bib.bib90))。

为了克服这一限制,无参考方法如GPTScore(Fu 等,2023(https://arxiv.org/html/2607.28282#bib.bib63))应运而生,它直接基于词元概率和任务特定维度评估输出。尽管这些方法很有前景,但有时与人类判断的相关性有限(Fu 等,2023(https://arxiv.org/html/2607.28282#bib.bib63)),突显了对更精确评估技术的持续需求。

另一种方法名为“LLM作为裁判”(Zheng 等,2023(https://arxiv.org/html/2607.28282#bib.bib68)),利用LLM(https://arxiv.org/html/2607.28282#id5.5.id5)自身进行评估。这既可以通过单一LLM(https://arxiv.org/html/2607.28282#id5.5.id5)评分实现,也可以借助更稳健的多LLM(https://arxiv.org/html/2607.28282#id5.5.id5)框架,如辩论或同行评审(Chang 等,2024(https://arxiv.org/html/2607.28282#bib.bib90));Liang 等,2023(https://arxiv.org/html/2607.28282#bib.bib67))。

在多LLM(https://arxiv.org/html/2607.28282#id5.5.id5)评估框架中,Elo评分系统作为一种基于两两比较动态排名的结构化方法而广受欢迎。尽管被广泛使用,Elo评分对评估顺序和超参数选择等因素敏感,导致可靠性方面的担忧(Boubdir 等,2023(https://arxiv.org/html/2607.28282#bib.bib55))。Boubdir 等(2023(https://arxiv.org/html/2607.28282#bib.bib55))最近的工作提出了增强可靠性的指南,包括通过排列过采样方法来减轻顺序效应,从而实现更稳健、可靠的模型性能评估。

## 4 方法

概述与动机。本节介绍一种方法论,利用LLM(https://arxiv.org/html/2607.28282#id5.5.id5)通过两两比较方法来评估给定任务(如摘要)的各种自由文本响应。使用LLM(https://arxiv.org/html/2607.28282#id5.5.id5)评估自由文本输出面临几个挑战:

- •C1 – 评分的客观性:绝对分数通常不一致,且存在尺度问题。
- •C2 – LLM偏差:位置偏差、冗长偏差和风格偏差可能扭曲评估结果。
- •C3 – 处理多次评估:将多个LLM输出聚合成一致的决策并非易事。
- •C4 – 稳健排名:以偏差最小化的方式得出项目的明确排序,需要一种有弹性的聚合机制。

为了应对这些挑战,我们的流水线分为三个不同阶段:(I)生成待比较的项目,(II)使用多个LLM(https://arxiv.org/html/2607.28282#id5.5.id5)进行系统的两两比较,以及(III)使用Elo评分系统对项目进行排名,以明确识别表现最佳的候选。图1(https://arxiv.org/html/2607.28282#S4.F1)概述了这一流水线。

图1:流程概览:包含生成、比较和排序的三阶段方法论。

该方法论首先生成多个用于比较的项目。此步骤可包含各种方法,以确保评估输入的多样性。例如,可以使用不同的超参数配置、不同的LLM(https://arxiv.org/html/2607.28282#id5.5.id5)或不同的措辞风格。随后,该方法论系统地评估和排列各项目,从而识别针对给定任务效果最佳的方法。

典型应用包括超参数优化、方法比较和LLM(https://arxiv.org/html/2607.28282#id5.5.id5)选择,其目标是确定最有效的配置或LLM(https://arxiv.org/html/2607.28282#id5.5.id5)。

基于最终的Elo排名,评估不同方法的性能,并确定表现最佳的项目。

相似文章

大型语言模型响应的全面评估:多因素评分系统

arXiv cs.CL

本文提出了一种用于评估大型语言模型(LLM)响应的多因素评分系统,综合了准确性、简洁性、事实一致性、可读性和连贯性。应用于TruthfulQA数据集,揭示了主流模型的优势与局限,提供了一个透明的评估框架。

大型语言模型有多像人类?一个关注语域的语言评估框架

arXiv cs.CL

本文提出了一种关注语域的语言评估框架,通过使用最大均值差异(MMD)比较人类与LLM生成文本中67个词汇语法特征的分布,来评估大型语言模型(LLM)的人类相似度。在七个经过指令微调的开源模型和五个语域上的实验表明,没有模型能完美匹配人类基线,且与人类语言的接近程度因语域而异,而非模型规模。