LLMs判断能力是否强于生成能力?评估上下文问答中的任务不对称性、机制可解释性与可迁移性

arXiv cs.CL 论文

摘要

本文测试了LLMs在上下文问答中判断能力优于生成能力的假设,发现在大多数基准上生成准确率超过自我评估,且评估过程对上下文的关注较少。这些发现挑战了自我评估流程中的核心假设。

arXiv:2606.28050v1 公告类型: 新 摘要:LLM作为评判者以及自我评估流程隐含地假设评估比生成更容易。我们在一个受控的上下文问答环境中对此进行了测试,其中上下文段落是唯一的信息源,每个模型对自己生成的答案进行评判,从而消除了开放域比较中参数化知识的混淆。在四个基准(SQuAD 2.0、DROP、HotpotQA、MuSiQue)和两个模型上,评估并非普遍更容易:在四个基准中的三个上,生成准确率超过了自我评估,多跳的MuSiQue是例外。注意力分析揭示了原因:评估对上下文的关注比生成少3到5倍,并且几乎不阅读候选答案。LoRA微调证实了这种不对称性并非训练人为产物:生成微调会导致过度接受,而评估微调则会降低生成能力。这些发现挑战了自我评估流程中的核心假设。
查看原文
查看缓存全文

缓存时间: 2026/06/29 05:25

# LLMs 能否比生成更好判断?评估上下文问答中的任务不对称性、机制可解释性与迁移性 来源:https://arxiv.org/html/2606.28050

###### 摘要

LLM-as-a-Judge 和自评估流程隐含地假设评估比生成更容易。我们在一个受控的上下文问答设置中测试这一点,其中上下文段落是唯一的信息源,每个模型判断自己生成的答案,从而消除了开放域比较中的参数知识混淆。在四个基准(SQuAD 2.0、DROP、HotpotQA、MuSiQue)和两个模型上,评估并非统一更容易:生成准确率在四个中的三个上超过自评估,多跳 MuSiQue 是例外。注意力分析揭示了原因:评估对上下文的注意力比生成少 3-5 倍,并且几乎不阅读候选答案。LoRA 微调证实了不对称性不是训练伪影:生成微调导致过度接受,评估微调降低生成质量。这些发现挑战了自评估流程的核心假设。

# LLMs 能否比生成更好判断?评估上下文问答中的任务不对称性、机制可解释性与迁移性

Sambaran Bandyopadhyay
Adobe Research
[email protected]

## 1 引言

LLM 现在不仅被部署为内容的生成器,还被部署为内容的评估者——这一转变对研究和工业都产生了深远影响。LLM-as-a-Judge 流程(Zheng 等人,2023 (https://arxiv.org/html/2606.28050#bib.bib7);Liu 等人,2023 (https://arxiv.org/html/2606.28050#bib.bib8))已迅速成为大规模文本评估的主力军,为排行榜、自动基准测试和生产质量评估提供动力,取代了成本高昂的人工标注(Bavaresco 等人,2025 (https://arxiv.org/html/2606.28050#bib.bib6))。自我反思和自我纠正框架(Asai 等人,2024 (https://arxiv.org/html/2606.28050#bib.bib18);Bai 等人,2022 (https://arxiv.org/html/2606.28050#bib.bib17);Huang 等人,2024 (https://arxiv.org/html/2606.28050#bib.bib9))使用同一模型来批评并迭代修改自己的输出,支撑了近期产品发布中涌现的智能体和推理系统。基于人类反馈的强化学习(Ouyang 等人,2022 (https://arxiv.org/html/2606.28050#bib.bib16))依赖于一个奖励模型——通常其本身就是 LLM——来提供偏好信号,使前沿模型与人类价值观对齐,这是几乎每个现代指令微调模型训练后流程的基础。这些用途共同使得基于 LLM 的评估不仅是一种外围能力,而是 LLM 训练、部署和信任所依赖的核心组件。然而,所有这些都基于一个*隐含的基本假设*,且很少被直接检验:即 LLM 能够可靠地(通常更容易地)判断答案的正确性,而不是从零开始生成答案。

然而,最近的实证工作提出了质疑。Oh 等人(2024 (https://arxiv.org/html/2606.28050#bib.bib3))发现 LLM 在 TriviaQA 上判断自己生成的答案时准确率*更低*;Jiang 等人(2025 (https://arxiv.org/html/2606.28050#bib.bib4))表明,在自生成的候选中进行判别性选择并不比直接生成更可靠;Lin 等人(2025 (https://arxiv.org/html/2606.28050#bib.bib2))报告了在 21 个任务上生成能力和判断能力之间仅存在微弱的相关性。然而,这些工作存在一个重要混淆因素:它们都是在*开放域*设置中进行的,其中两个任务都依赖参数知识。一个模型如果记住了某个事实,即使自由回忆失败,也能评估关于该事实的答案,这就将任何差距归因于差异化的记忆检索,而非任务的内在难度。

#### 我们的贡献。
我们通过一个受控的上下文问答框架和三项互补性研究来解决这一空白。
首先,我们在四个涵盖抽取式、多跳和数值推理的基准上测量 GA–EA 差距,其中每个模型判断自己刚刚生成的答案——这是对自我评估的直接测试。
其次,我们探查两个任务在最后一个 token 上的注意力模式,以理解差距存在的原因;据我们所知,这是首次将机制可解释性工具应用于生成-评估差距。
第三,我们使用 LoRA 分别在每个任务上以及联合微调,然后在两个任务上评估所有检查点,测试生成和评估的参数结构是共享的还是独特的。我们将研究范围限定为具有明确标准答案的上下文事实问答:正确性是二值且明确的,避免了长文本评估的主观性(Nandy and Bandyopadhyay,2025 (https://arxiv.org/html/2606.28050#bib.bib1)),并且将上下文段落作为唯一信息源,确保任何 GA–EA 差距反映的是综合难度与自我验证之间的差异,而非差异化的记忆检索。

## 2 相关工作

#### LLM 作为现代 NLP 流程中的评估者。
LLM 现在在模型开发生命周期的各个阶段被用作评判者、批评者和奖励模型。LLM-as-a-Judge 框架(Zheng 等人,2023 (https://arxiv.org/html/2606.28050#bib.bib7);Liu 等人,2023 (https://arxiv.org/html/2606.28050#bib.bib8);Bavaresco 等人,2025 (https://arxiv.org/html/2606.28050#bib.bib6))对生成的文本进行大规模评分或排名,取代昂贵的人工标注。自我反思和自我纠正流程(Asai 等人,2024 (https://arxiv.org/html/2606.28050#bib.bib18);Bai 等人,2022 (https://arxiv.org/html/2606.28050#bib.bib17);Huang 等人,2024 (https://arxiv.org/html/2606.28050#bib.bib9))让模型批评并修改自己的输出。基于 LLM 的奖励模型通过 RLHF(Ouyang 等人,2022 (https://arxiv.org/html/2606.28050#bib.bib16))驱动对齐,为训练后阶段提供偏好信号。已知的偏差如*自我偏好*(Panickssery 等人,2024 (https://arxiv.org/html/2606.28050#bib.bib10))使得系统性地表征 LLM 评估行为变得至关重要。

#### 生成-评估不对称性。
越来越多的文献直接比较同一模型的生成能力和评估能力。Oh 等人(2024 (https://arxiv.org/html/2606.28050#bib.bib3))发现 LLM 在评估自己在 TriviaQA 上的生成时表现更差。Jiang 等人(2025 (https://arxiv.org/html/2606.28050#bib.bib4))表明在自生成的候选中进行判别性选择并不比直接生成更可靠。Lin 等人(2025 (https://arxiv.org/html/2606.28050#bib.bib2))检查了 11 个模型上的 21 个任务,报告了生成-判断之间仅存在微弱的相关性。这三个工作都是在开放域设置中进行的,其中参数知识混淆了任务难度;我们通过将两个任务限制在共享的上下文来源中,并增加机制分析和迁移分析来补充它们。

#### LLM 决策的机制可解释性。
机制可解释性旨在解释 Transformer 如何在内部路由信息。Elhage 等人(2021 (https://arxiv.org/html/2606.28050#bib.bib23))形式化了注意力头作为读/写电路;Olsson 等人(2022 (https://arxiv.org/html/2606.28050#bib.bib24))将归纳头识别为上下文学习的关键机制。Meng 等人(2022 (https://arxiv.org/html/2606.28050#bib.bib25))和 Geva 等人(2023 (https://arxiv.org/html/2606.28050#bib.bib27))将事实关联定位到 MLP 层,Belrose 等人(2023 (https://arxiv.org/html/2606.28050#bib.bib26))表明语义表示在仅解码器 Transformer 的后期层中巩固。这些工作均未针对评估任务或生成-评估差距。

#### 通过参数高效微调进行跨任务迁移。
LoRA(Hu 等人,2022 (https://arxiv.org/html/2606.28050#bib.bib22))适配器通过在一个任务上训练并在另一个任务上评估,隔离了每个任务诱导的参数结构。Dymkiewicz 等人(2025 (https://arxiv.org/html/2606.28050#bib.bib19))记录了 NLP 基准上不对称的捐赠者-接受者迁移模式。我们将此设置应用于测试在单一 QA 领域内生成和评估是否共享参数结构。

## 3 方法论

我们在第 3.1 (https://arxiv.org/html/2606.28050#S3.SS1)–3.3 (https://arxiv.org/html/2606.28050#S3.SS3) 节中依次介绍上述三项研究。图 1 (https://arxiv.org/html/2606.28050#S3.F1) 勾勒了它们所基于的共享流程。

输入:\((c, q, a^*)\) 生成器 \(\mathcal{L}\) 任务 \(\mathcal{T}_{\mathrm{gen}}\): \((c,q) \to a\) 神谕 \(\mathcal{L}^*\) \((c,q,a,a^*) \to y^*\) 评估器 \(\mathcal{L}\) 任务 \(\mathcal{T}_{\mathrm{eval}}\): \((c,q,a) \to y\) GA (正确率) \(P(y^* = \text{Correct})\) EA (准确率) \(P(y = y^*)\) \(\boldsymbol{\Delta} = \text{EA} - \text{GA}\)

图 1:核心任务不对称性流程。模型 \(\mathcal{L}\) 在每个实例上测试两个任务:**生成**(\(\mathcal{T}_{\text{gen}}\))从 \((c,q)\) 产生答案 \(a\);**自我评估**(\(\mathcal{T}_{\text{eval}}\))判断给定 \((c,q,a)\) 时 \(a\) 是否正确。神谕 \(\mathcal{L}^*\) 根据标准答案 \(a^*\) 对 \(a\) 进行评分,得到 \(y^*\) 作为两个指标的 ground truth。虚线箭头表示数据传递操作,不涉及 LLM 调用。\(\boldsymbol{\Delta} = \text{EA} - \text{GA}\) 是主要的非对称性度量。机制分析和迁移性分析扩展了此流程。

### 3.1 任务不对称性分析

每个基准实例是一个三元组 \((c, q, a^*)\),其中 \(c\) 是上下文段落,\(q\) 是问题,\(a^*\) 是直接从 \(c\) 合成的标准答案。我们在相同实例上对语言模型 \(\mathcal{L}\) 进行两个顺序任务的测量。

#### 生成任务(\(\mathcal{T}_{\text{gen}}\))。
给定 \((c,q)\),\(\mathcal{L}\) 生成自由文本答案:
\[
a = \mathcal{L}(c, q). \tag{1}
\]

#### 评估任务(\(\mathcal{T}_{\text{eval}}\))。
将来自 \(\mathcal{T}_{\text{gen}}\) 的生成答案 \(a\) 直接传递给 \(\mathcal{L}\) 作为待判断的候选答案。给定 \((c,q,a)\),\(\mathcal{L}\) 产生一个二元判断:
\[
y = \mathcal{L}(c, q, a) \in \{\text{Correct}, \text{Incorrect}\}. \tag{2}
\]
这种顺序设计使得 \(\mathcal{T}_{\text{eval}}\) 成为一个**自我评估**任务:\(\mathcal{L}\) 判断自己刚刚生成的答案的质量。两个任务使用相同的采样实例,确保直接可比性。我们通过 \(\Delta = \text{EA} - \text{GA}\) 总结不对称性,其中 EA 和 GA 的正式定义见第 4.4 (https://arxiv.org/html/2606.28050#S4.SS4) 节。

#### 神谕评分。
我们使用神谕 LLM \(\mathcal{L}^*\) 根据标准答案 \(a^*\) 对生成答案 \(a\) 进行评分:
\[
y^* = \mathcal{L}^*(c, q, a, a^*) \in \{\text{Correct}, \text{Incorrect}\}. \tag{3}
\]
\(y^*\) 具有双重作用:它定义了**生成准确率**(\(a\) 是否正确),并提供了**评估标签 ground truth**,用于比较 \(\mathcal{L}\) 的判断 \(y\)。两个任务使用单一的 oracle 信号,确保 GA 和 EA 基于一致的外部参考。

#### 提示工程。
两个任务均使用零样本提示,采用固定模板。生成提示指示 \(\mathcal{L}\) 仅使用提供的上下文来回答,并简洁地回应。评估提示呈现 \((c,q,a)\) 并指示 \(\mathcal{L}\) 判断在给定上下文时 \(a\) 是否正确,以“Correct”或“Incorrect”精确回应。两个任务使用相同的上下文格式。

### 3.2 机制解释

为了理解任何观察到的差距背后的机制,我们检查 \(\mathcal{L}\) 在两个任务上内部如何分配注意力。对于每个提示,我们执行一次正向传播,启用注意力输出,并提取**最后一个 token 的注意力行**——即模型在预测第一个输出 token 时在所有输入位置上的分布。这是两个任务的自然决策点,因为 \(\mathcal{T}_{\text{gen}}\) 和 \(\mathcal{T}_{\text{eval}}\) 都产生短输出(\(\mathcal{T}_{\text{gen}}\) 的标准答案通常为 1-3 个 token,\(\mathcal{T}_{\text{eval}}\) 为单个 token),因此第一个 token 决策最为关键。我们测量落在三个标注的提示跨度上的注意力质量分数——上下文 \(c\)、问题 \(q\) 和候选答案 \(a\)(仅在 \(\mathcal{T}_{\text{eval}}\) 中)——从而得出每个任务分配策略的跨度级别指纹。注意力在所有头上平均,并在最后八个 Transformer 层(32 层的 Llama-3.1-8B-Instruct 的第 24-31 层)上平均。仅解码器 Transformer 的后期层巩固了高级语义和任务相关表示,而早期层则关注词汇和位置特征(Belrose 等人,2023 (https://arxiv.org/html/2606.28050#bib.bib26);Geva 等人,2023 (https://arxiv.org/html/2606.28050#bib.bib27));因此我们将比率计算限制在这个波段,以从低层 token 匹配行为中分离出语义、决策相关的注意力模式。

### 3.3 迁移性分析

为了测试生成和评估使用的参数结构是否共享,我们使用 LoRA 适配器以三种配置微调 \(\mathcal{L}\):
- •LoRA-Gen:仅在 \((c,q) \to a^*\) 示例上训练。
- •LoRA-Eval:仅在 \((c,q,a) \to y^*\) 示例上训练,其中 \(a\) 来自硬负样本池(如下所述)或当不可用时来自答案轮换。
- •LoRA-Both:在两个任务格式的 1:1 平衡合集上训练。

然后,每个适配器在两个任务 \(\mathcal{T}_{\text{gen}}\) 和 \(\mathcal{T}_{\text{eval}}\) 上使用与第 3.1 节相同的提示模板和神谕评分进行评估。不对称的跨任务增益表明两种能力依赖部分不同的参数资源;对称增益则表明共享底层能力。

#### 用于评估器训练的硬负样本生成。
一个天真的负样本用于 \(\mathcal{T}_{\text{eval}}\) 训练——任意选定的错误答案——很容易与正确答案区分,并且会产生一个不能泛化到合理错误的评估器。我们改为通过在*没有*上下文段落的情况下查询 \(\mathcal{L}\) 来生成**看似合理但错误的**候选答案,迫使其依赖参数记忆并产生幻觉答案。每个记录最多尝试五个幻觉;第一个其答案*不*匹配标准答案 \(a^*\)(由同一神谕 \(\mathcal{L}^*\) 判断)的答案被保留为该记录的硬负样本。拒绝式输出(例如“我需要更多信息”)被过滤,因为它们会教导评估器检测非答案而非验证事实内容;无法产生可用硬负样本的记录则回退到答案轮换,其中 \(a\) 从另一个实例的标准答案中采样。由此产生的训练集反映了评估器在测试时将面临的错误分布——即它判断实际模型生成的答案。

## 4 实验设置

### 4.1 数据集

我们仅使用每个数据集的验证集进行任务不对称性分析和注意力分析,仅使用训练集进行 LoRA 微调。数据集使用的详细总结——包括每个实验的具

相似文章

LLM能否生成可靠的评分标准?实验复现的元评估

arXiv cs.CL

本文首次系统性地对LLM生成的用于复现研究论文实验的评分标准进行元评估。它将评分标准重新表述为检查表格式,并从内在(语义相似性)和外在(分数对齐)两方面评估生成设置,发现增强设置改善了下游评估对齐,但生成的评分标准往往过于细粒度,且偏向高分。

换一个裁判,分数就变了:审计大模型作为裁判的可靠性

arXiv cs.CL

本文审计了大模型作为裁判(LLM-as-judge)评估的可靠性,表明即使候选回复固定不变,更换评估模型也可能改变评分。论文考察了Qwen3和MiniMax模型的扩展与升级路径,得出结论:裁判升级不可互换,并提出了最佳报告实践。