重新思考LLM作为评判器的口头置信度:2025年后专有模型上的兼容性转变

arXiv cs.CL 论文

摘要

本文表明,对于2025年后的专有模型,口头置信度已成为LLM作为评判器的更优软评分机制,挑战了之前倾向于对数概率的建议。它引入了过度置信度建议和自我辩论,以改善校准和鲁棒性。

arXiv:2609.10996v1 公告类型:新 摘要:口头置信度长期以来被斥为过度自信、粗糙且易出现整数聚集,现已成为顶级专有模型上LLM作为评判器的更稳健的软评分机制。在SummEval、AggreFact和HelpSteer2上,涉及多达18个大语言模型,我们证明了倾向于对数概率的标准建议在2025年后的模型上不再适用,口头置信度是更好的信号。我们将此称为兼容性转变。在标准口头置信度基线之上,我们引入了两个新要素:过度置信度建议和自我辩论。它们共同改善了校准、分数分布广度以及对任务主观性的鲁棒性。我们进一步观察到一种代际效应:2025年后的模型在引入这两个附加项时,平衡准确度成本很小,而2025年前的模型则有可衡量的损失。与基于对数概率的G-Eval相比,口头置信度在GPT系列顶级版本中是更抗主观性的软信号。这种转变在仅报告准确度时是不可见的。我们建议在LLM作为评判器中更广泛地使用软评分,而不是默认使用硬预测。更广泛地说,口头置信度已从对数概率的较弱替代品转变为当代LLM评判器的实用软评分机制。
查看原文
查看缓存全文

缓存时间: 2026/09/11 08:21

# 重新思考面向大模型评判者的语言化置信度:后2025年专有模型的兼容性转变
来源:https://arxiv.org/html/2609.10996

###### 摘要

语言化置信度长期以来被批评为过度自信、粒度粗糙且容易聚集在整数分值上,但目前已成为面向顶级专有模型的大模型评判者更稳健的软评分机制。在涵盖SummEval、AggreFact和HelpSteer2共18个大模型的评估中,我们发现:对于2025年后发布的模型,"优先使用对数概率"的标准建议已不再成立,语言化置信度才是更优的评估信号。我们将此现象称为"兼容性转变"。在标准语言化置信度基线之上,我们引入两个新要素:过度自信提示和自我辩论机制。二者协同提升了模型校准度、分值分布离散度及对任务主观性的鲁棒性。我们进一步观察到"生成代际效应":2025年后模型在加入这两个要素时几乎无损平衡准确率,而2025年前模型则会出现显著性能下降。与基于对数概率的G-Eval方法相比,在GPT系列顶级模型中,语言化置信度作为软信号更能抵抗主观性干扰。这种转变在仅报告准确率时难以察觉。我们建议在大模型评判范式中更广泛地采用软评分机制,而非默认使用硬预测。总体而言,语言化置信度已从对数概率的次优替代方案,发展为当代大模型评判者的实用软评分工具。

思科系统

## 引言

大模型评判者范式通过提示通用大模型,根据特定质量标准对候选输出进行评分。一个核心方法论问题是:评判者应采用何种软信号?是对预测词元取对数概率,还是产出语言形式的自然语言置信度。2025年前的证据强烈支持采用对数概率。G-Eval研究发现,大模型的Likert评分往往聚集于少数整数值,削弱了与人类评分(如Kendall's τ系数)的排序相关性。因此G-Eval通过词元对数概率计算更精细的期望分数(Liu et al. 2023)。Wang等人(2025)进一步证明,在逐点、配对和列表排序场景中,G-Eval风格的软评分方案优于贪婪语言提取。大规模基准测试显示大模型在语言化表达时存在系统性过度自信问题(Xiong et al. 2024),近期研究更指出语言化分数聚集于少数整数值,严重削弱其区分能力(Dai and Wang 2026)。因此主导的实际建议始终是"优先采用对数概率"。

然而,这些证据大多来自2025年前的模型。我们发现,在当代专有旗舰模型(各厂商顶级模型)上,比较结果呈现不同态势。随着前沿厂商推进2025年后的发布浪潮,两个趋势形成反向作用力:在对数概率方面,API访问稳定性持续下降,闭源模型API日益限制或取消对数概率接口;在语言化方面,近期关于开源权重模型的机制研究表明,模型的语言化置信度并非单纯将词元概率转化为文字,而是反映了更丰富的内部评估,能够传递未被对数概率捕捉的信息(Kumaran et al. 2026)。尽管我们无法在闭源旗舰模型(其内部结构及对数概率通常不可访问)上进行机制验证,但这一发现促使我们通过行为实验提出核心问题:能否通过提示工程,使语言化信号的信息量匹配甚至超越基于对数概率的软评分?

本研究通过涵盖GPT、Claude和Gemini系列共18个模型的横截面评估验证该问题,样本包含2025年前检查点和2025年后旗舰模型。我们发现,精心设计的语言化置信度方案现已成为前沿评判者的实用软信号。在唯一能公平对比对数概率的GPT系列中,我们的提示方案超越了基于对数概率的G-Eval,逆转了2025年前的偏好。我们称这种逆转为"兼容性转变":最优提示指导取决于模型世代,因此基于某一代模型校准的建议可能在新一代模型上失效。我们将转变归因于"生成代际效应":2025年后旗舰模型能更好地执行更复杂的评判提示,通过过度自信提示和自我辩论机制(在单次调用中权衡正反立场),在保持平衡准确率的同时提升校准度。而2025年前模型在相同提示下会损失显著的平衡准确率。当我们分析软分数的校准度和分值分布离散度时,这种转变变得清晰可见。因此我们建议在大模型评判中更广泛采用软评分,并通过这些指标而非单一硬预测准确率进行报告。

#### 核心主张与贡献

- 提出无需对数概率的语言化置信度方案(方法部分),在现有评分标准基线上仅增加过度自信提示和自我辩论两个要素,产出的概率分数比基线具有更好的校准度、更广的分布离散度和更低的任务主观性耦合度——这正是语言化置信度成为强软信号的根本原因。
- 揭示软信号的兼容性转变(兼容性转变章节)。在GPT系列旗舰模型(唯一仍返回对数概率的系列,Claude从未提供,Gemini在3.1 Pro版本后取消)上,语言化置信度超越基于对数概率的G-Eval,成为更具抗主观性干扰的信号,且与人类评分的对齐度随GPT世代迭代稳步提升,而G-Eval则呈现波动。
- 提出转变的生成代际效应解释(同章节)。2025年后旗舰模型在加入提示和自我辩论后仍保持预测准确率,而2025年前模型则出现显著准确率损失。这种差异解释了为何该方案能使当前模型受益,却对老一代模型造成精度代价。

#### 研究范围

大模型评判者是无参考质量评估的核心工具:无需标准参考即可对候选输出评分。我们研究其单次调用、逐点评估形式,即单次模型调用返回二元判断及软置信度分数。单次调用既是可扩展性选择,也是基础性选择:多次调用和多智能体评判均建立在包含本次研究的单次评判判断与置信度信号的基础上。此外,评估需权衡单样本资源消耗与数据规模,单次调用能保持低成本以支持更大规模的稳定代表性评估。我们研究两类评判目标:通过AggreFact的9个任务评估客观事实忠实性,通过SummEval的3个任务(一致性、连贯性、相关性)及HelpSteer2基准评估主观质量——这些任务本身具有不同的主观性程度。存在可验证答案的任务(如编程、数学及许多智能体目标)采用可验证的参考式评估以确保正确性,不属于本研究范畴,配对评判、列表排序评判及多次调用多智能体辩论同样不在研究范围内。我们聚焦于GPT、Claude和Gemini系列的当代闭源旗舰模型,以较小规模和开源权重模型作为生成代际效应的对照。

## 方法

### 提出的软评分协议

图1:本文对比的提示协议。G-Eval(对数概率基线)从词元对数概率中读取对数概率软分数,而语言化协议以自然语言陈述分数,产生语言化软分数及硬预测(真/假)。评分标准是语言化基线。我们的方案在评分标准基础上增加两个要素:过度自信提示和自我辩论步骤(先论证真、再论证假、最后得出结论),产出比评分标准更优校准且更抗主观性干扰的语言化软分数。所有协议共享剩余模块:任务定义、提示输入、响应请求、评分标准和输出格式。提示设计部分详细说明各模块在对数概率与语言化评分中的具体实现。我们的方案-自由推理作为消融实验,将自我辩论步骤替换为自由形式推理,该部分有定义但未在图中显示。我们从纯语言信号构建概率分数,目标是提取满足两个条件的软分数:(1)在给定质量标准下对真/假具有强区分度,(2)具备良好校准性。我们将大模型应用限制为:

1. 单次调用评判,排除多智能体设置;
2. 逐点二元分类。传统机器学习分级器通常提供0到1之间的连续质量分数,大模型虽可通过提示转化为临时二元分类器,但通常缺乏传统模型软评分的粒度精度。

基于对数概率的方法(如G-Eval及判断分布线)是成熟替代方案,但闭源模型API的对数概率访问可靠性持续下降(见补充材料)。因此我们聚焦无对数概率协议。

我们提出两个语言化置信度协议:我们的方案-自由推理和我们的方案,以仅含评分标准的基线和基于对数概率的G-Eval作为比较基准(图1)。

#### 提示组件

两个组件使我们的方案区别于评分标准基线,因精确措辞重要,此处复现SummEval相关性任务的实例化版本(完整模板见补充材料)。过度自信提示警告评判者避免过度自信,例如:"您在历史评估中持续表现出过度自信...";自我辩论要求评判者在决定前论证正反双方,例如:"模拟三步辩论:(1)主张为真因为...(2)主张为假因为...(3)解释:基于双方论证确定最终答案"。

#### 提示设计

我们将评判提示视为可复用组件的组合。三个共享模块(响应请求、评分标准、输出格式)根据各协议输出类型实例化。G-Eval请求Likert评分,其评分标准锚定Likert量表,输出为单一Likert值并从中读取对数概率软分数。语言化协议则请求二元预测及0-100置信度分数,其评分标准为固定置信度表述方式的置信度标准,输出按顺序列出答案和置信度。本研究定义三个语言化协议:

- • 评分标准(基线):无对数概率的语言化置信度协议,要求模型在置信度标准下提供二元判断及显式置信度分数。
- • 我们的方案-自由推理(消融实验):在评分标准基线上增加抑制过度自信的提示文本,并在预测前进行自由形式推理。模型被要求提供显式、无约束的推理,但无需考虑双方立场。
- • 我们的方案:完整方案,在评分标准基础上增加上述提示文本和自我辩论要求。

与评分标准基线相比,我们的协议仅改变两个组件:过度自信提示和推理模块(我们的方案-自由推理采用自由形式,我们的方案采用自我辩论)。置信度标准、输出顺序和引用证据子指令在三个协议中保持不变,因此对比我们的方案-自由推理与我们的方案可隔离自我辩论与自由形式推理的效果差异。因篇幅限制,原始提示模板见补充材料。

### 评估指标

表1定义了六项测量指标及其在实验中的应用。我们综合报告而非孤立呈现,因为单一指标无法揭示兼容性转变,只有组合分析才能体现(将在讨论部分详述)。

表1:六项指标:测量内容、优化方向(↑/↓)及出现位置。AECE为采用自适应等质量分箱的期望校准误差。Spread公式见正文。需要说明两点:Oracle BA直接在评估集上优化决策阈值,因此被视为从置信度可恢复的理想预测准确率,(非负)Oracle-Prediction Gap(OP Gap)表示已生成预测未利用的信号部分。Spread是置信度直方图q̂=(q̂₁,...,q̂_B)在[0,1]区间B个等宽分箱上的 Bhattacharyya 系数,与均匀参考分布的比较值:
\[ \mathrm{Spread}(\hat{q})=\frac{1}{\sqrt{B}}\sum_{b=1}^{B}\sqrt{\hat{q}_b} \]
我们采用此指标而非熵,因为我们追求与均匀分布的接近度,而非一般性离散度。

## 实验设置

### 任务设计

我们使用三个基准测试:SummEval和HelpSteer2均考察对任务主观性的鲁棒性(HelpSteer2作为SummEval结果的独立复现),AggreFact则探究提示压力下的二元事实忠实性。

SummEval(Fabbri et al. 2021)是分级主观评估:100篇文档各配对17个机器生成摘要及专家5点Likert评分。我们使用三个维度作为独立评判任务:一致性(摘要是否忠实于原文)、连贯性(摘要是否成文流畅)、相关性(摘要是否抓住重点同时避免冗余或无关细节)。

SummEval各维度的标注者间一致性(IAA)采用Krippendorff's α系数(专家5点评分),α值越低表示任务主观性越高:一致性α=0.80(最客观)、连贯性α=0.55(较主观)、相关性α=0.40(高度主观)。我们使用IAA作为后续斜率分析的任务主观性协变量。

HelpSteer2(Wang et al. 2024b)是现代大模型输出质量基准,约1000名众包标注者对21k提示-响应对进行3-5人评分。其众包标注和任务多样性与SummEval的三专家面板形成鲜明对比,因此我们将其作为主观性结果的独立复现而非合并扩展。我们采样800个样本。由于HelpSteer2的任务多样性无法得出单一任务一致性值,我们通过3-5个评分的标注者分歧衡量单样本主观性,这与SummEval的IAA具有可比性。

AggreFact(Tang et al. 2023a)是二元事实忠实性测试套件,覆盖多种问题场景:RAG幻觉检测(RAGTruth)、检索增强声明验证(ClaimVerify)、专家问答验证(ExpertQA)、长文本问答验证(Lfqa)、多步推理验证(Reveal)、对话验证(Dialo)等。

相似文章

面向可靠LLM判断的边际自适应置信度排序

arXiv cs.LG

本文提出了一种针对LLM作为评判系统的基于边际的置信度排序方法,通过学习专用估计器来确保置信度与人类分歧风险之间的单调性,具有泛化保证,并在多个数据集上提高了排序准确性。

LLM置信度估计的不同方法基准测试

Reddit r/artificial

本文对LLM置信度估计的各种黑盒与白盒方法进行了基准测试,包括口头化置信度、语言不确定性、推理长度、P(Answer)、P(True)和自我一致性,比较它们在主动学习和安全分类等任务中的有效性。