LLM置信度估计的不同方法基准测试
摘要
本文对LLM置信度估计的各种黑盒与白盒方法进行了基准测试,包括口头化置信度、语言不确定性、推理长度、P(Answer)、P(True)和自我一致性,比较它们在主动学习和安全分类等任务中的有效性。
LLM评判器在AI团队中越来越常见,因为它们能够自动化需要复杂推理和分析的决策。将其推理能力与校准的置信度分数结合,解锁了与AI合作的全新方式。例如,主动学习增强的提示优化利用低置信度决策来策展黄金集,使评判器能以更少的标注工作量学习人类专业知识。此外,面向智能体和聊天机器人的安全分类器可以使用置信度分数来可靠地处理假阴性。LLM的不确定性量化是一个仍处于早期阶段的活跃研究问题,白盒与黑盒方法之间持续存在竞争。白盒方法利用机械可解释性,从模型的残差流中读取不确定性信号,这些残差流是模型在每一层计算的中间向量,权重将提示转换为答案。它们需要访问权重,因此只适用于开源模型。黑盒方法使用令牌本身,有时也使用令牌对数概率。由于不需要权重,大多数黑盒方法可用于所有模型,包括闭源模型。我比较了前8种黑盒方法与顶级白盒方法,以最终解决这个问题:哪种LLM置信度估计方法最好?在本文中,我将详细解释每种方法以及它们之间的比较。
基于文本的
口头化置信度
如果你涉足过置信度估计,这可能是你的首选。你问模型:“在0到100的范围内,你有多确定?”由于RLHF,模型被训练得听起来自信且讨人喜欢,这意味着你得到的不再是“你应该在这里检查我的工作”,而是“信我,兄弟”。一篇论文发现,无论是否正确,口头化置信度得分都聚集在80-100%的区间内。
语言不确定性
人类在不确定时倾向于使用某些词语和短语。LLM从人类那里学会了说话和思考,所以也许它们也这样做?(我刚刚就这么做了)语言不确定性方法统计模型回复中模糊词(“也许”、“可能”、“我认为”)和警示语(“据我所知”、“在大多数情况下”)的频率。
推理长度
同样基于人类心理学,这种方法假设模型说得越长,它知道的就越少。在基于文本的方法中,这种方法最有道理,因为有些模型经过后训练,会对它们认为困难的任务进行更长时间的推理。话虽如此,这类方法在推理模型上表现更好。
基于令牌的
P(Answer)
可能是你的第二个选择,当你意识到LLM已经免费提供了概率。你读取答案令牌的概率,并与其他选项的概率进行归一化。在实践中这可能有点棘手,因为答案很少是单个令牌。
P(True)
P(True)通过将模型自身的答案输入并询问“这是正确的:是/否?”来绕过P(Answer)中的多令牌答案问题。大多数分词器将“是”和“否”视为单个令牌,使得读取概率分布更容易。基于令牌的方法在2026年是最不实用的,因为它们与推理模型不兼容。思考轨迹通常会提到将选择哪个答案,因此当目标令牌被采样时,答案已经确定:污染了概率分布。
基于采样的
自我一致性
将同一问题在温度为1时采样8次,并统计模型与自身一致的次数。这会花费你额外的7次API调用,而且很可能测量的并不是你想要的那种不确定性。MIT发现自我一致性主要测量的是偶然不确定性,即数据本身不可缩减的噪声。例如,评判器猜测硬币落地是哪一面,或者即使是两位专家也会意见分歧的模糊任务。对于主动学习,你需要的是认知不确定性,即模型自身知识中的空白,这些空白可以通过更多数据或更好的规格来填补。不幸的是,对于自我一致性,当模型在认知上错误时,它往往又会再次错误……再错7次。
提示扰动一致性
提示扰动与自我一致性同源,但你会调整框架以查看判决是否保持不变。在我的实验中,我在四种重新措辞的系统提示下重新运行每个判断(简洁、对明显答案持怀疑态度、仅依赖给定证据、删除任何额外文本),并将置信度评分为这四个中保持原始判决的比例。这是修复自我一致性固有问题的合理尝试,但实际上它是整个阵容中最弱的方法。
跨模型一致性
这才是真正的修复:通过询问其他模型是否同意来暴露认知差距。这是迄今为止最强的黑盒方法,并且在基准测试中保持一致,但可能很难找到适合用于面板的模型集。我从三个不同的模型家族构建了面板,使它们的知识互补而不是冗余。我还确保面板上的所有模型在基准测试上的准确率不超过±15%,以确保面板由真正的同侪组成,而不是教师或学生。更多内容稍后介绍!
机械解释探针(白盒)
对于白盒方法,我们使用Modaic SDK的Modaic探针。这些探针使用ML模型,经过训练以读取LLM内部状态中的不确定性和正确性信号。这些信号迄今最强。由于Modaic探针是ML模型,它们还有能力“作弊”,针对每个基准测试进行自我调优,而其他方法则难以在不同任务类型(二分类与多分类、主观与事实、推理与简单等)间保持一致。为了保持比较公平,我展示了未调优的探针结果,以及仅使用任务中100个标注示例进行调优的探针结果。
评估(gpt-oss-120b)
我们使用两个指标进行评估:AUROC和ECE。ECE代表期望校准误差。它将每个分数分组到箱中(0-10%、10-20%等),并测量箱中平均置信度与平均准确率之间的平均差异。换句话说,它衡量预测的置信度估计其正确性的程度。ECE越低越好,高于0.25则属于随机数生成器范围。虽然校准很重要,但它也非常容易被利用。一个特别懒惰的置信度估计器可以只输出评判器本身的准确率,并获得近乎完美的ECE。这就是为什么AUROC是我们的主要指标。AUROC是随机选择的正确预测获得比随机选择的错误预测更高置信度的概率。此外,它衡量估计器是否知道一些可以区分好坏的信息。0.5表示你的估计器不比抛硬币好,1.0表示完美。
我运行了两个评判器:gpt-oss-120b,一个中型推理模型,以及Llama-3.1-8B,一个小型非推理模型。每个评判器在八种黑盒方法上测量(gpt-oss由于无法进行令牌对数概率,因此为六种),加上Modaic探针的两种设置:未调优和在100个示例上调优。调优后的探针从未在保留的评估集示例上进行训练。我在MMLU-Pro、MT-Bench、ARC-Challenge和HaluEval Summarization上评估了1000个保留示例。CodeJudgeBench 344个,OR-Bench Toxic 300个,JudgeBench 254个,GPQA-Diamond 198个。gpt-oss-120b基准测试
gpt-oss-120b准确率
MMLU-Pro 79%
OR-Bench Toxic 69%
JudgeBench 82%
GPQA-Diamond 72%
MT-Bench 74%
ARC-Challenge 95%
CodeJudgeBench 83%
HaluEval Summ. 70%
AUROC(越高越好):
方法 MMLU-Pro OR-Bench JudgeBench GPQA MT-Bench ARC CodeJudge HaluEval
基于文本
口头化置信度 0.79 0.67 0.67 0.79 0.58 0.68 0.54 0.64
语言不确定性 0.79 0.74 0.74 0.82 0.60 0.71 0.67 0.60
推理长度 0.69 0.82 0
相似文章
量化LLM基准中的排名不确定性
本文分析了MMLU等LLM基准中排名不确定性的来源,提出了对假设检验的修改,以构建排名置信区间,并表明不同主题间的变异性很大。
面向可靠LLM判断的边际自适应置信度排序
本文提出了一种针对LLM作为评判系统的基于边际的置信度排序方法,通过学习专用估计器来确保置信度与人类分歧风险之间的单调性,具有泛化保证,并在多个数据集上提高了排序准确性。
自我评价之言:大语言模型在机器翻译中的口头化置信度研究
本文研究了从大语言模型中提取机器翻译输出置信度的口头化方法,并将其与内部token概率进行了比较。研究发现,尽管两种方法在错误检测和校准方面表现相似,但内部置信度与口头化置信度之间几乎没有相关性。
基准是否低估了 LLM 的性能?采用以大语言模型为先、人工仲裁的评估方法评估幻觉检测
本文通过采用以大语言模型为先、人工仲裁的评估方法重新评估幻觉检测数据集,研究了标准基准是否低估了大语言模型(LLM)的性能。研究发现,在仲裁过程中融入大语言模型的推理能力可以提高评估的一致性,并表明针对容易产生歧义的任务,采用模型辅助的重新评估能产生更可靠的基准。
基于推理的不确定性估计:LLM在多语言和跨语言MCQA性能中的大规模研究
本文对LLM在22种语言中的九种不确定性估计方法进行了大规模评估,发现提示模型用英语推理可改善低资源语言的不确定性估计,且方法的选择取决于模型规模。