判断、检索或放弃:具有可证明风险保证的不确定性防护LLM判断
摘要
本文提出一个风险控制框架,用于在事实评估中将LLM作为判断器。该框架校准不确定性阈值以维持用户指定的错误率,并在必要时路由到检索增强模式,从而实现具有可证明可靠性保证的更高覆盖率。
arXiv:2608.17994v1 Announce Type: new
摘要:将LLM用作判断器已成为大规模评估模型输出的标准做法。这在主观、开放性任务中尤为常见,例如评估帮助性或对齐性,这些任务没有单一的参考答案。然而,客观任务为无参考的LLM判断引入了独特的可靠性挑战。在没有参考答案的情况下,判断器通过其参数知识或工具增强来评估事实正确性。虽然前者实现了高效评估,但判断器可能产生幻觉或缺乏足够证据支持其结论。相反,工具增强可以提供额外证据,但会引入额外的计算成本,并需要适当的机制来确定何时以及如何可靠地使用这些证据。更重要的是,单独任一方法都无法对接受的结论风险提供形式化控制,也无法在指定级别上保证其可靠性。我们提出一个风险控制框架,该框架在校准集上校准不确定性阈值,使得接受结论中的错误发现率在高概率下保持在用户指定的水平~$\alpha$以下,使用有限样本Clopper-Pearson区间。当参数模式不够置信时,实例被路由到检索增强模式,其中判断器收集网络证据并在第二个校准阈值下重新评估该实例。有限样本保证在不增加额外假设的情况下延伸到这种双阈值路由。在开放域QA基准和不同规模的判断器上,该框架保持了目标错误率,同时实现了比单模式基线高得多的覆盖率。
查看缓存全文
缓存时间: 2026/08/19 10:11
# 判断、检索或弃权:具有可证明风险保证的不确定性防护LLM评估
来源:https://arxiv.org/html/2608.17994
Ali Emami
所属机构:埃默里大学
{sh545346,hsajjad}@dal.ca, [email protected]
Hassan Sajjad
所属机构:达尔豪斯大学、纽约大学阿布扎比分校
###### 摘要
使用LLM作为评估器已成为大规模评估模型输出的标准实践。这在主观、开放式任务(如评估有用性或对齐性)中尤为常见,因为此类任务不存在单一的参考答案。然而,客观任务为无参考的LLM评估引入了独特的可靠性挑战。在缺乏参考答案的情况下,评估器通过其参数知识或工具增强来评估事实正确性。前者虽能实现高效评估,但评估器可能产生幻觉或缺乏足够证据支持其判断。相反,工具增强可提供额外证据,但会增加计算成本,且需要适当机制来确定何时及如何可靠使用这些证据。更重要的是,这两种方法均无法单独对已接受判断的风险进行形式化控制,也无法在指定水平上保证其可靠性。我们提出一个风险控制框架,利用有限样本Clopper-Pearson区间在保留集上校准不确定性阈值,使得已接受判断的错误发现率以高概率保持在用户指定水平α以下。当参数模式置信度不足时,实例会被路由至检索增强模式,评估器在此收集网络证据并在第二个校准阈值下重新评估实例。有限样本保证无需额外假设即可扩展到此双阈值路由机制。在开放领域问答基准和不同规模的评估器上,该框架在保持目标错误率的同时,实现了比单模式基线显著更高的覆盖率。
## 1 引言
LLM作为评估器已成为人类评估的可扩展替代方案,用于评估语言模型输出[39]。它使从业者能够以远低于人类标注所需的成本和时间评估数千个模型输出[11;29]。然而,大多数现有工作将LLM评估器用于主观评估[6],例如在奖励建模中为有用性、无害性或风格等输出评分,其中不存在单一正确答案,近似一致即可[38;19]。将LLM评估器扩展至客观事实评估仍是开放挑战。在事实性和开放领域问答中,答案要么正确要么错误,评估器必须可靠地做出此判定。然而,为此获取大规模真值标注成本高昂[9;22],需要领域专业知识处理专业问题,且当LLM作为自主智能体在无预收集标签的真实环境回答开放式查询时完全不可行。LLM评估器提供了消除这种依赖性的无参考替代方案。然而,利用LLM评估器评估正确性而不使用显式参考会引入两个关键可靠性挑战[26;7]。首先,LLM评估器受限于其训练数据,可能缺乏对近期事件、罕见实体或专业领域的知识[36]。此类限制可能妨碍可靠区分正确答案与看似合理的伪造答案。其次,即使评估器具有相关知识,幻觉仍可能导致其产生自信但错误的判断[12]。在这两种情况下,失败是静默的,因为评估器未表明其判断不可靠。若无机制来量化和应对这种不确定性,错误评估可能未被察觉地传播至下游决策。选择性评估提供了自然的缓解策略,允许评估器在不确定时弃权,仅在可能正确时生成判断。不确定性量化方法可识别不可靠的判断[27]。然而,对这些分数应用启发式阈值无法对已接受评估的错误率提供形式化保证[5]。近期关于风险控制选择性预测的工作通过校准统计有效阈值来解决此差距,以高概率约束所选输出中的错误发现率[30;33]。然而,现有方法旨在筛选问答任务中的考生答案,而非控制元评估设置中的错误。此外,早期方法将弃权作为不确定实例的唯一补救措施。这丢弃了评估器的不确定性源于可借助额外证据解决的知识差距或幻觉的情况[4]。本文提出针对LLM评估器的风险控制选择性评估框架,以解决上述局限。受LLM智能体利用外部工具克服参数局限性的启发,我们为评估器配备网络搜索作为工具以弥补其知识差距。我们的框架以两种模式运行。模式1中,评估器模型仅使用其参数知识进行评估,不借助任何工具增强。若评估器自信,则接受判断。若不确定,实例将被路由至模式2,评估器从网络检索相关证据并在增强上下文中重新评估。若检索后评估器仍不确定,则弃权并将实例标记供人工审查。两个阈值通过Clopper-Pearson上置信区间[10]在已知真值标签的保留集上联合校准。我们证明固定阈值对的有限样本FDR保证可扩展至双阈值路由设置,无需额外分布假设。我们的贡献包括:
- • 我们针对事实性问答中的LLM评估器制定风险控制选择性评估方案。
- • 我们引入双模式路由机制,为评估器配备自适应网络检索以在弃权前解决不确定性。
- • 我们证明Clopper-Pearson界限所需的伯努利结构可扩展至双阈值路由设置。
- • 在开放领域问答基准和不同规模评估器上的实验表明,自适应检索在控制评估器错误率的同时,恢复了相对于单模式基线的显著覆盖率。
## 2 相关工作
##### LLM作为评估器。使用LLM评估其他模型的输出已作为人类标注的经济高效替代方案被广泛采用。强大的LLM可近似人类在主观维度上的偏好[19]。因此,它们已被用于奖励建模和强化学习[28]。近期,LLM评估器已扩展至事实评估等客观任务。SAFE[35]使用配备网络搜索的LLM智能体验证长文本响应中的单个事实。类似地,SAGE[4]采用工具增强智能体迭代检索和综合外部证据,进行无参考问答评估。这些工作提高了评估器准确性,但未对判断可靠性提供形式化保证。
##### LLM评估的不确定性量化。现有方法通常分为两类。白盒方法从评估器的词元概率估计不确定性。最常见的选择是输出分布的预测熵[20]。这些概率相对于正确性通常校准良好[16]。黑盒方法则通过重复查询评估器并测量其判断的一致性来估计不确定性[31;32]。两种信号均与评估器准确性相关,并可标记低置信度判断[5]。然而,它们仍是启发式的。例如,手工选择或在验证集上调整的阈值无法对已接受判断的错误率提供形式化保证。
##### 基于不确定性的路由和工具使用。平行研究线利用不确定性来确定何时需要额外资源。FrugalGPT[8]和AutoMix[1]使用置信度在具有不同能力的模型之间路由查询,在成本与质量间权衡。相比之下,FLARE[13]使用词元级不确定性来决定生成期间何时检索外部信息。近期,SAGE[4]为LLM评估器引入搜索增强检索,评估器作为智能体在评估自由形式答案时收集定向证据。然而,这些方法通常依赖无条件检索,引入了不必要的计算。此外,它们未对所得评估的错误率提供形式化保证。
##### 风险控制选择性评估。保形预测通过基于保留数据校准的预测集提供无分布、有限样本覆盖保证[2]。保形风险控制将其扩展至覆盖范围之外,以用户指定水平约束任意损失函数,包括FDR[3]。近期工作将这些保证应用于问答。SConU构建预测集以高概率覆盖可接受答案[34]。类似地,COIN[33]使用Clopper-Pearson上置信区间[10]校准不确定性阈值,以约束已接受答案中的FDR。更接近我们设置的是,Trust or Escalate[15]和SCOPE[5]将风险控制选择性预测应用于成对评估,并对已接受判断的人类一致性提供保证。然而,两者均针对主观偏好任务,其中评估器比较两个响应而非评估事实正确性(即客观评估)。我们的框架引入风险控制检索增强评估,其中检索基于校准的不确定性阈值选择性激活。与无条件检索方法不同,它为已接受判断提供形式化FDR保证。
## 3 方法论
我们提出针对LLM评估器的风险控制框架。该框架在具有人类标签的保留集上校准不确定性阈值,使得在评估器评估的所有实例中,产生错误判断的概率被用户指定的风险水平α约束[2;3]。当评估器不确定时,框架首先尝试通过网络检索改进评估;若检索后评估器仍不确定,则弃权并将实例标记供人工审查111我们不实现人工审查;该术语表示这些实例被排除在自动化评估之外。
### 3.1 问题表述
##### 任务。设F: X → Y为考生LLM,给定问题x ∈ X生成候选答案ŷ ∈ Y,并设y* ∈ Y为相应的真值答案。评估器LLM J: X × Y → {0,1}评估ŷ是否正确回答了x,生成二元判断v ∈ {0,1},其中v=1表示评估器认为ŷ正确。
##### 准入函数。真值评估标签e* ∈ {0,1}表示ŷ是否真正正确。它可通过人类标注获得,或通过应用任务特定相关性函数Aref: Y × Y → [0,1]及阈值λA得到:e* = 1[Aref(ŷ, y*) ≥ λA]。(1)
判断v可接受当且仅当其与真值匹配:A(v, e*) = 1[v = e*]。(2)
##### 选择性评估。评估器不必总是输出判断,可在不确定时弃权。我们定义失败指示符W = 1[v ≠ e*]。给定不确定性分数U(定义见§3.2),评估器仅在U ≤ t(对于某阈值t)时输出判断。错误发现率为:R(t) = E[W | U ≤ t],(3)即评估器选择评估的实例中的错误率。
##### 目标。对于用户指定风险水平α ∈ (0,1)和显著性水平δ(例如0.05),我们寻求阈值t使得:Pr(R(t) ≤ α) ≥ 1−δ,(4)其中概率是校准数据随机性的函数。以高置信度(1−δ),评估器非弃权输出中的错误率至多为α。
##### 校准数据。我们保留N个校准样本Dcal = {(x_i, ŷ_i, y_i*)}_{i=1}^N,其中包含已知真值标签e_i*,从数据生成分布D中独立同分布抽取。
### 3.2 不确定性量化(UQ)
准确的不确定性估计对选择性评估至关重要:不确定性分数区分正确与错误判断的能力越强,在给定风险水平下的覆盖率(更少弃权)越高。
### 3.3 风险约束选择性评估
我们现在描述如何校准不确定性阈值以满足公式(4)的保证。本节介绍评估器仅使用其参数知识(无检索)的基础情况;我们将在第相似文章
面向可靠LLM判断的边际自适应置信度排序
本文提出了一种针对LLM作为评判系统的基于边际的置信度排序方法,通过学习专用估计器来确保置信度与人类分歧风险之间的单调性,具有泛化保证,并在多个数据集上提高了排序准确性。
面向多LLM系统中不确定性感知的信任估计方法:基于结构化专家判断
本文介绍了一种面向多LLM预测聚合的不确定性感知信任估计方法,该方法改编自结构化专家判断,采用库克风格对数加权来惩罚过度自信的错误预测。在MMLU和MMLU-Pro上的评估表明,该方法在异构和受污染的专家面板下实现了优越的准确性与可靠性平衡。
一致但校准不佳:评估LLM在自然语言风险沟通中的局限性
本文评估了九个LLM在自然语言中准确传达概率预测的能力,发现模型表现一致但校准不佳,尤其是在不确定性任务上。
安全是情境性的,LLM评判者则不然:驾驭评估者的刚性先验
本文研究了用于安全评估的LLM-as-judge适应情境信息及不同安全定义的能力,发现它们基本是刚性的,当情境与其内部先验相矛盾时无法调整。
LLMs-as-a-Judge在多语言环境和低资源语言中的挑战与建议
本文分析了LLM-as-a-Judge在多语言和低资源场景下的应用,发现评估结果不一致且过度信任LLM判断,并提出了改进实践的建议。