面向多LLM系统中不确定性感知的信任估计方法:基于结构化专家判断

arXiv cs.LG 论文

摘要

本文介绍了一种面向多LLM预测聚合的不确定性感知信任估计方法,该方法改编自结构化专家判断,采用库克风格对数加权来惩罚过度自信的错误预测。在MMLU和MMLU-Pro上的评估表明,该方法在异构和受污染的专家面板下实现了优越的准确性与可靠性平衡。

arXiv:2607.20529v1 公告类型:新 摘要:大型语言模型(LLM)集成通过组合多个LLM的预测来提高可靠性,应用日益广泛。然而,现有的聚合方法通常假设所有模型同等可信,忽略了不确定性质量的差异。这一假设不适用于异构LLM,其可靠性和能力差异显著,使得简单聚合容易受到不可靠或对抗性专家影响。在本文中,我们将多LLM聚合问题形式化为不确定性感知的信任估计问题。我们借鉴决策理论中的结构化专家判断,使用上下文感知的校准问题,根据专家概率预测的质量来估计其可靠性。具体来说,我们采用库克风格对数加权,惩罚过度自信的错误预测,并偏好校准良好的专家。我们在同质、异构和受污染的专家面板上进行了MMLU和MMLU-Pro评估。结果表明,虽然在同质环境中聚合方法表现相似,但在异构和受污染情况下,库克加权变得至关重要。它在准确性和可靠性之间实现了优越的平衡,并且在引入不可靠专家时保持鲁棒性。这些发现表明,多LLM聚合不仅需要结合预测,还需要在不确定性下校准信任。
查看原文
查看缓存全文

缓存时间: 2026/07/24 05:10

# 基于结构化专家判断的多LLM系统不确定性感知信任估计
来源:https://arxiv.org/html/2607.20529
Jiazhen Zhang DigitLab, 埃克塞特大学 j\.zheng2@exeter\.ac\.uk, j\.zhang15@exeter\.ac\.uk

###### 摘要

大型语言模型(LLM)集成通过组合多个LLM的预测来提升可靠性,其应用日益广泛。然而,现有的聚合方法通常假设所有模型同等可信,忽视了不确定性质量的差异。这种假设对于异构LLM并不适用,因为它们的可靠性和能力差异显著,导致简单聚合容易受到不可靠或对抗性专家影响。在本工作中,我们将多LLM聚合问题形式化为一种不确定性感知的信任估计问题。我们从决策理论中借鉴了结构化专家判断方法,利用上下文感知的校准问题,基于专家概率预测的质量来估计其可靠性。具体而言,我们采用Cooke式对数加权法,该方法会惩罚过度自信的错误预测,并青睐校准良好的专家。我们在MMLU和MMLU-Pro数据集上,针对同质、异构和受污染专家小组进行了评估。结果表明,虽然聚合方法在同质设置下表现相似,但在异构和受污染情况下,Cooke加权变得至关重要。它在准确率-可靠性之间取得了更优的平衡,并且在引入不可靠专家时仍保持稳健。这些发现表明,多LLM聚合不仅仅是组合预测,更需要在不确定性下校准信任。

基于结构化专家判断的多LLM系统不确定性感知信任估计

Jiawei Zheng 和 Jiazhen Zhang
DigitLab, 埃克塞特大学
j\.zheng2@exeter\.ac\.uk, j\.zhang15@exeter\.ac\.uk

## 1 引言

大型语言模型(LLM)越来越多地被部署在需要不确定性下进行可靠推理的场景,包括科学分析、医疗支持和法律决策Huang et al. (2024a (https://arxiv.org/html/2607.20529#bib.bib8))。在这些领域,系统的质量不仅取决于是否给出正确答案,还取决于其置信度是否合理Tian et al. (2023 (https://arxiv.org/html/2607.20529#bib.bib18)); Liu et al. (2024 (https://arxiv.org/html/2607.20529#bib.bib14))。近期研究表明,现代LLM经常表现出严重的校准失误,常常给出自信但错误的预测和幻觉Kumaran et al. (2026 (https://arxiv.org/html/2607.20529#bib.bib11)); Leng et al. (2024 (https://arxiv.org/html/2607.20529#bib.bib12)); Xiong et al. (2023 (https://arxiv.org/html/2607.20529#bib.bib21))。这种过度自信的失败在医疗等高风险场景中尤其危险,因为用户可能依赖置信度信号来评估可信度Zhou et al. (2025 (https://arxiv.org/html/2607.20529#bib.bib22)); Qin et al. (2024 (https://arxiv.org/html/2607.20529#bib.bib16))。

准确表达不确定性对于LLM的可靠和可信部署至关重要。先前工作已经研究了LLM中的不确定性估计和校准,表明它们经常校准不良,容易产生过度自信的错误Xiong et al. (2023 (https://arxiv.org/html/2607.20529#bib.bib21)); Tian et al. (2023 (https://arxiv.org/html/2607.20529#bib.bib18)); Kumaran et al. (2026 (https://arxiv.org/html/2607.20529#bib.bib11))。然而,这些方法在单个模型层面运作,假设不确定性可以在单个模型内解决。

然而在实践中,单个模型在不同输入和领域上表现出不同的可靠性。Lincoln et al. (2026 (https://arxiv.org/html/2607.20529#bib.bib13)); Kruse et al. (2025 (https://arxiv.org/html/2607.20529#bib.bib10)); Chen et al. (2025 (https://arxiv.org/html/2607.20529#bib.bib3))。不同的LLM展现出互补的优势,由于训练数据、目标和架构的差异,它们在输入空间的不同区域泛化能力更强Chan et al. (2022 (https://arxiv.org/html/2607.20529#bib.bib2))。这种多样性促使组合多个LLM以提高鲁棒性。然而,这也带来了一个关键挑战:模型不仅在准确性上存在差异,其不确定性估计的质量也各不相同Kumaran et al. (2026 (https://arxiv.org/html/2607.20529#bib.bib11))。

大多数现有的聚合方法,如多数投票和等权平均,仍然以准确性为中心,将所有模型视为同等可靠,没有考虑不确定性质量的差异Wang et al. (2022 (https://arxiv.org/html/2607.20529#bib.bib19)); Chen et al. (2025 (https://arxiv.org/html/2607.20529#bib.bib3))。结果,校准不良或过度自信的模型可能会不成比例地扭曲最终预测。最近一种方法通过模型分歧来估计不确定性Kruse et al. (2025 (https://arxiv.org/html/2607.20529#bib.bib10)),但没有直接解决哪些模型应该被信任的问题。因此,不可靠或校准不良的模型仍然可能对最终预测施加重大影响,特别是在异构或受污染的环境中。

在本工作中,我们将多LLM聚合问题框架化为一个不确定性感知的信任估计问题。我们不问如何组合预测,而是问:哪些模型应该被信任,以及在什么不确定性条件下?为了回答这个问题,我们改编了Cooke的方法Cooke (1991 (https://arxiv.org/html/2607.20529#bib.bib6)); Colson and Cooke (2018 (https://arxiv.org/html/2607.20529#bib.bib5)),这是一个来自决策理论的经典框架,用于组合不同专家的不确定性预测,来估计LLM聚合的可靠性。具体而言,使用已知答案的校准(种子)问题评估专家,并使用对数评分规则分配权重,该规则惩罚过度自信的错误,同时奖励校准良好的置信度。

我们在MMLUHendrycks et al. (2021 (https://arxiv.org/html/2607.20529#bib.bib7))和MMLU-ProWang et al. (2024 (https://arxiv.org/html/2607.20529#bib.bib20))上评估我们的方法,跨越三个逐步具有挑战性的场景:1) 前沿模型的同质小组,2) 结合不同能力模型的异构小组,以及3) 包含明确噪声或对抗性专家的受污染小组。在同质设置中,聚合方法表现相似。然而,随着异构性和污染程度的增加,不确定性感知的加权变得至关重要。特别是,Cooke加权在保持强准确性的同时,显著减少了过度自信的失败,并防止了其他基线中观察到的严重性能下降。

## 2 相关工作

LLM集成组合多个LLM已成为提高可靠性和推理性能的有效策略Choi et al. (2025 (https://arxiv.org/html/2607.20529#bib.bib4)); Ai et al. (2026 (https://arxiv.org/html/2607.20529#bib.bib1))。除了§1 (https://arxiv.org/html/2607.20529#S1)中提到的相关工作,一篇最近的综述系统地将这些方法分类为推理前、推理中和推理后聚合范式Chen et al. (2025 (https://arxiv.org/html/2607.20529#bib.bib3))。虽然这些方法提高了预测性能,但它们通常假设模型可靠性相等或优化目标是准确性Huang et al. (2024b (https://arxiv.org/html/2607.20529#bib.bib9)),而没有明确建模专家之间不确定性质量的差异。

LLM中的不确定性量化越来越多的研究关注LLM中的不确定性估计和校准,表明LLM经常校准不良且容易产生过度自信的错误Xiong et al. (2023 (https://arxiv.org/html/2607.20529#bib.bib21)); Tian et al. (2023 (https://arxiv.org/html/2607.20529#bib.bib18)); Kumaran et al. (2026 (https://arxiv.org/html/2607.20529#bib.bib11))。然而,大多数方法专注于在单个LLM层面衡量或校正不确定性Rivera et al. (2024 (https://arxiv.org/html/2607.20529#bib.bib17)); Leng et al. (2024 (https://arxiv.org/html/2607.20529#bib.bib12))。最近,Kruse et al. (2025 (https://arxiv.org/html/2607.20529#bib.bib10))提出使用信息论分歧来估计多LLM系统中的不确定性。他们主要从分歧中量化集成层面的不确定性,而不是估计单个LLM的可信度。

结构化专家判断(SEJ)我们的工作与SEJ密切相关,特别是Cooke的方法Cooke (1991 (https://arxiv.org/html/2607.20529#bib.bib6)),该方法根据专家在校准问题上的表现,使用适当的评分规则分配权重。我们将SEJ改编应用于LLM,将模型视为概率专家,并根据其不确定性估计的质量进行评估。与以往关注组合预测的LLM集成方法不同,我们的工作聚焦于不确定性感知的信任估计,从而在异构和受污染的专家小组下实现稳健的聚合。

## 3 方法

我们将一组LLM视为一个产生概率预测的异构专家小组,并将聚合问题形式化为不确定性下的信任估计问题。

### 3.1 问题形式化

我们考虑一个由 \( M \) 个专家组成的小组,每个专家 \( e_i \) 针对输入 \( x \) 产生概率预测。令 \( \mathcal{Y} \) 表示输出空间,可以是离散的、结构化的或基于序列的。对于输入 \( x \),每个专家提供一个预测分布:

\( p_i(y \mid x), \quad y \in \mathcal{Y} \)  (1)

目标是聚合这些专家预测,同时考虑专家可靠性和不确定性质量的差异。

我们假设可以访问一小部分校准示例:

\( \mathcal{D}_{seed} = \{ (x_j, y_j) \}_{j=1}^N \)  (2)

其中真实输出 \( y_j \) 是已知的。这些校准示例用于在目标集上聚合之前估计每个专家的信任度。

### 3.2 概率引出

对于每个输入 \( x \),每个专家产生一个归一化的预测分布。在实践中,对于LLM,这样的分布可以通过候选输出上的归一化概率或序列生成的词元级似然获得。

我们假设预测满足:

\( p_i(y \mid x) \geq 0, \quad \int_y p_i(y \mid x) \, dy = 1 \)  (3)

### 3.3 上下文感知的信任估计

我们使用应用于校准数据的对数评分规则来估计专家可靠性。在许多情况下,专家可靠性不是全局的,而是依赖于上下文的。例如,一个专家可能在一个领域表现良好,但在另一个领域表现不佳。为了捕捉这一点,我们引入 \( c(x) \) 表示与输入 \( x \) 关联的上下文变量。假设上下文变量是可观察的,可以是分类的(例如,主题标签),或者从元数据或任务结构中推导出来。

对于每个专家 \( e_i \) 和上下文 \( c \),我们计算一个特定于上下文的分数:

\( s_{i,c} = \frac{1}{|\mathcal{D}_{seed}^c|} \sum_{(x_i, y_j) \in \mathcal{D}_{seed}^c} \log p_i(y_j \mid x_j) \),  (4)

其中 \( \mathcal{D}_{seed}^c = \{ (x_j, y_j): c_j = c \} \) 包含上下文 \( c \) 中的校准示例。计算对数分数时,概率会被截断到一个小的常数 \( \varepsilon \) 以避免数值不稳定。

对数的性质确保了过度自信的错误预测比不确定的预测受到更严厉的惩罚。因此,评分函数可以区分校准良好的不确定性(预测反映真实不确定性)和过度自信的错误(不正确的结果获得高概率)。结果,信任估计对不确定性质量变得敏感,而不仅仅是正确性。

专家 \( e_i \) 的相应权重计算如下:

\( w_{i,c} = \frac{\exp(\tau S_{i,c})}{\sum_{m=1}^M \exp(\tau S_{m,c})} \)  (5)

其中温度参数 \( \tau \) 控制方法在高分专家上集中权重的程度。\( \tau \) 值越大,越倾向于选择校准最好的种子专家。除非另有说明,我们设置 \( \tau = 1 \)。

### 3.4 不确定性感知的聚合

给定每个专家的上下文相关权重,我们计算聚合预测为:

\( p_{agg}(y \mid x) = \sum_{i=1}^M w_{i,c} p_i(y \mid x) \).  (6)

最终预测根据任务从 \( p_{agg} \) 中得出,例如分类任务取 argmax,序列生成任务进行采样。

## 4 实验设置

### 4.1 数据集

我们在MMLU和MMLU-Pro上进行实验,这是两个广泛用于评估大型语言模型知识密集型推理能力的基准。MMLU包含涵盖广泛领域的四选一选择题,包括科学、数学、学术和专业科目。MMLU-Pro是MMLU的一个更具挑战性的扩展,包含更具挑战性的问题和更细微的选项区分。每个问题最多有十个选项。对于每个问题,我们指示LLM输出选项上的概率分布,称为口头化置信度Xiong et al. (2023 (https://arxiv.org/html/2607.20529#bib.bib21))。

对于每个数据集,我们评估涵盖科学、专业、数学和社会科学领域的一个子集。对于每个主题,我们将问题分为种子集和目标集。种子问题仅用于估计专家可靠性和计算聚合权重。目标问题仅用于最终评估。除非另有说明,我们在每个主题内使用20/80的种子/目标划分。我们重复实验5次随机划分以减少方差。

### 4.2 专家小组

我们在三个逐步具有挑战性的场景下评估聚合方法,这些场景旨在隔离不确定性感知信任估计的作用。

同质前沿小组。此设置仅包含能力较强、校准质量相对相似的前沿专有模型。此场景的目的是评估当专家质量相对均匀时加权是否仍然有益。同质小组由三个前沿LLM组成:1) Claude Sonnet 4.6,2) Gemini 3 Flash Preview,以及3) GPT-5.4。

异构专家小组此设置结合了前沿专有模型和具有不同能力及不确定性特征的开源模型。与同质设置不同,专家质量差异显著,构成了一个更现实的信任估计问题。

除了同质小组中的三个前沿模型外,此小组还包括:1) Qwen 3.5 Plus,2) GPT-OSS-20b,3) Deepseek-v3.2,以及4) Qwen 3.5 35b。因此,该小组总共包括7个专家。此配置有意同时包含强专家和不完美专家,以评估聚合方法在可靠性异构性下的表现。

受污染专家小组为了进一步评估在不可靠专家下的鲁棒性,我们引入了包含合成噪声专家的受污染专家小组,模拟实际多LLM系统中常见的失败模式。

我们考虑三种污染类型:1) 随机专家:返回选项上的随机概率分布;2) 过度自信错误专家:为错误

相似文章

面向可靠LLM判断的边际自适应置信度排序

arXiv cs.LG

本文提出了一种针对LLM作为评判系统的基于边际的置信度排序方法,通过学习专用估计器来确保置信度与人类分歧风险之间的单调性,具有泛化保证,并在多个数据集上提高了排序准确性。