自信扩展:针对自适应测试时间缩放的LLM置信度校准

arXiv cs.AI 论文

摘要

本文提出了C3RL,一种在保持准确性的同时校准LLM置信度的强化学习算法,以及CAS,一种基于置信度的自适应测试时缩放策略,可将推理成本降低多达12.33倍。

arXiv:2607.01612v1 Announce Type: new 摘要:使用强化学习(RL)训练大型语言模型(LLMs)显著提升了它们在推理和问答任务上的表现。然而,主流的RL奖励设计通常优先考虑响应的正确性,而忽略了激励模型准确表达其置信度。这导致了一个关键问题:性能提升往往伴随着置信度与准确性之间的校准不良,误导模型在不确定时过度自信地产生幻觉。为了解决这一局限,我们提出了$\textbf{C}$orrectness and $\textbf{C}$onfidence $\textbf{C}$alibration $\textbf{R}$einforcement $\textbf{L}$earning ($\textbf{C3RL}$),一种新颖的RL算法,它整合了正确性、校准和基于数据集的参考准确性奖励。在8个文本和多模态数据集上的综合评估表明,C3RL在不牺牲准确性的情况下增强了校准,在性能和校准指标上均优于当前最先进的方法。利用C3RL校准良好的口头化置信度,我们进一步引入了$\textbf{C}$onfidence-based $\textbf{A}$daptive Test Time $\textbf{S}$caling ($\textbf{CAS}$),一种可调整的推理时策略,根据响应置信度分配计算资源。实验表明,CAS在领域内和领域外数据集上均超越了多数投票,同时将推理预算降低了多达12.33倍。我们相信C3RL和CAS的协同作用为部署更可靠且资源高效的LLMs铺平了道路。代码、数据和模型将公开发布。
查看原文
查看缓存全文

缓存时间: 2026/07/03 05:44

# 充满自信地扩展:校准LLM的置信度以实现自适应测试时扩展  
来源:https://arxiv.org/html/2607.01612  
许庆阳1,袁毅2,雷山哲3,王旭宏3  
1上海交通大学,2东南大学,3上海人工智能实验室  

###### 摘要  
使用强化学习(RL)训练大型语言模型(LLM)显著提升了它们在推理和问答任务上的表现。然而,当前主流的RL奖励设计通常优先考虑回答正确性,而忽略了激励模型准确表达其置信度。这导致了一个关键问题:性能提升的同时,置信度与准确性之间的校准往往很差,使得模型在不确定时过度自信地产生幻觉。为了解决这一局限,我们提出了**正确性与置信度校准强化学习**(C3RL),一种融合了正确性、校准和数据集参考准确性奖励的新型RL算法。在8个文本和多模态数据集上的综合评估表明,C3RL在不牺牲准确性的前提下提升了校准性能,在性能和校准指标上均超越了当前最先进的方法。利用C3RL校准后的口头化置信度,我们进一步引入了**基于置信度的自适应测试时扩展**(CAS),一种可调整的推理时策略,根据回答置信度分配计算资源。实验表明,CAS在领域内和领域外数据集上的表现均优于多数投票法,同时将推理预算降低了最多12.33倍。我们相信,C3RL与CAS的协同作用为部署更可靠、更资源高效的LLM铺平了道路。代码、数据和模型将会开源。

# 充满自信地扩展:校准LLM的置信度以实现自适应测试时扩展  
许庆阳1,袁毅2,雷山哲3,王旭华3†  
†通讯作者:[email protected]  
1上海交通大学,2东南大学,3上海人工智能实验室  

## 1 引言  
大型语言模型(LLM)在推理、问答和代码生成方面表现出色(Brown等人,2020;Achiam等人,2023)。然而,它们令人印象深刻的能力伴随着一个关键的失败模式:当面对不确定性时,LLM经常产生过度自信但错误的输出——这种现象被广泛称为幻觉(Ji等人,2023)。这种行为不仅仅是学术上的好奇,还可能导致严重后果,包括虚假信息传播和安全关键领域中的决策失败。为了减轻这些风险,理想的LLM不仅应生成正确的输出,还应可靠地表达其认知不确定性。这一属性被称为**置信度校准**,指的是模型生成的概率估计能够忠实反映正确可能性的能力(Guo等人,2017)。良好校准的置信度可作为放弃不确定回答、交给人监督或在置信度低时动态调整计算预算的基础。

尽管其重要性,LLM的置信度校准仍未被充分探索,并面临若干限制。首先,他们通常将校准简化为二分类任务(确定与不确定),这过于粗糙,无法捕捉LLM预测的细微不确定性。其次,他们通常以牺牲精度为代价来改进校准,因为模型可能学会刻意给出错误但低置信度的答案以最小化校准损失。此外,他们很少探索校准置信度在下游决策(如自适应推理和资源分配)中的潜力(Zhao等人,2024)。我们的工作通过在强化学习框架内联合优化正确性和校准,并利用校准后的置信度进行自适应测试时扩展,来解决这些差距。具体地,我们设计了一种方法,明确教导LLM在不确定时发出低置信度信号。此外,我们利用由此产生的校准置信度来指导测试时扩展中的提前停止,为低置信度样本分配更多计算量。据我们所知,我们的方法是首个将置信度校准和测试时扩展统一在单一框架内的方法,从而提高了推理的可靠性和效率。我们的贡献总结如下:

1. **正确性与置信度校准强化学习(C3RL)**:我们提出C3RL,一种新颖的RL算法,能同时改进正确性和校准,在保持整体性能的同时减少过度自信。
2. **基于置信度的自适应测试时扩展(CAS)**:我们引入了一种用于测试时扩展的提前停止机制,利用校准后的置信度动态分配推理预算。这种方法将更多计算资源分配给低置信度样本,实现了更好的效率-准确性平衡。
3. **统一框架**:C3RL与CAS共同形成一个连贯的流水线,使LLM能够表达校准的置信度并自适应控制推理成本,为更可信、高效的LLM铺平了道路。

## 2 相关工作  
近期研究表明,LLM经常表现出过度自信(Xiong等人,2023;Mei等人,2025)和幻觉(Zhang等人,2025;Liang等人,2024),这损害了它们的可靠性。现有改进置信度估计和校准的工作大致可分为两条主线:(i) 基于提示和采样的校准,以及 (ii) 基于训练和RL的校准。我们还进一步讨论了自适应测试时扩展的相关工作。

### 2.1 基于提示和采样的校准  
基于提示的方法引导LLM在生成答案后明确口头表达其置信度或自我评估其可靠性。(Tian等人,2023;Xiong等人,2023;Yang等人,2024a)表明,口头化置信度通常校准不佳,尽管随着模型规模和推理能力的提高,校准会有所改善。近期更多面向推理的研究(Mei等人,2025;Yoon等人,2025)表明,内省或“慢思考”思维链(CoT)提示可以使置信度与正确性之间更好地对齐。然而,这些基于提示的技术严重依赖提示措辞,限制了鲁棒性和可扩展性(Zhao等人,2021)。另一条研究路线通过响应一致性隐式估计置信度。这些基于采样的方法依赖响应多样性或多数投票(Kuhn等人,2023;Aichberger等人,2025;Kang等人,2025),其中多个生成之间的一致性被视为不确定性。虽然这些方法与经验准确性相关良好,但计算成本高昂。

参见图注:图1:训练集构建、正确性与置信度校准强化学习(C3RL)和基于置信度的自适应测试时扩展(CAS)框架的流水线。基座模型首先为每个样本生成10个回答,并将样本分类为“全部正确”、“部分正确”和“全部错误”。在C3RL中,\(R_{\mathrm{correctness}}\)鼓励正确回答,\(R_{\mathrm{reference}}\)根据分配的分类奖励/惩罚正确性变化,而\(R_{\mathrm{calibration}}\)激励置信度的校准。在CAS中,停止概率(式1)通过最自信的回答和第二自信的回答计算得出。如果最自信的回答主导了已有的生成(\(c_1\)远大于\(c_2\)),则推理将停止以节省预算。

### 2.2 基于训练和RL的校准  
基于训练的方法旨在通过监督或强化目标学习校准的置信度分布。Lin等人(2022)通过将响应类型与经验准确性相关联引入数据集级监督,而R-Tuning(Zhang等人,2023)则用二元“我确定/不确定”标签扩充监督微调数据。虽然对粗略不确定性有效,但这种设计无法捕捉细粒度的、上下文依赖的置信度。更规范的形式采用强化学习(RL)来联合优化正确性和校准。SaySelf(Xu等人,2024)和Stangel等人(2025)使用适当的评分规则(如Brier或对数损失)作为奖励来训练语言模型,直接对齐口头化置信度与输出正确性。然而,这些目标通常只优先考虑校准,可能鼓励低置信度的错误答案以最小化损失。RLCR(Damani等人,2025)引入了校准的奖励函数以平衡准确性和校准,但应用仍限于问答或数学任务。相反,我们使用C3RL在推理密集型任务上训练的模型保持了准确性,并在校准方面达到了最优改进。

### 2.3 自适应测试时扩展  
自适应采样已成为降低测试时扩展计算成本的一种强大方法。Adaptive-Consistency(Aggarwal等人,2023)引入了一种模型无关技术,通过基于答案频率的轻量级停止准则动态调整每个问题的采样数量。Li等人(2023)采用了另一种方法,将采样过程划分为连续窗口,并在窗口内所有样本相同时停止。然而,这些自适应采样方法依赖频率或熵来近似置信度,未能直接使用置信度信号本身。

## 3 方法  
在本节中,我们介绍训练数据的构建过程(第3.1节)、C3RL的奖励设计(第3.2节)以及基于校准置信度的自适应测试时扩展策略(第3.3节)。图1展示了整个框架的流水线。

### 3.1 训练数据集构建  
通过强化学习训练LLM需要全面且难度适中的数据集。我们创建了高质量的训练数据集,并为每个数据分配一个准确性标签。我们首先收集数学、科学和逻辑推理领域的数据集。所选数据集记为\(\mathcal{D}\),包含以下部分:(1) 数学与科学:NuminaMath-TIR(Jia LI, 2024)(69k个面向计算和推理的数值答案数学问题)和WebInstruct-verified(Ma等人,2025)(4.5k个经过筛选、含整数答案的数值科学问题);(2) 逻辑推理:LogicNLI(Tian等人,2021)(16k个解绑目标一阶逻辑推理与常识推理的问题)和LogiQA(Liu等人,2020)(8,678个专注于演绎推理的QA问题)。详细的过滤过程见A.1.1。\(\mathcal{D}\)被随机分为\(\mathcal{D}_{train}\)(106k样本,99%)和\(\mathcal{D}_{test}\)(1,073样本,1%)。对于\(\mathcal{D}_{train}\)中的每个问题\(q\),我们使用基座模型(Qwen2.5VL-7B-Instruct(Team, 2025)或Llama-3.2-3B-Instruct(Meta, 2024))以解码温度0.7生成10个答案。答案生成提示见4。我们计算该答案集的准确性:\[Acc_q = \sum_{i=1}^{10} \mathbb{I}(a_i = a^*)/10\],其中\(\mathbb{I} \in \{0,1\}\)是指示函数,\(a^*\)是真实标签。然后我们从以下三个选项中选择参考准确性标签\(T_q\):“全部正确”(\(Acc_q = 1\))、“部分正确”(\(0 < Acc_q < 1\))和“全部错误”(\(Acc_q = 0\))。

### 3.2 正确性与置信度校准强化学习(C3RL)  
C3RL奖励设计包含三个部分:正确性奖励\(R_{\mathrm{correctness}}\)、置信度校准奖励\(R_{\mathrm{calibration}}\)和参考准确性奖励\(R_{\mathrm{reference}}\)。整体奖励函数定义为:\[R = R_{\mathrm{correctness}} + R_{\mathrm{calibration}} + R_{\mathrm{reference}}\]  
正确性奖励:标准正确性奖励在模型产生正确回答时给予固定奖励\(R_{\mathrm{correctness}} = +1\),错误时给予\(R_{\mathrm{correctness}} = 0\)。  
置信度校准奖励:我们通过在生成过程中强制口头化置信度来校准模型。模型被引导以“[置信度=X%]”的格式输出其置信度,其中X的范围为0到100,步长为5。对于每个回答,我们将输出置信度\(c_{a_q}\)与阈值\(t\)进行比较,以分类为“确定”(\(c_{a_q} > t\))和“不确定”(\(c_{a_q} \leq t\))类别。我们鼓励“确定正确”和“不确定错误”的回答,给予\(R_{\mathrm{calibration}} = +\beta\),同时惩罚“确定错误”和“不确定正确”的响应,给予\(R_{\mathrm{calibration}} = -\beta\)。确定\(\beta\)的消融过程详见A.5。  
参考准确性奖励:为了利用数据构建过程中的先验准确性信息,我们基于参考准确性标签\(T_q\)为问题\(q\)定制奖励。当模型对之前“全部错误”的问题给出正确回答时,我们给予\(R_{\mathrm{reference}} = +\alpha\)的激励。相反,如果模型对之前“全部正确”的问题产生幻觉并给出错误回答,我们给予\(R_{\mathrm{reference}} = -\alpha\)的惩罚。这种设计迫使模型在原本能给出正确答案时保持正确,并进一步阻止模型陷入“校准但错误”的风险。选择\(\alpha\)的消融过程详见A.5。

### 3.3 基于置信度的自适应测试时扩展(CAS)  
先前的自适应自一致性方法通常依赖频率或熵来确定提前停止准则。然而,这些信号往往未经校准,无法准确反映模型的真实置信度。为了解决这一限制,我们提出了一种基于置信度的自适应测试时扩展(CAS)策略,将校准的口头化置信度集成到停止准则中。在生成每批响应后,CAS基于模型输出的口头化置信度应用一个良好校准的停止准则,以决定是否(1)继续采样,或(2)停止并返回当前最高置信度加权答案。受高置信度答案若主导其他所有响应则表明可靠停止准则这一想法的启发,我们如下设计CAS:对于需要采样\(N\)次的问题\(q\),假设已生成\(n\)个答案(\(n < N\)),当前最频繁的答案\(a_1\)出现次数为\(s_1\),其对应的平均口头化置信度为\(c_1\);第二最频繁的答案\(a_2\)出现次数为\(s_2\),对应平均置信度为\(c_2\)。我们定义停止概率为:\[P_{stop} = \sigma(c_1 - c_2 - \epsilon)\] 其中\(\sigma(\cdot)\)是Sigmoid函数,\(\epsilon\)是一个偏移参数。当最自信的答案的置信度远高于第二自信的答案时,停止概率接近1,触发提前停止。否则,继续采样直至达到最大值\(N\)。最终答案通过基于置信度的加权投票产生,而非简单多数投票。

###(图3和图2的说明文字略,根据上下文保留英文但翻译说明文字)  
参见图注:图2:使用不同测试时扩展策略时,C3RL模型与基座模型在MMLU-Science(领域内)上的性能对比。y轴0.55-0.86范围被剪裁以便清晰显示。高置信度集从测试时扩展中获益远少于低置信度集。  
参见图注:图3:使用不同测试时扩展策略时,C3RL模型与基座模型在MMLU-Science(领域内)上的性能对比。y轴0.55-0.86范围被剪裁以便清晰显示。高置信度集从测试时扩展中获益远少于低置信度集。

相似文章

大型语言模型中的置信度校准

arXiv cs.AI

本文分析了11个主流大型语言模型的置信度校准情况,发现它们普遍过于自信,尤其在困难任务上,而在简单任务上则信心不足。文章引入了LifeEval,这是一个用于评估不同难度级别下校准效果的测试。

用 LLM 优化 LLM:面向测试时扩展的智能体发现方法

Hugging Face Daily Papers

本文提出了 AutoTTS,这是一种环境驱动的框架,通过将测试时扩展(TTS)策略的发现过程形式化为控制器合成,自动发现用于大型语言模型(LLM)的测试时扩展策略。该框架在数学推理基准测试上展示了更优的准确率-成本权衡,且计算开销极小。

检索增强的语言校准

arXiv cs.CL

本文提出检索增强的语言校准(RALC),一种事后流水线方法,通过将语言置信度建模为分布并使用检索增强重写来校准大语言模型中的置信度信号。它引入了忠实度散度指标,并在多个基准测试中展示了显著改进。

基于语义级奖励的LLM校准

arXiv cs.CL

提出了CSR,一种直接在语义空间中使用新颖的语义校准奖励来校准LLM的框架,在多个数据集上将ECE降低了高达40%,并将AUROC相较于口头化置信度基线提升了高达31%。