基于语义级奖励的LLM校准
摘要
提出了CSR,一种直接在语义空间中使用新颖的语义校准奖励来校准LLM的框架,在多个数据集上将ECE降低了高达40%,并将AUROC相较于口头化置信度基线提升了高达31%。
arXiv:2605.15588v1 公告类型:新论文
摘要:随着大型语言模型(LLM)在医疗问答和法律推理等关键场景中的部署,准确估计其输出正确性的能力对于安全可靠的使用至关重要,这需要良好校准的不确定性。标准的使用可验证奖励的强化学习(RLVR)使用二值正确性奖励进行训练,该奖励对置信度无区分,对高置信但错误的预测没有惩罚,从而降低校准效果。近期的工作通过训练模型在答案旁边生成口头化置信度分数,并根据正确性奖励一致性来解决这一问题。然而,口头化置信度是在词级别进行校准的,因此在语义相同的文本变体间表现出不一致性。我们提出了**Calibration with Semantic Reward (CSR)**(基于语义奖励的校准),一个无需口头化置信度接口而直接在语义空间中校准语言模型的框架。CSR将正确性奖励与一种新颖的语义校准奖励相结合,通过促进语义一致性来鼓励正确输出中的利用,并通过抑制虚假一致性来鼓励错误输出中的探索。在三个模型系列上,对HotpotQA(分布内)以及TriviaQA、MSMARCO和NQ-Open(分布外)的实验表明,CSR在几乎所有设置中一致地实现了比口头化置信度基线更低的ECE和更高的AUROC,将ECE降低了高达40%,并将AUROC相较于口头化置信度基线提升了高达31%,且校准行为在所有四个评估设置中均表现出强大的泛化性。
查看缓存全文
缓存时间: 2026/05/18 06:32
# 使用语义级奖励校准大语言模型 来源:https://arxiv.org/html/2605.15588 ###### 摘要 随着大语言模型(LLMs)被部署在医疗问答、法律推理等高影响场景中,估算其输出正确性的能力对于安全、可靠的使用至关重要,这要求模型具备良好校准的不确定性。标准的可验证奖励强化学习(RLVR)使用二元正确性奖励训练模型,该奖励对置信度不敏感,对高置信度的错误预测不施加任何惩罚,从而损害了校准效果。近期的工作通过训练模型在答案旁边生成显式的置信度分数,并根据正确性给予奖励来解决这一问题。然而,基于词语的置信度校准依赖于词元级别,因此在具有相同语义的不同文本变体间表现出不一致性。我们提出**语义奖励校准(CSR)**框架,该框架直接在语义空间中校准语言模型,无需显式的置信度输出接口。CSR将正确性奖励与一种新颖的语义校准奖励相结合:该奖励通过促进语义一致性来鼓励正确采样输出之间的集约利用,并通过抑制虚假一致性来鼓励错误采样输出之间的探索。在HotpotQA(分布内)、TriviaQA、MSMARCO和NQ-Open(分布外)上的实验表明,CSR在几乎所有设置下均一致地实现了比基于显式置信度的基线更低的期望校准误差(ECE)和更高的AUROC,ECE降低高达40%,AUROC提升高达31%,并且校准行为在全部四个评估设置中展现出稳健的泛化能力。 11footnotetext:加州大学圣迭戈分校计算机科学与工程系,美国加利福尼亚州拉霍亚 22footnotetext:加州大学圣迭戈分校哈勒乔格鲁数据科学研究所,美国加利福尼亚州拉霍亚 ††footnotetext:∗同等贡献。通讯作者:Rose Yu ([email protected] (https://arxiv.org/html/2605.15588v1/mailto:[email protected])). ## 1 引言 可验证奖励强化学习(RLVR)已成为推理语言模型的主流训练范式,在问答、数学推理和多步推理等任务上取得了强劲性能(Wen等,2025 (https://arxiv.org/html/2605.15588#bib.bib18))。标准的RLVR目标使用二元正确性奖励:当生成的答案与真实答案匹配时,采样输出获得正信号,否则为零。 虽然该方法在提升准确率方面有效,但这一公式并未考虑模型对生成答案的置信度。一个高置信度但猜测错误的模型与一个弃权模型获得的信号相同。这种不敏感性在结构上鼓励了过度自信的猜测,因为表达确定性不会带来额外成本。在医疗问答和法律推理等高影响部署场景中,一个可靠的系统不仅要生成正确答案,还要表达校准后的不确定性,以支持合理的下游决策。经验上,RL训练已被发现会恶化校准并增加幻觉率,推理模型比其基础模型表现出明显更强的过度自信(Ji等,2023 (https://arxiv.org/html/2605.15588#bib.bib3);Damani等,2025 (https://arxiv.org/html/2605.15588#bib.bib13))。 近期的工作通过训练模型在答案旁生成显式的置信度分数,并根据分数与经验正确性之间的一致性给予奖励来解决这一问题。诸如Rewarding Doubt (RD)(Bani-Harouni等,2025 (https://arxiv.org/html/2605.15588#bib.bib14))、RLCR(Damani等,2025 (https://arxiv.org/html/2605.15588#bib.bib13))、SaySelf(Xu等,2024 (https://arxiv.org/html/2605.15588#bib.bib10))、ConfTuner(Li等,2025 (https://arxiv.org/html/2605.15588#bib.bib9))和LACIE(Stengel-Eskin等,2024 (https://arxiv.org/html/2605.15588#bib.bib11))等方法均在此范式内运作,将训练信号附加到模型根据显式提示生成的显式置信度输出上。 参见图注(a) 单样本分布 参见图注(b) 不一致性 参见图注(c) 变异性 图 1:显式置信度并非总是稳定的。(a) 对于单个采样答案,解码出的置信度本质上是不确定的,其他数值以相当高的概率出现。(b) 产生相同答案的多个响应报告了不一致的置信度分数。(c) 按语义等价计数对采样输出进行分组,显式置信度在每组内仍然变化很大。实验细节参见附录B.1 (https://arxiv.org/html/2605.15588#A2.SS1)。 然而,现有研究已指出,显式置信度是模型不可靠的不确定性代理(Xiong等,2024 (https://arxiv.org/html/2605.15588#bib.bib31);Groot和Valdenegro-Toro,2024 (https://arxiv.org/html/2605.15588#bib.bib33);Yang等,2024 (https://arxiv.org/html/2605.15588#bib.bib34))。报告的分数取决于答案文本和提示格式,而非自由采样下模型产生的含义分布。因此,分数可能随着提示措辞或指令风格的变化而变化,而答案行为并无相应改变。图1 (https://arxiv.org/html/2605.15588#S1.F1) 在RLCR下具体说明了这一点。面板(a)显示,即使对于单个采样答案,解码出的置信度也并非稳定量:替代数值以相当高的概率出现在输出分布中。面板(b)显示,产生相同答案的多个响应报告了不一致的置信度分数,证实了显式置信度在语义等价的输出之间会变化。面板(c)在规模上量化了这种效应:按语义等价计数分组,置信度在每个组内仍然变化很大,未能跟踪语义一致性的程度。这些观察共同表明,现有方法校准的是一个报告接口,而非模型关于答案含义的底层不确定性。 在本工作中,我们提出直接在语义空间中校准语言模型,绕过显式置信度输出接口。我们将校准置于*语义级不确定性*的框架下:当从同一问题重复采样时,模型产生的含义分布。当正确预测形成一个集中的语义簇,而错误预测产生分散、语义多样的输出时,模型在语义上是良好校准的。不确定性可以在事后根据答案分布进行估计,无需任何置信度报告的指令。为此,我们引入了**语义奖励校准(CSR)**,一种将跨采样输出的成对语义一致性与每个采样输出的正确性相对齐的微调框架。CSR塑造模型的答案分布,使得通过聚类语义等价输出计算的语义熵(Farquhar等,2024 (https://arxiv.org/html/2605.15588#bib.bib7))成为一种可靠的不确定性信号。一个课程学习计划稳定了准确性和校准的联合优化。概括来说,我们的贡献包括: - **语义校准**,一种将LLM校准建立在语义级不确定性而非显式置信度基础上的公式化方法,为依赖提示的置信度报告接口提供了一个有原则的替代方案。 - **CSR**,一种强化学习框架,它将对齐跨采样输出的成对语义一致性与正确性,使模型能够学习校准的语义不确定性,而无需显式的置信度监督。 - **跨三个模型族的实证验证**,显示CSR相对于基础模型将ECE降低了高达42%,AUROC提升了高达16%,同时保持了有竞争力的准确性,并泛化到分布外数据集。 ## 2 相关工作 **基于采样的不确定性估计。** 一类重要的后验不确定性方法通过探测模型的输出分布来工作,无需修改模型或添加置信度接口。词元级代理从生成概率中推导置信度,例如归一化熵(Malinin和Gales,2018 (https://arxiv.org/html/2605.15588#bib.bib16))、困惑度(Farquhar等,2024 (https://arxiv.org/html/2605.15588#bib.bib7))或通过让模型自我评估候选答案获得的\(P(\text{true})\)分数(Kadavath等,2022 (https://arxiv.org/html/2605.15588#bib.bib5))。基于采样的代理则将不确定性视为重复采样下的离散度:自一致性(Wang等,2022 (https://arxiv.org/html/2605.15588#bib.bib6))使用独立采样推理链之间的一致性作为隐式正确性信号,而语义熵(Farquhar等,2024 (https://arxiv.org/html/2605.15588#bib.bib7))通过按语义等价对采样输出进行聚类来改进这一方法,提供了对于释义变异不变的不确定性估计。 **用于显式不确定性校准的强化学习。** 提示模型显式表达其置信度是一种有吸引力的不确定性估计方法(Lin等,2022 (https://arxiv.org/html/2605.15588#bib.bib17);Tian等,2023 (https://arxiv.org/html/2605.15588#bib.bib8)),但显式分数在实践中并不可靠:它们依赖于提示格式和答案措辞,表现出系统性的过度自信,且不一定反映自由采样下产生的答案含义分布(Xiong等,2023 (https://arxiv.org/html/2605.15588#bib.bib15);Yang等,2024 (https://arxiv.org/html/2605.15588#bib.bib34);Groot和Valdenegro-Toro,2024 (https://arxiv.org/html/2605.15588#bib.bib33))。标准的RLVR训练进一步恶化了校准,因为二元正确性奖励对置信度不敏感,并在结构上鼓励过度自信的猜测(Groot和Valdenegro-Toro,2024 (https://arxiv.org/html/2605.15588#bib.bib33);Wen等,2025 (https://arxiv.org/html/2605.15588#bib.bib18))。一系列工作通过使用RL直接改进显式置信度:SaySelf(Xu等,2024 (https://arxiv.org/html/2605.15588#bib.bib10))将Brier分数奖励附加到自我反思的理由上;Rewarding Doubt(Bani-Harouni等,2025 (https://arxiv.org/html/2605.15588#bib.bib14))通过一个截断的对数损失项惩罚过度自信的错误答案;RLCR(Damani等,2025 (https://arxiv.org/html/2605.15588#bib.bib13))将二元正确性奖励与Brier分数校准项结合起来,可证明地激励了准确性和校准;ConfTuner(Li等,2025 (https://arxiv.org/html/2605.15588#bib.bib9))将模型的显式置信度词元分布与经验准确性对齐;LACIE(Stengel-Eskin等,2024 (https://arxiv.org/html/2605.15588#bib.bib11))采用了一个说话者-听者框架,其中听者推断出的置信度塑造了说话者的奖励信号。虽然这些方法提升了显式置信度的质量,但它们仍然依赖于一个显式的置信度报告接口,这继承了上述提示敏感性和语义差距问题。我们的方法则使用RL来塑造跨采样输出的成对语义一致性,作为隐式的正确性代理,在没有任何置信度接口的情况下实现语义级校准。 ## 3 预备知识 #### 可验证奖励强化学习 (RLVR)。 令\(\pi_\theta\)是一个将提示\(x \in \mathcal{X}\)映射到输出\(y \in \mathcal{Y}\)的语言模型。给定一个问答对数据集\(\mathcal{D} = \{(x_i, y_i^*)\}\)和一个奖励函数\(R: \mathcal{Y} \times \mathcal{Y} \to \mathbb{R}\),RLVR通过优化策略下的期望奖励来训练模型(Damani等,2025 (https://arxiv.org/html/2605.15588#bib.bib13)): \[ \arg\max_\theta \; \mathbb{E}_{(x,y^*) \sim \mathcal{D},\; C \sim \pi_\theta(\cdot|x)} \left[ R(C, y^*) \right]. \] \(R\)的标准选择是二元正确性奖励\(R_{\text{RLVR}}(C,y^*) = \mathbf{1}_{C \equiv y^*}\),其中\(\mathbf{1}_{C \equiv y^*} \in \{0,1\}\)指示生成的答案\(C\)是否等价于真实答案\(y^*\)。这一奖励对提升准确率有效,但不提供校准信号,因为它对模型产生答案时的置信度或一致性不敏感。 #### 语义熵。 语义熵(Farquhar等,2024 (https://arxiv.org/html/2605.15588#bib.bib7))是一种基于采样的方法,用于估计语言模型输出的不确定性。给定一个问题\(x\),从\(\pi_\theta(\cdot|x)\)中采样\(K\)个响应\(\{C^{(1)}, \dots, C^{(K)}\}\),并通过双向蕴含将其划分为语义等价类\(\{\mathcal{M}_s\}_{s=1}^S\)。具体地,令\(\mathrm{Entail}(C^{(i)}, C^{(j)}) \in \{0,1\}\)表示\(C^{(i)}\)是否蕴含\(C^{(j)}\);两个响应当且仅当\(\mathrm{Entail}(C^{(i)}, C^{(j)}) = 1\)且\(\mathrm{Entail}(C^{(j)}, C^{(i)}) = 1\)时被分配到同一类。每个语义类的概率通过经验估计为: \[ \hat{p}(\mathcal{M}_s \mid x) = \frac{1}{K} \sum_{j=1}^K \mathbf{1}\! \left[ C^{(j)} \in \mathcal{M}_s \right]. \] 语义熵即为类分布上的香农熵: \[ \mathrm{SE}(x) = -\sum_{s=1}^S \hat{p}(\mathcal{M}_s \mid x) \,\log \hat{p}(\mathcal{M}_s \mid x). \] 通过操作语义类而非单个词元或表面形式,\(\mathrm{SE}\)对于释义变异是不变的。高\(\mathrm{SE}(x)\)表示语义多样的输出和高不确定性;低\(\mathrm{SE}(x)\)表示跨采样输出的一致的语义一致性。我们在整个实验中采用语义熵作为语义级不确定性的后验置信度代理。 参见图注 图 2:CSR概览。对于每个问题\(x\),我们从策略模型\(\pi_\theta\)中抽取\(K\)个采样输出,利用可验证正确性奖励\(r_{\mathrm{RLVR}}\)和一个语义校准奖励\(r_{\mathrm{Calibration}}\)(等式5 (https://arxiv.org/html/2605.15588#S4.E5))对每个采样输出进行评分,并通过组相对优势更新策略。CSR将正确的采样输出集中到一个紧密的语义簇中,同时保持错误的采样输出分散,使得采样输出之间的语义一致性成为正确的信号指标。 ## 4 语义奖励校准(CSR) 我们提出**语义奖励校准(CSR)**框架,该框架直接在语义空间中校准语言模型,无需引入任何显式的置信度变量(图2 (https://arxiv.org/html/2605.15588#S3.F2))。核心思想是使*采样输出之间的语义一致性能够反映正确性*,使得正确的答案由一致的采样输出支持,而错误的答案不会因虚假的一致性而得到加强。我们通过两个互补的奖励信号来实现这一点:一个*可验证正确性奖励*将概率质量转移到正确的语义模式上,以及一个*语义校准奖励*(第4.1节)
相似文章
检索增强的语言校准
本文提出检索增强的语言校准(RALC),一种事后流水线方法,通过将语言置信度建模为分布并使用检索增强重写来校准大语言模型中的置信度信号。它引入了忠实度散度指标,并在多个基准测试中展示了显著改进。
自信扩展:针对自适应测试时间缩放的LLM置信度校准
本文提出了C3RL,一种在保持准确性的同时校准LLM置信度的强化学习算法,以及CAS,一种基于置信度的自适应测试时缩放策略,可将推理成本降低多达12.33倍。
自我评估已然存在:用极少数据激发基础大语言模型中的潜在评判校准
本文介绍了自我评估激发(SEE)方法,该方法通过校准耦合的强化学习和掩码蒸馏,用极少数据激发基础大语言模型中的潜在评判校准,在保持答案质量的同时提升了跨基准的校准效果。
基于语义奖励的强化学习实现低资源语言扩展而无对齐代价
本文提出使用基于语义奖励的强化学习(通过GRPO)来将LLM扩展到低资源语言,避免了典型的灾难性遗忘对齐代价,展示了相比监督微调更好的语义质量和迁移性。
当校准排名反转时:面向LLM公平比较的精度控制评估
本文证明,诸如期望校准误差(Expected Calibration Error)等全局校准指标会受到模型精度的混杂影响,并提出了ACE,一个用于公平比较大语言模型的精度控制评估框架。