选择性问答中的渐近风险校准
摘要
本文提出了 A-CRC-QA,一种用于选择性问答的事后校准框架,通过渐近风险校准控制已接受答案中的错误率,并在 CoQA 和 MedMCQA 上展示了更好的可靠性与保留率之间的权衡。
查看缓存全文
缓存时间: 2026/08/13 15:29
# 用于选择性问答的渐近风险校准
Source: https://arxiv.org/html/2608.12008
## 用于选择性问答的渐近风险校准 DOI:XXXXXXX\.XXXXXXX (https://doi.org/XXXXXXX.XXXXXXX) 会议:请从你的权利确认邮件中填写正确的会议标题;2018年6月03–05日;纽约州伍德斯托克 ISBN:978\-1\-4503\-XXXX\-X/2018/06
2018© , 2018;
###### 摘要。
大型语言模型(LLMs)可能生成流畅但不正确的答案,这使得不确定性量化对于可靠的问答至关重要。然而,启发式的不确定性分数无法完美地区分正确预测和错误预测,直接应用固定的不确定性阈值也无法对已接受答案中的错误率提供统计控制。为解决这一局限,我们提出了 A\-CRC\-QA,一个用于不确定性感知的选择性问答的事后校准框架。所提出的方法将选择条件错误控制重新表述为线性期望约束,并应用受共形风险控制启发的单调化经验风险校准程序。由于由此产生的逐实例损失通常关于接受阈值是非单调的,我们的框架针对的是渐近风险控制而非有限样本风险控制。A\-CRC\-QA 是模型无关的,不需要额外训练,并且可以与不同的不确定性估计器结合使用。在 CoQA 和 MedMCQA 上的实验证明了其在开放式和封闭式问答中的适用性,与未校准和基于置信边界的基线相比,在已接受答案的可靠性和答案保留率之间实现了有利的权衡。
###### 关键词:
选择性问答、不确定性量化、风险校准、弃权
## 1\. 引言
大型语言模型(LLMs)在问答和知识密集型生成任务中取得了令人瞩目的性能。然而,它们的回应并不总是可信的。LLMs 可能生成事实上不正确或幻觉的答案,同时以流畅且自信的方式呈现(16 (https://arxiv.org/html/2608.12008#bib.bib14);7 (https://arxiv.org/html/2608.12008#bib.bib38))。这个问题在医学等高危领域尤其令人担忧,因为用户可能无法独立验证生成的内容。因此,一个可靠的问答系统不仅应该生成答案,还应该确定该答案何时足够可靠以至于可以返回。
不确定性量化提供了估计 LLM 输出可靠性的实用信号。现有方法使用标记概率、序列似然、自我评估或多个采样响应的一致性(21 (https://arxiv.org/html/2608.12008#bib.bib7);24 (https://arxiv.org/html/2608.12008#bib.bib17))。对于封闭式问答,可以根据候选选项的概率分布计算预测熵。对于开放式生成,语义熵在衡量不一致性之前对语义等价的响应进行分组,而词序列熵则考虑不同词和序列的不平等不确定性贡献(9 (https://arxiv.org/html/2608.12008#bib.bib19);38 (https://arxiv.org/html/2608.12008#bib.bib5))。尽管这些方法对于排序答案是有用的,但它们的不确定性分数是启发式的,无法完美地区分正确和不正确的预测。
一个常见的解决方案是选择性问答,即模型回答低不确定性(即高置信度)的问题,而放弃高不确定性的问题。然而,直接选择不确定性阈值并不能保证已接受答案的可靠性。正确和错误预测的分布往往重叠,且自信的错误响应可能仍然获得较低的不确定性分数。因此,经验选择的阈值可能在一个数据集上表现良好,但在另一个模型、任务或数据划分下失效。因此,有必要根据用户指定的错误容忍度对不确定性阈值进行统计校准。
共形预测提供了一种模型无关的方法,将启发式的不确定性信号转换为统计校准的决策。现有研究已将共形方法应用于开放式和集合值语言生成。ConU 构建具有正确性覆盖保证的共形答案集,而 SConU 引入选择性机制以提高共形不确定性集的实用性(36 (https://arxiv.org/html/2608.12008#bib.bib4);39 (https://arxiv.org/html/2608.12008#bib.bib3))。共形语言建模和后续研究进一步研究了自由形式生成的校准响应集、采样可行性和误覆盖分解(27 (https://arxiv.org/html/2608.12008#bib.bib18);14 (https://arxiv.org/html/2608.12008#bib.bib21);22 (https://arxiv.org/html/2608.12008#bib.bib23))。相关的风险校准思想也在多模态基础模型(18 (https://arxiv.org/html/2608.12008#bib.bib37);19 (https://arxiv.org/html/2608.12008#bib.bib36);34 (https://arxiv.org/html/2608.12008#bib.bib35);26 (https://arxiv.org/html/2608.12008#bib.bib34);29 (https://arxiv.org/html/2608.12008#bib.bib33);2 (https://arxiv.org/html/2608.12008#bib.bib39);5 (https://arxiv.org/html/2608.12008#bib.bib41);4 (https://arxiv.org/html/2608.12008#bib.bib40))、医学图像分割和级联检索增强生成系统(33 (https://arxiv.org/html/2608.12008#bib.bib24);30 (https://arxiv.org/html/2608.12008#bib.bib20);17 (https://arxiv.org/html/2608.12008#bib.bib22);32 (https://arxiv.org/html/2608.12008#bib.bib28);23 (https://arxiv.org/html/2608.12008#bib.bib30);31 (https://arxiv.org/html/2608.12008#bib.bib29)) 中进行了探索。然而,集合值方法可能会返回多个候选答案,而系统必须提供单个答案或弃权时不太适用。
因此,最近的工作重点在于控制已接受点预测中的错误率。COIN 使用统计上置信上界来校准选择性问答阈值,并提供高概率风险保证(37 (https://arxiv.org/html/2608.12008#bib.bib2))。LEC 将选择条件的错误控制重新表述为涉及预测选择和正确性的线性期望约束,使得选择性预测和模型路由的校准不那么保守(35 (https://arxiv.org/html/2608.12008#bib.bib1))。共形风险控制进一步将共形预测推广到有界期望损失的控制(1 (https://arxiv.org/html/2608.12008#bib.bib15))。然而,其标准有限样本保证要求损失关于校准参数是单调的。用于选择性回答的 LEC 式实例损失通常是非单调的,因为接受正确答案和接受错误答案对损失的影响方向相反。因此,标准有限样本 CRC 结果无法直接应用。
在这项工作中,我们提出了 A\-CRC\-QA,一个轻量级的不确定性感知选择性问答渐近风险校准框架。所提出的方法使用留出校准集来评估候选不确定性阈值,并选择满足经验修正的线性期望约束的最大可接受阈值。与需要额外训练或修改 LLM 的方法不同,A\-CRC\-QA 是一个事后且模型无关的框架,可以与不同的 LLM 和不确定性估计器结合使用。在可交换性和标准正则性条件下,校准的决策规则提供了对已接受答案错误率的渐近控制。
我们在 CoQA 和 MedMCQA 上评估了 A\-CRC\-QA,分别代表开放式对话问答和封闭式医学多项选择问答。实验使用 LLaMA\-3\.1\-8B\-Instruct 和 Qwen2\.5\-7B\-Instruct 进行。CoQA 使用语义熵和词序列熵,而 MedMCQA 使用预测熵和最大选项概率。在目标已接受答案错误率为 0.150.15 的情况下,A\-CRC\-QA 在 CoQA 和 MedMCQA 上分别实现了 0.1430.143 和 0.1380.138 的平均错误率,同时保留了 46\.2%46\.2\% 和 58\.7%58\.7\% 的测试答案。与基于 Hoeffding 的置信上界方法相比,所提出的方法在 CoQA 上的接受率提高了约 6\.16\.1 个百分点,在 MedMCQA 上提高了 7\.47\.4 个百分点。
本工作的主要贡献总结如下:
- • 我们将不确定性感知的选择性问答表述为控制已接受 LLM 响应错误率的问题。
- • 我们将 LEC 中使用的线性期望约束与共形风险控制中对非单调损失的渐近处理相结合,得到一种简单的事后阈值校准方法。
- • 我们在开放式和封闭式问答任务上评估了所提出的框架,证明了其在不同模型和不确定性信号下的适用性。
## 2\. 相关工作
### 2\.1\. 大型语言模型的不确定性量化
大型语言模型(LLMs)可以生成流畅但事实上不正确的响应(6 (https://arxiv.org/html/2608.12008#bib.bib26);3 (https://arxiv.org/html/2608.12008#bib.bib25);15 (https://arxiv.org/html/2608.12008#bib.bib27);41 (https://arxiv.org/html/2608.12008#bib.bib31);40 (https://arxiv.org/html/2608.12008#bib.bib32);38 (https://arxiv.org/html/2608.12008#bib.bib5)),这限制了它们在问答和其他知识密集型应用中的可靠性。不确定性量化(UQ)旨在为每个生成的答案关联一个标量信号,指示其潜在的正确性或可靠性(11 (https://arxiv.org/html/2608.12008#bib.bib6))。现有方法大致可分为基于置信度和基于一致性的方法。基于置信度的方法使用标记概率、序列似然或明确的自我评估分数(如生成答案正确的概率)来估计可靠性(21 (https://arxiv.org/html/2608.12008#bib.bib7))。然而,基于似然的置信度可能与语义正确性不一致,特别是对于具有多种有效表面形式的自由形式答案。
基于采样的方法则根据多次随机生成之间的一致性来估计不确定性。SelfCheckGPT 通过测量原始响应和额外采样响应之间的一致性来检测幻觉(24 (https://arxiv.org/html/2608.12008#bib.bib17))。语义熵进一步在计算熵之前对语义等价的生成进行分组,从而降低对词汇变化的敏感性(9 (https://arxiv.org/html/2608.12008#bib.bib19))。词序列熵通过考虑不同词和序列在估计自由形式问答不确定性时的不平等贡献,扩展了这一方向(38 (https://arxiv.org/html/2608.12008#bib.bib5))。这些方法为识别不可靠答案提供了有用的排序信号。然而,仅有一个不确定性分数并不能指定操作性的接受阈值,也不能保证已接受答案中的错误率保持在用户定义的级别以下。
### 2\.2\. 共形校准与选择性风险控制
共形预测通过在留出数据上校准预测集,提供模型无关的统计保证。其在语言生成中的应用主要集中在集合值输出上。共形语言建模校准采样和过滤规则,以构建包含可接受答案的高概率候选响应集(27 (https://arxiv.org/html/2608.12008#bib.bib18))。ConU 为开放式 LLM 输出建立正确性覆盖保证,而 SConU 引入选择性机制以提高共形不确定性集的信息量和可行性(36 (https://arxiv.org/html/2608.12008#bib.bib4);39 (https://arxiv.org/html/2608.12008#bib.bib3))。最近的研究进一步解决了误覆盖分解、采样可行性和可靠的集合值生成问题(14 (https://arxiv.org/html/2608.12008#bib.bib21);22 (https://arxiv.org/html/2608.12008#bib.bib23))。相关共形框架也已被开发用于多模态基础模型、医学图像分割和级联检索增强生成系统(33 (https://arxiv.org/html/2608.12008#bib.bib24);30 (https://arxiv.org/html/2608.12008#bib.bib20);17 (https://arxiv.org/html/2608.12008#bib.bib22))。尽管预测集提供了覆盖保证,但它们可能包含多个或不可靠的候选答案,并且在系统必须返回一个答案或弃权时不太可操作。
选择性预测通过接受低不确定性输出并放弃高不确定性输出来提供另一种决策机制(12 (https://arxiv.org/html/2608.12008#bib.bib16);20 (https://arxiv.org/html/2608.12008#bib.bib9))。经典方法描述了选择性风险和覆盖率之间的权衡,或联合训练预测和拒绝函数(10 (https://arxiv.org/html/2608.12008#bib.bib8))。然而,它们的接受阈值通常不能提供对已接受预测错误率的无分布控制。共形风险控制(CRC)将共形预测从误覆盖扩展到有界单调损失的期望值(1 (https://arxiv.org/html/2608.12008#bib.bib15))。对于选择性问答,COIN 使用置信上界校准不确定性阈值,提供对已接受答案错误率的高概率控制(37 (https://arxiv.org/html/2608.12008#bib.bib2))。最近,LEC 将选择条件错误控制重新表述为涉及选择和错误指示器的线性期望约束,从而实现更不保守的阈值校准和模型路由扩展(35 (https://arxiv.org/html/2608.12008#bib.bib1))。
我们的工作将 CRC 与 LEC 式线性损失联系起来,用于基于不确定性的选择性问答。与标准 CRC 应用不同,由此产生的样本级损失在验收阈值上可能是非单调的,因为接受正确答案会降低损失,而接受错误答案会增加损失。因此,标准有限样本 CRC 定理不能直接应用。我们转而研究在非单调、近似单调总体风险的渐近处理下的阈值校准,为控制已接受 LLM 答案的错误率提供一种轻量级的事后机制。
## 3\. 方法论
### 3\.1\. 问题表述
设 G:X→Y\\mathcal\{G\}:\\mathcal\{X\}\\rightarrow\\mathcal\{Y\} 表示一个预训练的大型语言模型。给定一个问题 x∈Xx\\in\\mathcal\{X\},模型产生一个答案 y^=G\(x\)\\hat\{y\}=\\mathcal\{G\}\(x\)。我们考虑一个标量不确定性估计器 U\\mathcal\{U\},它为每个答案分配一个不确定性分数 u=U\(x,y^,G\)u=\\mathcal\{U\}\(x,\\hat\{y\};\\mathcal\{G\}\),其中较小的值表示模型对其答案更有信心。不确定性估计器可以基于预测熵、语义熵、序列似然、自一致性或任何其他标量可靠性信号。
为便于表示,我们将不确定性转换为可靠性评分 r=h\(u\)r=h\(u\),其中 hh 是任意严格递减函数。例如,可以直接使用 r=−ur=\-u。这种变换不会改变模型预测的顺序,也不会改变最终的选择。相似文章
TriageRA-CCF:面向自适应秩预算的源端临床置信度与覆盖信号(用于医学大语言模型)
本文提出TriageRA-CCF,一种用于医学问答中LoRA自适应秩预算的方法。它利用源端信号(基座模型置信度、临床覆盖、反事实代理)动态选择秩预算,在Qwen3-8B和Llama3.1-8B上取得了适度的准确率提升。
From token probabilities to calibrated confidence: An empirical study of mathematical question answering
This paper empirically studies token-probability-based confidence estimation and calibration for LLMs in mathematical question answering, comparing single-pass and multi-pass estimators and evaluating post-hoc calibration methods.
AB-RAG:自适应预算检索增强生成用于可靠问答
AB-RAG是一种无需训练、骨干无关的框架,通过估计答案置信度自适应地检索段落以进行问答,在多个骨干和数据集上提高了效率和准确性。
CALIBER:语言模型中推理前后的置信度校准
本文介绍了CALIBER,一种通过获取推理前后的置信度估计并匹配信息状态的监督目标来校准推理语言模型置信度的方法。它在多个基准测试上显著降低了期望校准误差(最多52.5%),并取得了强劲的Brier分数和AUROC。
面向QANTA 2026的基于置信度校准与增量推理的任务特定多模态问答智能体
本文提出了一种面向QANTA 2026共享挑战的任务特定双智能体架构,用于多模态问答。该架构使用GPT-4.1-mini处理需要置信度校准的抢答题,并使用GPT-4.1处理需要结构化推理的附加题。该系统在整体排行榜上取得了最高分,展示了高效推理策略的有效性。