LLM弃权的两个维度:答案正确性与问题可回答性

arXiv cs.CL 论文

摘要

本文研究了LLM弃权的两个维度:答案正确性与问题可回答性。研究表明,单一的置信度阈值会混淆这两种失败模式,并提出了一种带有独立预算的三类选择性接受框架。在五个经过指令微调的模型上进行的实验表明,可回答性在内部是可读的,但输出置信度或自我评估难以捕捉。

arXiv:2607.08456v1 公告类型:新 摘要:模型应当拒绝两类不同的内容:它会答错的答案,以及根本不应回答的问题,例如不可回答的问题或基于错误前提的问题。常规做法是设定一个单一的置信度阈值,但这无法区分这两者。我们在来自三个系列(2B至14B)的五个经过指令微调的模型上发现,它们是独立的维度。普通的答案置信度能够追踪答案是否正确,但对问题是否可回答几乎视而不见;而隐藏状态的线性探针则相反。这种盲点不会随模型规模扩大而缩小。在自然出现的错误前提问题(CREPE)上表现最差。在这些问题上,答案置信度、P(IK)、P(True),甚至直接询问模型前提是否为假,都接近随机水平,而隐藏状态探针的AUROC达到了0.69至0.77:模型内部表征了问题,却不会报告出来。这一问题是可修复的。指令模型检查前提会适得其反,因为它会同等地质疑正确和错误的前提(57%的错误挑战),无法区分;而使用探针引导相同指令,挑战精度大致提高了三倍。我们将这两个维度转化为一个校准策略,仅当可回答性得分和正确性得分各自超过一个独立……(原文此处有表述不清)认证行为不同:不可回答问题的回答率在每个规模下都是可控的,而错误答案率受模型准确率上限约束,因此保证随着阈值策略而收紧——该策略在覆盖75%正确答案的同时认证两个预算,而单一阈值仅覆盖31%;在14B规模下,这是唯一可行的认证策略。
查看原文
查看缓存全文

缓存时间: 2026/07/10 06:15

# 答案正确性与问题可回答性
来源:https://arxiv.org/html/2607.08456
## LLM 拒绝回答的两个维度:答案正确性与问题可回答性

###### 摘要

选择性回答通常通过设置一个置信度阈值来实现。我们表明,这种做法混淆了两种失败模式:对可回答的问题给出错误答案,以及回答根本不应当回答的问题。在三个系列(2B–14B)的五个指令微调模型上,正确-可回答(C)、错误-可回答(W)和不可回答(U)问题在同一决策上形成了交叉几何结构:训练后的可回答性读出器在输出置信度上保持在0.54–0.67 AUROC,无规模趋势,而从隐藏状态则达到0.97–0.99,同时可回答性轴几乎无法区分C和W,即使训练方向不含任何W项时这种坍缩依然存在。在自然出现的虚假预设(CREPE)上,两个类别均来自同一分布的真实用户问题,训练后的输出读出器性能处于或接近随机水平,诱导的自我评估(P(IK)、P(True)以及直接前提检查)最多达到0.67,而内部线性读出器为0.69–0.77。这一差距在行为上具有重要影响,并且可以通过行为手段修复:提示模型检查前提会导致它对正确和虚假前提都提出质疑(57%的虚假挑战),因为它无法区分两者;在相同的提示上加上基于样本外隐藏探针的门控,可将挑战精确度提升三倍。我们将拒绝回答形式化为三类选择性接受,并对不可回答-答案率和错误-答案率分别设置预算(αU=0.15, αW=0.50, δ=0.10),通过在独立于得分训练和阈值调整的划分上使用精确二项式界限进行认证。这些认证揭示了一个规模依赖的不对称性:不可回答-答案预算在五个模型中的四个上得到认证,而错误-答案预算受到模型准确率的限制;在8B规模,因式分解的双阈值策略在0.75的正确答案覆盖率下认证了两个预算(单答案置信度阈值:0.31;学习到的双信号融合达到0.81,但放弃了每轴的风险归因),而在14B规模,它是唯一能进行认证的策略。先前工作已确定可回答性在内部是可读的,且生成前的知识可以估计;我们的贡献在于对这两个维度进行相同决策的分解,在控制条件下测量输出置信度、诱导和表面特征各自恢复的内容,以及风险控制的组合。

## 1 引言

一个能够良好拒绝回答的模型必须正确处理两件不同的事情。它必须避免给出错误的答案,也必须避免回答根本不应当回答的问题,例如不可回答的问题和虚假前提。主流的拒绝回答方法估计一个单一量——生成答案的不确定性——并对其设置阈值:语义熵(Farquhar 等人,2024)、共形拒绝回答(Abbasi Yadkori 等人,2024)、最大概率评分(Hendrycks 和 Gimpel,2017)。单个阈值将低支持度视为拒绝,这是一种隐含的封闭世界规则;而根本不应当尝试的问题形成了一个开放区域,该规则无法表示,这类似于开放世界与封闭世界推理的区别(Wagner 和 d’Avila Garcez,2022)。

我们表明,这两个要求对应于两个维度,它们在相同的决策上分离,并且不被相同的信号所捕捉。在 SelfAware 基准测试(Yin 等人,2023)上,我们每次对每个问题评分一次,并标记三种状态:正确-可回答(C)、错误-可回答(W)和不可回答(U)。普通的答案置信度将C排在W和U之上,但几乎无法区分W和U:它主要告诉你尝试的答案是否成功,而不是尝试本身是否允许。可回答性轴(区分可回答与不可回答)需要不同的信号。这种模式并非小模型的人工产物:它在 Gemma 2 2B、Qwen2.5-3B、Qwen2.5-7B、Llama-3.1-8B 和 Qwen2.5-14B 上重复出现,并且延续到来自 CREPE(Yu 等人,2023)的自然出现的虚假预设,其中两个问题类别均来自同一来源和同一时段的真实用户问题。

我们在创新性方面非常谨慎,因为最接近的先前工作已经很接近了。隐藏状态编码了不可回答性,尽管生成过于自信,这一发现来自 Slobodkin 等人(2023);可迁移到 SelfAware 和虚假前提数据的线性可回答性方向由 Lavi 等人(2026)给出;生成前、查询级别的不确定性信号与答案级别不确定性信号不同的价值在同期工作中得到论证(Chen 等人,2026);模型同时携带 P(True) 和 P(IK) 信号归功于 Kadavath 等人(2022)。我们并不声称发现了可回答性轴在内部是可读的。我们的贡献在于:(i) C、W 和 U 在两种信号下的交叉、相同项几何结构,从 2B 到 8B 跨三个模型系列重复,包括内部 C–W 坍缩并非探针训练标签伪影的验证;(ii) 诚实的控制实验表明,可回答性信号既可以通过表面和诱导恢复,也可以通过探针恢复,这将关于输出置信度的主张限制为普通的答案可能性,同时在 CREPE 上进行了自然数据测试,其中表面混淆因素通过构造大大减弱;(iii) 一个行为后果及其修复:指令式前提检查失败,因为模型不加区分地提出质疑,而将相同指令与隐藏探针结合,以极低的虚假挑战代价恢复了前提纠正;(iv) 将拒绝回答形式化为三类选择性接受,具有独立认证的每轴风险预算,其双风险证书将模糊的能力声称(“模型太弱,无法限制错误答案”)转化为可测量的、规模依赖的量,以及种子重复审计,检查已发布证书在新划分上的保持频率。

## 2 相关工作

Slobodkin 等人(2023)是最接近的前身:他们展示了模型对不可回答问题生成过于自信的答案,而其隐藏状态编码了可回答性,并且他们因果性地擦除了可回答性子空间。我们的输出几何结构与他们的过度自信发现一致;我们的新增贡献在于相同项上的交叉三状态处理以及认证的双信号策略。Lavi 等人(2026)在两个开放权重模型上识别了跨四个抽取式问答数据集的线性不可回答性方向,将其迁移到 SelfAware 和 CREPE,并因果性地引导拒绝回答;我们的可回答性方向是同种对象,我们不声称其新颖。查询级不确定性工作(Chen 等人,2026)明确区分了答案是否正确与查询是否可回答,并在生成前估计后者;我们的区别在于受控的相同项几何结构,而非引入查询级信号。Kadavath 等人(2022)区分了 P(True) 和 P(IK);我们将两者作为一等输出基线运行,同时还有直接前提检查诱导和答案置信度特征的训练后读出器。基于采样的语义熵(Farquhar 等人,2024)不符合我们的单次通过协议,本文未运行;共形拒绝回答(Abbasi Yadkori 等人,2024;Mohri 和 Hashimoto,2024)作为校准后的仅答案置信度策略出现在第7节。在策略方面最接近的是 Phillips 等人(2026),他们显示熵单独不足以进行安全的选择性预测,并将其与正确性探针结合;他们融合两个信号来检测一个结果(答案不正确),而我们则将选择性失败分解为错误-可回答和不可回答状态,并为每个校准单独的风险预算。内部状态真实性和不确定性探针(Azaria 和 Mitchell,2023;Chen 等人,2024;Kossen 等人,2024)以及不确定性解耦(Mucsányi 等人,2024)确立了不确定性是多维的;同期工作显示不确定性和正确性由功能不同的内部特征编码(Patel 等人,2026),这支持了因式分解的前提,但未构建拒绝回答策略。我们的贡献在于生成中可回答性与正确性的具体分解及其认证使用,而非一般性声称。

最后,这个分解本身具有神经符号学的解读。对一个置信度分数设置阈值强制执行了一种隐含的封闭世界支持度处理:低支持度被视为拒绝。三值神经符号推理则将未知区域作为一等对象:Wagner 和 d’Avila Garcez(2022)在 Badreddine 等人(2022)的逻辑张量网络框架中构建了明确的开放/封闭世界边界,带有一个否定互补区域,将系统可以决定的内容与超出其知识范围的内容分开,并且将命名的概念在学习的表示中扎根是概念扎根的神经符号概念(Wagner 和 d’Avila Garcez,2021)。我们的 C/W/U 几何结构是该边界的经验性 LLM 实例化:可允许性轴将模型的封闭片段(尝试成功或失败)与开放区域(尝试本身就是错误)分开;第7节的因式分解策略是两个命名谓词(可回答和正确)的阈值化合取,扎根于隐藏状态中。

## 3 相同决策上的两个维度

#### 设置。

我们使用 SelfAware(Yin 等人,2023),每个模型在每个问题上评分一次,采用平衡样本(150个可回答和150个不可回答;Qwen2.5-3B 各120个),涉及三个系列的五个指令微调模型:Gemma 2 2B-it、Qwen2.5-3B、Qwen2.5-7B、Llama-3.1-8B 和 Qwen2.5-14B。2B 和 3B 模型以全精度运行;7B 和 8B 模型以8比特量化运行,14B 模型以4比特运行,并且我们在 Qwen2.5-3B 上验证了量化管线与全精度管线的一致性(生成准确率相同,可回答性读出器 0.972 对 0.973)。从同一次前向传播中,我们记录输出答案置信度(贪心答案的平均 token 对数概率,以及第一个 token 的预测熵)和三个深度的最终提示 token 隐藏状态。可回答项的正确性通过将生成答案与基准测试的金标准别名匹配来判断。SelfAware 可回答准确率分别为 0.28、0.30、0.35、0.42 和 0.37,我们报告确切分母,并对正确性轴进行适当的谨慎处理。

#### 对称读出器。

为避免将训练后的探针与未训练的标量进行比较,我们为所有四个来源乘以轴的单元格训练等容量的 L2 正则化逻辑读出器,使用相同的校准和测试划分,并在嵌套校准划分上选择隐藏层。输出特征是两种答案置信度统计量;隐藏特征是提示 token 状态。测试项上的百分位自助法 95% 区间显示在括号中。

表 1:对称 2×2 读出器(AUROC,测试半区;自助法 95% CI)。O = 输出置信度特征,H = 隐藏状态;C = 正确性轴,A = 可回答性轴。输出到可回答性的不足在每个规模上持续存在且无趋势(O→A 0.54–0.67;在14B上最小,为0.54);隐藏正确性读出器随规模增长。

由此得出两点,我们诚实地陈述。首先,隐藏状态在2B–3B时中等程度地读取正确性(0.64 和 0.59),在7B–8B时越来越好(0.80 和 0.88),因此我们不声称内部状态缺乏正确性信号;提示时状态已知能预测正确性(Moreno Cencerrado 等人,2025;Patel 等人,2026),并且在8B时隐藏读出器是更好的正确性读取器。随规模不变的是可回答性列:即使训练后的输出读出器也几乎无法读取可回答性(所有四个模型为0.56到0.67),而可回答性轴从隐藏状态读取到0.97到0.99。我们测试的每个模型中都存在的交叉模式是,普通的答案置信度读取执行情况(尝试是否成功),而在可允许性(是否应该进行尝试)方面远远落后。这是一种交叉分数几何结构,而非严格的双重分离,我们以此呈现。

#### 三状态几何结构。

最清晰的表述是几何的。在校准标准化单位中,Gemma 上普通答案置信度的均值分别为 C=0.77, W=−0.23, U=−0.05,而可回答性读出器的均值分别为 C=0.90, W=0.86, U=−0.90。这种模式是 L 形。答案置信度分离了 C 与 W 和 U(C−W 差距 1.00,区间 [0.73,1.24]),但未分离 W 与 U(差值 −0.19,区间 [−0.43,0.06],包含零)。可回答性读出器则相反,分离了 W 与 U(差值 1.76,区间 [1.67,1.86]),但未分离 C 与 W(差值 0.04,区间 [−0.07,0.15],包含零)。Qwen 显示出相同的 L 形,但有一个我们在报告中坦承的注意事项:其内部 C 对 W 的坍缩同样清晰(差值 0.01,区间 [−0.19,0.18]),但其输出 W 对 U 的差值虽小但在统计上非零(−0.32,区间 [−0.61,−0.03])。相同的 L 形在规模上成立:在 Qwen2.5-7B 上,输出 W 对 U 的差值为 0.03(区间 [−0.27,0.30]),而 C 对 W 的分离为 0.82;在 Llama-3.1-8B 上,数值分别为 0.14 [−0.11,0.39] 对 1.03;在 Qwen2.5-14B 上为 −0.16 [−0.44,0.11] 对 0.82;那里内部 W 对 U 的分离分别为 1.73、1.67 和 1.77,而内部 C 对 W 的差值仍然小得多(0.09、0.12 和 0.04)。我们不将包含零的区间解读为无分离的证明;定量陈述是差距比率的强烈不对称性,完整报告在附录A的表7中。

相似文章

LLM置信度估计的不同方法基准测试

Reddit r/artificial

本文对LLM置信度估计的各种黑盒与白盒方法进行了基准测试,包括口头化置信度、语言不确定性、推理长度、P(Answer)、P(True)和自我一致性,比较它们在主动学习和安全分类等任务中的有效性。

面向可靠LLM判断的边际自适应置信度排序

arXiv cs.LG

本文提出了一种针对LLM作为评判系统的基于边际的置信度排序方法,通过学习专用估计器来确保置信度与人类分歧风险之间的单调性,具有泛化保证,并在多个数据集上提高了排序准确性。