模型能否免费捕捉自身的幻觉?:无标签怀疑信号在拒绝回答任务中与标签数据集相媲美

arXiv cs.CL 论文

摘要

本文提出了一种无标签方法,使大型语言模型在不确定时拒绝回答,利用内部置信信号,并展示其在性能上与监督式拒绝回答调优相匹配。

arXiv:2608.26121v1 公告类型:新 摘要:大型语言模型在陈述虚假事实时与陈述真实事实一样流畅,但模型内部常常"知道"自己何时处于不稳定的境地:它对自己答案的分配概率在错误事实上往往下降。处理这一问题的通常方法是教模型拒绝回答而非猜测,这需要一个包含正确和错误答案的标签数据集。我们探究模型自身的置信度——它是免费且无需标签的——是否能胜任这项工作。我们对每个模型进行微调(使用LoRA),使其在置信度高时回答,在置信度低时说"我不确定",仅使用信号而无正确性标签。在六个开源模型(参数从1B到8B,来自两个系列)上进行短式事实问答,正确性由独立评判模型裁定,这种无标签方法与标签监督的拒绝回答调优相抗衡:在匹配覆盖度下,我们发现两者在统计上无显著差异。一个控制实验中,专注于困难示例而非拒绝回答并无帮助,表明收益来自校准而非机械记忆。该信号的一个盲点是置信但错误的事实,它无法标记。因此,模型自身的怀疑是教其何时拒绝回答时标签数据集的近似免费替代品。代码和制品可根据要求提供。
查看原文
查看缓存全文

缓存时间: 2026/08/28 09:17

# 模型能否免费捕捉自身的幻觉?:无标签的不确定信号与有标签数据集在拒绝回答任务上的表现相当
来源:https://arxiv.org/html/2608.26121  
Tony Salomone Transformer Lab Deep Gandhi Transformer Lab 通讯作者:deep@lab\.cloud

###### 摘要

大型语言模型能流畅地陈述虚假事实,但模型通常在“内心”知道自己何时站不住脚:它为自身答案分配的概率,往往在事实错误时会下降。通常处理这种情况的方法是教模型在猜测时选择拒绝回答,而不是猜测,但这需要一个包含正确与错误答案的有标签数据集。我们想问,模型自身(免费且无需标签)的*置信度*能否替代这一任务。我们使用LoRA对每个模型进行微调,使其在自身冻结的置信度高时回答,在置信度低时说“我不确定”,仅使用该信号,而不使用正确性标签。在六个开源模型(1B–8B,两个系列)上进行短形式事实问答任务测试,并由独立的评审模型判定正确性,结果表明,这种无标签的方法与有标签监督的拒绝回答微调效果相当:在覆盖率匹配的情况下,我们未发现两者之间存在统计上可检测的差异。一个通过强化困难示例而非拒绝回答的控制实验没有帮助,这表明收益来自*校准*,而非机械记忆。该信号的唯一盲点是*自信错误*的事实,它无法标记。因此,模型自身的不确定性是在教其何时拒绝回答时,数据集的一个近乎免费的替代品。代码和工件可按需提供。

## 1 引言

语言模型会产生幻觉:它们以陈述真实事实同样的自信陈述虚假事实,而流畅的表达让读者无法感知到某个主张缺乏支持。越来越多的研究观察到,模型的*内部*状态包含了关于自身正确性的信息,特别是,模型在正确事实上分配的token级概率高于错误事实。我们在自己的模型上证实了这一点:答案片段上的平均对数概率,能以0.73–0.86的AUROC区分正确与错误答案,即使在1B模型上也是如此。

如果模型已经“知道何时不确定”,那么自然的问题是,能否教会它*根据*这种知识采取行动,即在低置信度事实上选择拒绝回答,而不是断言它们。一种简单的方法是在推理时将冻结信号作为外部门控进行阈值处理;我们选择将行为*内化*到权重中,使模型原生地进行拒绝,这不需要部署时的外部评分器,并能让拒绝与生成过程交互。通常的拒绝教学方法是监督式的:为训练集收集正确性标签,并训练模型拒绝回答其错误的问题。但标签很昂贵:它需要知道每个训练问题的正确答案。我们提出一个更经济的问题:模型自身的*置信度信号*(免费、已存在、无需标签)能否扮演这些标签的角色?

我们研究*信号门控的拒绝微调*。我们预先计算一次冻结基础模型在每个训练问题答案片段上的置信度;对其进行阈值处理;然后微调模型,使低置信度问题被重定向到“我不确定”,而高置信度问题保持模型自身的答案。整个过程从未使用正确性标签。我们在2×3模型网格上,将其与相同方法的标签监督版本、标准微调、一个上采样权重控制组以及未经训练的基础模型进行了直接比较,正确性由独立的开源评审模型判定,显著性通过bootstrap置信区间评估。

贡献。

1. 1\.无标签的拒绝回答方案。我们引入*信号门控的拒绝微调*,它使用模型自身冻结的token概率置信度,无需正确性标签,来教模型在内部不确定事实上拒绝回答。我们首先验证了该方案所依赖的前提:这种置信度在六个模型和两个系列中都能区分模型自身的幻觉,即使在1B规模下也是如此(§5 (https://arxiv.org/html/2608.26121#S5))。
2. 2\.免费置信度与有标签数据集表现相当。在覆盖率匹配且由独立评审判定的情况下,无标签方案与有标签监督的拒绝微调具有竞争力:我们在所有六个模型上都未检测到差异(§5 (https://arxiv.org/html/2608.26121#S5))。
3. 3\.收益来自校准,而非记忆。一个上采样权重控制组,在强化相同困难问题时并未拒绝回答,未能减少幻觉,这将校准孤立为关键机制(§5 (https://arxiv.org/html/2608.26121#S5))。
4. 4\.对局限性的诚实说明。我们指出了该方法失效之处:无法标记的自信错误事实,以及幻觉集中的罕见实体(§6 (https://arxiv.org/html/2608.26121#S6))。

## 2 相关工作

#### 内部置信度信号。

一系列工作通过读取模型自身内部状态来检测幻觉:基于token概率的幻觉检测器\[18 (https://arxiv.org/html/2608.26121#bib.bib18),16 (https://arxiv.org/html/2608.26121#bib.bib16)\],以及对事实置信度估计器的综述,这些综述提醒原始序列概率在QA任务上是一个相对较弱的估计器\[14 (https://arxiv.org/html/2608.26121#bib.bib14)\]。Kumaran等人\[12 (https://arxiv.org/html/2608.26121#bib.bib12)\]认为一阶token对数概率存在固有盲点,并提出了基于语言或激活的替代方案。我们的结果与这两点观察一致:对数概率信号具有足够的区分能力,因而有用,但其残余错误恰好是它无法看到的自信错误案例。

#### 教授拒绝与放弃。

另一类互补的工作通过微调模型在知识边界处拒绝回答,通常使用正确性信号、标签或奖励:感知拒绝的微调与拒绝token\[8 (https://arxiv.org/html/2608.26121#bib.bib8)\],通过强化学习实现的知识边界拒绝\[3 (https://arxiv.org/html/2608.26121#bib.bib3)\],以及无需训练的保形拒绝\[21 (https://arxiv.org/html/2608.26121#bib.bib21)\]。这些方法依赖正确性信号、标签或奖励来决定*在何处*拒绝;我们询问模型自身的置信度是否能免费提供这种监督。

#### 通过训练内化置信度。

多种方法将置信度或拒绝行为固化到权重中:置信度token与路由\[2 (https://arxiv.org/html/2608.26121#bib.bib2)\],用于级联的置信度微调\[17 (https://arxiv.org/html/2608.26121#bib.bib17)\],可微分校准损失\[11 (https://arxiv.org/html/2608.26121#bib.bib11)\],以及使用适当评分奖励的强化学习\[19 (https://arxiv.org/html/2608.26121#bib.bib19)\]。最接近我们的是自监督方法:将模型自身的(基于采样或自评估的)不确定性蒸馏为语言表达的置信度\[6 (https://arxiv.org/html/2608.26121#bib.bib6),1 (https://arxiv.org/html/2608.26121#bib.bib1)\],以及使用少量外部标签进行自我蒸馏以恢复校准的\[20 (https://arxiv.org/html/2608.26121#bib.bib20)\]。我们区别于它们在于具体、廉价的方案:一个*冻结的、单次传递的token概率*信号,经阈值处理成二元的拒绝/回答目标,以及一个与*有标签监督*版本进行的、控制覆盖率匹配的比较。Kaplan等人\[10 (https://arxiv.org/html/2608.26121#bib.bib10)\]记录了标准微调可能导致事实遗忘;我们的标准微调控制组重现了这种中性到略差的表现。最后,Liu等人\[13 (https://arxiv.org/html/2608.26121#bib.bib13)\]提醒,校准指标与忠实的不确定性表达可能存在差异;因此,我们报告选择性风险,而非依赖期望校准误差。

## 3 方法

#### 置信度信号。

对于问题q,模型贪婪解码出一个答案a=(t₁,...,tₘ)。我们定义其置信度为模型为其自身答案token分配的平均对数概率,
s(q) = (1/m) ∑_{i=1}^m log p_θ(t_i | q, t_{<i}),
该值在微调前从冻结的基础模型*预先计算一次*。更高的s意味着模型将其概率集中于自身答案;更低的s意味着模型即使在生成流畅答案时,内部也在有所保留。

#### 信号门控拒绝微调(我们的方法,“C3”)。

在一个训练集上,我们根据s(q)对问题进行排序,并选取最低s比例(拒绝阈值,一个覆盖率调节旋钮)。对于这些低置信度问题,监督目标变为一个固定的拒绝字符串(“我不确定。”);对于其余问题,目标则是模型*自身*的贪婪答案(自蒸馏)。我们使用LoRA(r=16)进行微调。整个过程未使用任何正确性标签:仅凭冻结信号决定在何处拒绝。

#### 对比方法(相同方案,不同监督)。

- •Base:未经训练的指令模型。
- •标准SFT(“C1”):在模型自身的贪婪答案上进行LoRA微调(无拒绝,无信号)。
- •有标签监督的拒绝(“C2”,R-Tuning风格\[23 (https://arxiv.org/html/2608.26121#bib.bib23)\]):与我们的方法相同,只是拒绝/回答的决策使用*正确性标签*(基础模型错误的地方拒绝,通过金标准+别名匹配判定),而非信号。
- •上采样权重控制组(“C4”):对于低信号问题,不是拒绝,而是*增加*其对答案的损失权重(“强化记忆”)。如果C4与C3表现匹配,则收益是召回率,而非校准。

## 4 实验设置

#### 模型。

六个开源指令模型,构成2×3网格(系列×规模):Llama-3.2-1B, Llama-3.2-3B, Llama-3.1-8B\[5 (https://arxiv.org/html/2608.26121#bib.bib5)\];Qwen3-1.7B/4B/8B\[22 (https://arxiv.org/html/2608.26121#bib.bib22)\](运行非思考模式以保证答案片段可比性)。所有模型均使用LoRA\[7 (https://arxiv.org/html/2608.26121#bib.bib7)\](r=16)进行微调;每个网格单元进行一次训练。

#### 数据。

一个事实性短问问答集,包含700个开发集和700个测试集问题,来源于PopQA\[15 (https://arxiv.org/html/2608.26121#bib.bib15)\](MIT)和TriviaQA\[9 (https://arxiv.org/html/2608.26121#bib.bib9)\](Apache-2.0),每个划分包含300个TriviaQA和400个PopQA问题。

划分按*实体分组*:开发集和测试集*零*重叠实体,防止记忆事实泄露。策略性答案和置信度信号按模型分别生成。

#### 指标与协议。

*覆盖率*是模型回答(而非拒绝)的问题比例;*幻觉率*是*已回答*项目中被评审标记为不正确的比例。由于拒绝越多的方法回答的问题越少(且越简单),两者存在权衡:*风险-覆盖率曲线*在拒绝阈值变化覆盖范围时绘制幻觉率,AURC(曲线下面积,越低越好)总结了与任何单一操作点无关的选择性预测性能。测试集上的正确性由一个*独立的*开源评审模型gemma-2-27b-it\[4 (https://arxiv.org/html/2608.26121#bib.bib4)\]判定(特意选择既非Llama也非Qwen系列,以避免同系自我偏好)。我们使用AURC而非期望校准误差,因为我们的模型是拒绝回答而非输出数值置信度,因此置信度分箱校准指标在此不适用。

#### 显著性。

*覆盖率匹配*意味着我们为每个模型设置C3的拒绝阈值,使其覆盖率近似于C2,然后在该操作点比较幻觉率(仍存在小的残余覆盖率差距;见局限性)。置信区间是基于700项测试集(固定种子)的1,000次项目级bootstrap重采样得到的百分位区间。这些区间仅捕捉测试集的采样方差,而非训练种子方差。

## 5 结果

#### 信号能区分幻觉(且在大规模下基本保持有效)。

冻结的平均对数概率信号能以AUROC 0.778/0.821/0.858(Llama 1B/3B/8B)和0.755/0.778/0.725(Qwen3 1.7B/4B/8B)区分基础模型的正确与错误答案,所有值均高于0.65,即使在1B规模下也具有区分性。趋势在Llama内是单调的,但在Qwen3内不是(其8B值是三者中最低的)。

#### 无标签与有标签监督表现相当(主要结论)。

表1 (https://arxiv.org/html/2608.26121#S5.T1)报告了在覆盖率匹配下由评审判定的幻觉率。在所有模型上,C2与C3的95% bootstrap置信区间都重叠,即我们未检测到无标签方法与有标签监督方法之间存在幻觉差异。点估计落在一个狭窄范围内(C3/C2减少比为0.95–1.10),根据此证据,这属于噪声范围内;因此,我们将结果解读为持平(未检测到差异),而非任一方法优于另一方。标准微调(C1)表现与基础模型持平或略差。

表1:在700项保留测试集上由评审判定的幻觉率(越低越好)。C1=标准SFT,C2=有标签监督拒绝(R-Tuning),C3=我们的方法(无标签)。C3在覆盖率匹配C2的条件下评估;C3的覆盖率已显示(C2通过过度拒绝在可比的低覆盖率≈0.15–0.50下操作)。在所有模型上,C2与C3的95% bootstrap置信区间重叠(未检测到差异)。C3/C2列(相对于基础模型的幻觉*减少*比率)是噪声范围内的点估计。参照图例:图1:幻觉率(越低越好)。在覆盖率匹配下,无标签拒绝(C3,红色)和有标签监督拒绝(C2,蓝色)在所有模型上均未显示出可检测的差异(95% bootstrap置信区间重叠),两者都远低于未经训练的基础模型(灰色)。无标签方法无需正确性标签。

#### 收益与校准一致,而非记忆。

上采样权重控制组(C4)在接近完全覆盖率下保持了基础模型的幻觉率,而C3降低了幻觉率:更用力地训练低信号问题毫无帮助,而将其重定向到拒绝则有效。(此控制组是在我们的字符串匹配,n=250阶段测量的;下面基于评审的、n=700的选择性预测结果是真实校准的更有力证据。)

#### 选择性预测。

被视为选择性预测器时,C3的冻结信号比非选择性模型产生更低的风险-覆盖率曲线下面积:Llama(1B/3B/8B)降低7/25/28%,Qwen3(1.7B/4B/8B)降低17/24/26%,其中较大的Llama模型收益最大。拒绝目标明确:有用修正与浪费在正确答案上的拒绝之比大约为7:1。

#### 鲁棒性。

在字符串匹配与评审判定正确性下(评审使C3看起来略*好*而非更差),持平的结论不变;适用于两个模型系列;并且从n=250到n=700保持稳定;实际上,在n=250时一个明显的69%点估计是采样噪声,在n=700的bootstrap下消失了。用能量信号替代平均对数概率没有带来增益。

## 6 讨论与局限

实践要点是,模型自身的置信度在教授短形式拒绝回答时,是一个有前景的、近乎免费的正确性标签替代品:在六个模型上,我们无法区分无标签方法与有标签监督方法。两种失败模式界定了结果。首先,幻觉集中在*罕见*实体上:最差的人口统计...

相似文章

幻觉作为承诺失败:大型语言模型在知晓答案的情况下仍然犯错

arXiv cs.CL

本文研究了大型语言模型在其生成时间分布中已有正确答案时仍产生幻觉的现象。通过引入答案可用性的语义概念,作者表明16-47%的指令调优模型幻觉发生在正确概念已经表示的情况下,并且这一比例随着模型规模增加而上升。他们指出,指令调优强化了答案承诺,使得有用性和自信幻觉成为同一枚硬币的两面。

使用分流解码的大语言模型幻觉检测

arXiv cs.CL

本文提出分流解码(diversion decoding)方法,通过在解码阶段主动挑战模型响应来提取特征,训练不确定性启发式模型,从而检测大语言模型中的幻觉,实现了更优的性能和更低的计算复杂度。

为什么语言模型会产生幻觉

OpenAI Blog

OpenAI发布研究指出,语言模型产生幻觉的原因在于标准的训练和评估程序奖励猜测而不是承认不确定性,并建议评估指标应该优先考虑对局限性的诚实认识而不是原始准确率。

共识作为无标签自蒸馏的特权上下文

arXiv cs.LG

一篇研究论文,介绍了CANON,一种无标签自蒸馏方法,利用采样解之间的共识为训练大型语言模型在推理任务上提供密集的标记级监督,可将pass@1提升最多12个百分点,并以极少的计算量超越无标签强化学习。