口头过度自信的多维度:一项可解释性研究

arXiv cs.CL 论文

摘要

本可解释性研究通过分析不确定性如何通过口头标记、弃权和数值分数表达,聚焦于Qwen3-4B,考察了大型语言模型中的过度自信现象,并提出了识别和缓解过度自信错误的方法。

arXiv:2608.18106v1 公告类型:新 摘要:大型语言模型往往表现出过度自信,在证据提示应谨慎或弃权时给出断言性回答。通过控制操纵逻辑必然性和可能性的推理场景,我们在Qwen3-4B上研究了这一行为,涉及三种表达不确定性的方式:口头认识标记、弃权和数值置信度分数。我们的结果证实了这种过度自信的倾向,特别是在模型被提示输出数值置信度分数时。在可解释性层面,我们提出了一种方法,能够区分识别负责不确定性和确定性的转码器特征。分析显示,Qwen3-4B的默认机制通过广泛的共享特征联盟倾向于生成确定性,而不确定性则作为稀疏覆盖,由一组专门的特征介导实现。干预这些不确定性特征不仅在因果上证明了导致过度自信的不平衡,还缓解了过度自信错误。相同的特征集在三种不确定性表达设置、语言和分布外模态任务中具有泛化能力。
查看原文
查看缓存全文

缓存时间: 2026/08/20 10:01

# 言语过度自信的不同面向:一项可解释性研究

来源:https://arxiv.org/html/2608.18106  
Davide Mazzaccara 特伦托大学认知与脑科学中心 davide\.mazzaccara@unitn\.it & Leonardo Bertolazzi 特伦托大学信息与计算科学系 leonardo\.bertolazzi@unitn\.it

###### 摘要  
大型语言模型倾向于表现出过度自信,在证据提示应保持模糊或回避回答时却给出肯定的答案。我们通过控制推理场景来操纵逻辑必然性与可能性,在Qwen3\-4B模型上研究了这种行为,考察了三种表达不确定性的方式:言语认识标记、回避回答以及数值置信度分数。我们的结果证实了这种过度自信的倾向,尤其在模型被要求输出数值置信度分数时更为明显。在可解释性层面,我们提出了一种方法,能够差异化地识别导致不确定性与确定性的转码器特征。分析表明,Qwen3\-4B的默认机制通过广泛的共享特征联合体倾向于生成确定性内容,而不确定性则通过一小部分专用特征介导的稀疏覆盖来实现。对这些不确定性特征的干预不仅从因果上证明了这种不平衡是过度自信的根源,也能缓解过度自信的错误。相同的特征集在三种不确定性表达设置、不同语言以及分布外模态任务中均表现出泛化能力。

言语过度自信的不同面向:一项可解释性研究  
Davide Mazzaccara 特伦托大学认知与脑科学中心 davide\.mazzaccara@unitn\.it Leonardo Bertolazzi 特伦托大学信息与计算科学系 leonardo\.bertolazzi@unitn\.it  
Raffaella Bernardi 博尔扎诺自由大学 raffaella\.bernardi@unibz\.it

## 1 引言  
大型语言模型正日益渗透到社会的各个实践领域,包括医疗或情报行动等关键场景。尽管它们在生成合适输出方面表现强大,但准确表达对这些输出的不确定性能力仍是一个重大挑战(Xiong等,2024 (https://arxiv.org/html/2608.18106#bib.bib11);Testoni和Calixto,2026 (https://arxiv.org/html/2608.18106#bib.bib20))。一个已确立的发现是,语言模型往往表现出过度自信(Zhou等,2024 (https://arxiv.org/html/2608.18106#bib.bib5)),在证据应建议模糊或回避的情况下却生成肯定的陈述。然而,先前的研究将回避回答视为与言语置信度不同的问题(Wen等,2025 (https://arxiv.org/html/2608.18106#bib.bib15)),或将通过言语认识标记表达的言语置信度与数值置信度分数混为一谈(Zhou等,2023 (https://arxiv.org/html/2608.18106#bib.bib4))。在本研究中,我们尝试采用一种全面的方法,比较这三种言语不确定性表达方式:言语认识标记、回避回答以及数值置信度分数。

受控故事是研究语言模型不确定性表达的有用工具。每个故事都提供一些证据和一个相关问题。如果证据足以逻辑推导出“是/否”答案,模型应表达确定性;否则应表达不确定性。以下两个示例展示了言语设置:确定性通过肯定的动词*is*表达,不确定性则通过认识标记*might*表达。不确定性也可以通过回避回答(“我不知道”)或在1(不确定)到5(确定)的量表上给出低分来表达。

**确定性场景**  
一支铅笔在红色、白色或蓝色盒子中。已知铅笔既不在红色也不在白色盒子里。  
铅笔在蓝色盒子里吗?  
它*在*蓝色盒子里。

**不确定性场景**  
一支铅笔在红色、白色或蓝色盒子中。已知铅笔不在白色盒子里。  
铅笔在蓝色盒子里吗?  
它*可能*在蓝色盒子里。

请参见图1说明:Qwen3\-4B在三种设置中的过度自信表现。左图:确定性场景和不确定性场景中的准确率。右图:每个场景中不确定性侧响应的概率分布:在言语置信度设置中是观察到的认识标记P\(\textit{might, could}\)的累积概率质量,在回避回答设置中是回避回答率,在数值置信度设置中是P\(\text{score}<5\)。菱形标记表示平均值。

本研究的主要目的是更好地理解言语过度自信。我们使用Qwen3\-4B模型(Yang等,2025 (https://arxiv.org/html/2608.18106#bib.bib17))在受控故事上,试图回答以下研究问题:
- • RQ1:模型在言语置信度、回避回答和数值置信度分数中是否表现出过度自信行为?
- • RQ2:模型表达确定性与不确定性的机制是什么?

## 2 实验1  
我们使用受控故事,在言语认识标记、回避回答和数值置信度分数设置中测试Qwen3\-4B的不确定性行为。研究问题是观察是否出现过度自信行为,以及三种设置之间可能存在的差异。

受控故事来自Li等(2025 (https://arxiv.org/html/2608.18106#bib.bib6)),我们将其中的选择题设置重构为开放式问答任务。数据集包含450对前提和问题,其中300个不确定性场景和150个确定性场景,涵盖不同的模板。数据集在所有三种不确定性表达格式中进行测试(提示词见附录A (https://arxiv.org/html/2608.18106#A1))。准确率计算为表达(不)确定性与场景匹配的回答比例。在此背景下,过度自信行为指的是在不确定性场景中给出确定性答案。

为了评估准确率,我们需要根据设置评估模型的输出是确定性还是不确定性。对于言语标记设置,由于模型可能产生范围广泛的表达,我们使用外部模型(Claude Haiku (https://www.anthropic.com/claude/haiku))作为评判者来标注输出为确定性或不确定性。在回避回答设置中,包含回避回答(“我不知道”)的标签被视为不确定性,否则视为确定性。在数值置信度分数设置中,确定性标签为“5”,低于该值则模型输出被视为不确定性。

### 2.1 过度自信表现  
如图1 (https://arxiv.org/html/2608.18106#S1.F1)(左图)所示,在确定性场景中模型持续表达确定性,而在不确定性场景中,它在言语、回避回答和数值设置中分别有14%、27%和80%的情况错误地表达确定性。这种过度自信倾向在数值置信度设置中尤为明显,即模型倾向于在所有场景中都表示“5”(确定)。

图1 (https://arxiv.org/html/2608.18106#S1.F1)(右图)进一步支持了这一观察,显示即使在不确定性场景中,大部分(平均)概率质量也集中在“5”(确定)标记上。在确定性场景中,所有设置的概率质量都接近零;在不确定性场景中,言语设置中概率质量集中在接近1的地方,回避回答设置则在两极之间分布。这种分布不平衡在标记概率层面证实了过度自信。

总体而言,无论不确定性如何被引发,模型都表现出明显的过度自信行为。另一个观察是,当不确定性以数值形式表达时,这种倾向特别强烈,表明数值置信度分数尤其不可靠。

## 3 实验2  
请参见图2说明:针对错误(不确定性场景中产生确定性输出)的前20个不确定性特征的错误干预。左图:提升倍率对错误样本的渐进影响;P\(\textit{assertive}\)下降,而P\(\textit{epistemic}\)和挽救正确率上升,在\times 2.5时达到约94%。右图:在\times 3提升下各设置的准确率。

### 3.1 方法论  
遵循机制可解释性中通过对比选择性定位单元然后进行因果验证的既定实践(AlKhamissi等,2025 (https://arxiv.org/html/2608.18106#bib.bib18)),我们分两个互补阶段识别区分Qwen3\-4B中确定性与不确定性的转码器特征,使用circuit-tracer(Hanna等,2025 (https://arxiv.org/html/2608.18106#bib.bib8))在正确样本的概念层中间层(20–29)上运行:**选择性**——哪些特征在一种条件下比另一种条件下激活更多;**因果贡献**——哪些特征实际上推动下一个标记走向确定性或不确定性表达。这两个阶段回答不同的问题:一个特征可能具有选择性但不移动输出,或者移动输出但不具有条件选择性,因此我们保留两者。

对于选择性,我们用Cohen's d对比每个特征在不同条件下每个样本的平均激活值(使用Mann–Whitney U和Benjamini–Hochberg FDR校正,α=0.05,适用于跨多个同时检验的稀疏、非正态激活),将特征标记为**确定性特定**(d>0.2)、**不确定性特定**(d<−0.2)或**共享**。

对于因果贡献,在500个选择性最高的特征上,我们对每个样本进行一次归因,目标为\(\mathrm{mean}(\mathrm{unembed}(\text{certainty})) - \mathrm{mean}(\mathrm{unembed}(\text{uncertainty}))\)(确定性:*is*, *did*;不确定性:*might*, *could*),并乘以实际观测到的\(|P(\text{certain}) - P(\text{uncertain})|\)缩放,使分数反映对logit的实际推动力,并记录每个特征对该目标的带符号多跳影响作为其dla_score。通过对\(|d|\)和\(|dla\_score|\)的排名取平均,保留那些既具有选择性又具有因果有效性的特征。选择性针对一种条件但推动logit走向相反方向的特征会被降级并排除在干预之外。

### 3.2 默认机制与稀疏覆盖  
选择性与因果贡献之间的区分不仅是方法论上的:它反映了模型实际产生确定性和不确定性的方式,也是过度自信的根源。在**激活**层面上,两种条件看起来相似——共享特征在两者中都占主导(图5 (https://arxiv.org/html/2608.18106#A2.F5)),因此仅靠选择性无法区分它们——但在**logit**层面上它们截然不同:确定性特定特征对确定性标记的贡献几乎为零,而不确定性特定特征则提供了对不确定性标记的主要推动力。

因此,确定性没有专门到达logit的子网络;它是网络的**默认输出**,由广泛的共享中间层特征联合体承载。不确定性是其**稀疏覆盖**:一小群专门的不确定性特定特征仅在提示允许时才接管推动力——对于确定性广泛而浅层,对于不确定性则在同一20-29层内陡峭而集中。只有因果视角才能单独找出实际驱动不确定性的特征,这就是为什么我们依赖它来选择干预目标;这种不对称性也解释了过度自信——确定性是回退选项,因此每当不确定性覆盖激发不足时,模型就默认给出自信的答案,如第3.3节 (https://arxiv.org/html/2608.18106#S3.SS3)的干预所证实。

### 3.3 言语、回避回答与数值不确定性  
为了确立上述识别的特征**导致**模型的确定性或不确定性,而不仅仅是与之相关,我们在生成过程中操纵它们的激活值,提升或抑制排名最高的确定性和不确定性特征,测量对生成文本的影响。

在34个不确定性错误样本上,生成时提升前20个不确定性特征产生渐进式挽救:在\times 1时没有挽救;在\times 1.5时挽救23/34个;从\times 2.5起约94%(32/34)得到挽救,P\(\text{uncertain}\)从0.11上升到0.95(图2 (https://arxiv.org/html/2608.18106#S3.F2))。相反的消融实验确认了这种不对称性:在**正确**不确定性样本上抑制相同的前20个不确定性特定特征,将不确定性表达从99%正确率降至0%;而在确定性样本上对称抑制前20个确定性特定特征,确定性仍保持100%;随机特征基线在两种条件下都保持平稳(附录B.3 (https://arxiv.org/html/2608.18106#A2.SS3))。

相同的前20个不确定性特征,在错误案例上\times 3提升,能够泛化到回避回答设置:82个固定回答错误中有30个翻转为“我不知道”,将回避回答准确率从72.7%提高到82.7%(图2 (https://arxiv.org/html/2608.18106#S3.F2))。因此,驱动*might*/*could*的特征也驱动回避回答,它们以足够抽象的方式编码不确定性,从而在不同的词汇形式中显现。

在数值设置上,相同的提升具有单调但可忽略的影响:期望分数随倍率单调下降,但在\times 3时,只有11个过度自信错误降至5分以下(19.7%→20.0%,图2 (https://arxiv.org/html/2608.18106#S3.F2))。5分的概率质量已经饱和(错误案例上平均P\(5\)=0.95),因此特征无法移动预测。

### 3.4 不确定性特征的泛化  
我们通过将它们应用于Lepori等(2026 (https://arxiv.org/html/2608.18106#bib.bib14))的模态任务来测试言语不确定性的不确定性特征。我们关注*可能*/*不可能*模态条件,每个条件70个样本。我们将相同的前20个不确定性特征钳位到它们在受控故事数据集中的激活值,在\times 1到\times 5范围内缩放,用于Qwen3\-4B生成。输出随后由Claude Haiku使用从*非常不确定*到*非常确定*的言语量表进行评分。

图3 (https://arxiv.org/html/2608.18106#S3.F3)报告了每个确定性标签下,相对于无干预基线的回答数量变化(高于零的条形表示增加回答,低于零的表示减少回答;阴影从浅到深表示\times 1到\times 5)。提升将质量从*比较确定*移动到不确定性标签,但不对称:在*可能*项目上,转变局限于*比较确定*→*比较不确定*的边缘,*非常确定*保持不变,并立即饱和(在\times 1–\times 5范围内平稳);在*不可能*项目上,它随提升规模扩大,逐渐将*比较确定*耗尽到*比较不确定*和*非常不确定*中。

这些特征的泛化证实了Ji等(2025 (https://arxiv.org/html/2608.18106#bib.bib1))最近发现的不确定性表达的线性维度。通过干预,不确定性以多种形式显现。语法上它弱化了情态动词,例如对于“*Could someone start a fire using kindling?*”,从“someone *can* start a fire”变为“someone *could* start a fire”。词汇上,对于“*Could someone chop a carrot using a sword?*”,“it’s *certainly possible*”变为“an *unusual and impractical* scenario”。在某些情况下,干预涉及答案的重新表述,例如对于“*Could someone eat soup using a bucket?*”,“Yes, someone could technically...”

相似文章

一种更优的识别大语言模型过度自信的方法

MIT News — Artificial Intelligence

MIT研究人员开发了一种新方法,通过衡量相似模型间的跨模型分歧来识别过度自信的LLM,而非仅依赖自洽性指标。该方法能更好地捕捉认知不确定性,并在高风险应用中更准确地识别出不可靠的预测。