校准与决策:重新审视未学习语言模型中的可靠性悖论

arXiv cs.CL 论文

摘要

本文重新审视了语言模型机器遗忘背景下的可靠性悖论,证明模型在依赖基于捷径的决策规则的同时能够实现较低的校准误差,从而将该悖论扩展至未学习模型。

arXiv:2605.20915v1 公告类型:新 摘要:机器遗忘旨在从模型中移除特定训练数据的影响,同时保留对剩余数据的可靠行为,这使得可靠预测和不确定性估计对评估至关重要。校准通常被用作语言模型可靠性的代理指标,但低校准误差并不一定意味着可靠的决策规则,因为模型可能依赖虚假相关性同时仍保持良好校准。我们利用TOFU基准上的多项选择问答评估协议,研究了生成式语言模型中的这一差距,通过校准指标(ECE、MCE、Brier)测量概率可靠性,并通过基于归因的捷径检测(使用积分梯度和局部互信息)测量决策规则可靠性。我们发现,微调模型实现了较低的校准误差(ECE ~ 0.04),而预训练模型的校准误差较高(ECE > 0.5);遗忘后的模型尽管在遗忘集上的准确率下降,但仍保持类似的低校准,同时归因分析显示对基于相关性的标记的依赖增加。这些结果表明,遗忘后良好的校准可以与基于捷径的决策规则共存,从而将可靠性悖论扩展到机器遗忘设置中。
查看原文
查看缓存全文

缓存时间: 2026/05/21 06:36

# 校准 vs. 决策:重新审视未学习语言模型中的可靠性悖论
来源:https://arxiv.org/html/2605.20915
Divyaksh Shukla, Ashutosh Modi
印度理工学院坎普尔分校 (IIT Kanpur)
\{divyaksh,ashutoshm\}@cse.iitk.ac.in

###### 摘要

机器遗忘旨在移除模型中特定训练数据的影响,同时保留其在剩余数据上的可靠行为,这使得可靠的预测和不确定性估计对于评估至关重要。校准通常被用作语言模型可靠性的代理指标,但低校准误差并不一定意味着可靠的决策规则,因为模型可能在保持良好校准的同时依赖虚假相关性。我们利用TOFU基准测试上的多项选择问答评估协议来研究生成式语言模型中的这一差距,通过校准指标(ECE、MCE、Brier)衡量概率可靠性,并通过基于归因的捷径检测(结合积分梯度和局部互信息)衡量决策规则可靠性。我们发现,微调后的模型实现了较低的校准误差(ECE≈0.04),而预训练模型的ECE > 0.5;遗忘后的模型尽管在遗忘分片上的准确率有所下降,但仍保持类似的低校准性,而归因分析则显示出对基于相关性标记的依赖增加。这些结果表明,在遗忘后,良好的校准可以与基于捷径的决策规则共存,从而将可靠性悖论扩展到了机器遗忘的设定中。

校准 vs. 决策:重新审视未学习语言模型中的可靠性悖论

Divyaksh Shukla, Ashutosh Modi
印度理工学院坎普尔分校 (IIT Kanpur)
\{divyaksh,ashutoshm\}@cse.iitk.ac.in

## 1 引言

大型语言模型(LLMs)广泛应用于现实世界的决策系统,包括问答、医疗辅助Singhal et al. (2025) (https://arxiv.org/html/2605.20915#bib.bib24); Maity and Saikia (2025) (https://arxiv.org/html/2605.20915#bib.bib18)以及法律自然语言处理Zhong et al. (2020) (https://arxiv.org/html/2605.20915#bib.bib31); Ali et al. (2023) (https://arxiv.org/html/2605.20915#bib.bib1)。在此类场景中,模型预测的可靠性与原始准确率同等重要。一个可靠的模型不仅应产生正确的输出,还应分配反映正确真实可能性的置信度分数Guo et al. (2017) (https://arxiv.org/html/2605.20915#bib.bib10),并使用可解释的决策Wang et al. (2022) (https://arxiv.org/html/2605.20915#bib.bib26)。

模型校准通常被用作可靠性的代理指标,衡量预测概率与经验准确率之间的一致性。然而,近期研究表明,良好的校准并不一定意味着模型是基于有意义或可泛化的特征进行决策的Bihani and Rayz (2024) (https://arxiv.org/html/2605.20915#bib.bib2); Izmailov et al. (2022) (https://arxiv.org/html/2605.20915#bib.bib11)。模型可能在实现良好校准的同时依赖捷径线索或数据伪影,从而导致不可靠的决策。这种现象被称为*可靠性悖论*,即模型根据校准指标看起来可靠,但实际上依赖的是数据集内的捷径而非可解释的决策Bihani and Rayz (2024) (https://arxiv.org/html/2605.20915#bib.bib2)。

参见标题
图 1:遗忘场景下可靠性评估概览。数据集D被分为保留集Dr和遗忘集Df。预训练模型在D上进行微调以得到全微调模型,并通过U(·)进行遗忘以得到遗忘模型。在保留分片上微调预训练模型可得到保留模型(理想遗忘模型)。所有模型均使用校准指标(ECE, MCE, Brier)和基于归因方法导出的捷径分数P_SC和T_SC进行评估。比较这些结果揭示了可靠性悖论:模型可能保持良好校准,却同时依赖捷径线索。

在机器遗忘的背景下,这个问题变得更为关键Cao and Yang (2015) (https://arxiv.org/html/2605.20915#bib.bib3); Eldan and Russinovich (2023) (https://arxiv.org/html/2605.20915#bib.bib6),即模型被修改以移除特定目标训练数据(遗忘数据)的影响,而无需从头重新训练。在遗忘之后,模型可能仍保持良好校准,但其用于预测的内部决策规则可能以意外方式发生变化Wang et al. (2022) (https://arxiv.org/html/2605.20915#bib.bib26); Du et al. (2021) (https://arxiv.org/html/2605.20915#bib.bib5)。这可能导致模型依赖数据集特定的捷径线索而非有意义的特征,从而可能影响遗忘后的可靠性。这被称为可靠性悖论Bihani and Rayz (2024) (https://arxiv.org/html/2605.20915#bib.bib2)。

我们假设机器遗忘既会影响模型的校准可靠性,也会影响其对数据集特定捷径线索的依赖。与标准微调不同,遗忘会明确修改模型参数以移除特定知识。这提出了一个问题:在遗忘之后,校准指标是否仍是决策质量的可靠指标。先前关于可靠性悖论的工作在分类任务上研究了编码器架构,表明良好校准的模型可能依赖捷径特征而非有意义的输入信号Bihani and Rayz (2024) (https://arxiv.org/html/2605.20915#bib.bib2)。然而,尚不清楚这一现象是否也发生在生成式语言模型中,尤其是在机器遗忘之后。在这项工作中,我们将可靠性悖论的研究扩展到LLMs,并通过校准指标和基于归因的分析来分析遗忘后的可靠性。

为了评估遗忘设定下的可靠性,我们使用了虚构遗忘任务(TOFU)数据集Maini et al. (2024) (https://arxiv.org/html/2605.20915#bib.bib17),该数据集为研究语言模型中的遗忘和保留行为提供了受控基准。我们采用了RELU中提出的MCQA评估协议Joshi et al. (2024) (https://arxiv.org/html/2605.20915#bib.bib12),该协议在TOFU上引入了数据转换以稳健地评估遗忘。RELU将TOFU中的生成任务转换为多项选择问答(MCQA)格式,从而能够对模型预测进行概率评估。MCQA设置特别适合校准分析,因为它允许在一组固定的答案选项上计算置信度分数Yang et al. (2026) (https://arxiv.org/html/2605.20915#bib.bib28)。我们在图1 (https://arxiv.org/html/2605.20915#S1.F1)中展示了整体评估流程,包括数据集划分、遗忘和可靠性分析。在这项工作中,我们做出以下贡献:

- • 我们研究了机器遗忘后语言模型的可靠性,这种设定下模型被期望遗忘特定的训练数据,同时保持对剩余知识的可信赖性。我们表明,仅凭常用的校准指标不足以评估此设定下的可靠性。
- • 我们将先前的可靠性分析扩展到生成式语言模型,结合概率可靠性(校准指标)与基于归因的捷径检测(使用积分梯度和局部互信息)的决策规则可靠性。
- • 利用带有RELU MCQA评估协议的TOFU基准,我们对预训练、全面微调、保留和遗忘的Llama-3.1-8B模型进行了系统分析,从而能够在不同遗忘设定下对校准和决策行为进行受控比较。
- • 我们提供经验证据表明,多种遗忘算法产生的模型在保持良好校准的同时,却越来越多地依赖基于相关性的捷径标记,这表明可靠性悖论在遗忘后的生成式语言模型中依然存在。代码和执行日志通过以下链接共享:https://github.com/Exploration-Lab/Unlearning-Reliability-Paradox。

## 2 相关工作

机器遗忘旨在移除模型中特定训练数据的影响,而无需从头重新训练。早期工作研究了经典ML设定中的遗忘Cao and Yang (2015) (https://arxiv.org/html/2605.20915#bib.bib3); Ginart et al. (2019) (https://arxiv.org/html/2605.20915#bib.bib8),近期工作则使用近似遗忘算法将其扩展到大型语言模型Eldan and Russinovich (2023) (https://arxiv.org/html/2605.20915#bib.bib6)。一些基准测试如TOFU、WMDP和MUSE已被提出用于评估LLMs中的遗忘Maini et al. (2024) (https://arxiv.org/html/2605.20915#bib.bib17); Li et al. (2024) (https://arxiv.org/html/2605.20915#bib.bib13); Shi et al. (2024) (https://arxiv.org/html/2605.20915#bib.bib23)。这些工作主要评估模型是否忘记了目标数据,同时保持任务性能,但并未研究由此产生的模型是否做出可靠决策。

神经模型的可靠性通常通过校准来评估,校准衡量预测置信度与经验准确率之间的一致性Guo et al. (2017) (https://arxiv.org/html/2605.20915#bib.bib10); Mukhoti et al. (2020) (https://arxiv.org/html/2605.20915#bib.bib19)。然而,近期工作表明,良好校准的模型仍可能依赖捷径线索或虚假相关性,从而导致可靠性悖论Bihani and Rayz (2024) (https://arxiv.org/html/2605.20915#bib.bib2); Du et al. (2021) (https://arxiv.org/html/2605.20915#bib.bib5); Wang et al. (2022) (https://arxiv.org/html/2605.20915#bib.bib26)。诸如积分梯度之类的归因方法通常用于分析有影响的输入Sundararajan et al. (2017) (https://arxiv.org/html/2605.20915#bib.bib25); Sarti et al. (2023) (https://arxiv.org/html/2605.20915#bib.bib22),并且将它们与数据集统计信息(如互信息)相结合有助于识别数据集特定的捷径Bihani and Rayz (2024) (https://arxiv.org/html/2605.20915#bib.bib2)。研究还表明,尽管大型语言模型性能有所提升,但捷径学习仍然存在Du et al. (2023) (https://arxiv.org/html/2605.20915#bib.bib4); Yuan et al. (2024) (https://arxiv.org/html/2605.20915#bib.bib29); Izmailov et al. (2022) (https://arxiv.org/html/2605.20915#bib.bib11)。

Bihani and Rayz (2024) (https://arxiv.org/html/2605.20915#bib.bib2) 表明,仅靠校准并不能保证可靠的决策规则,他们通过比较基于编码器的分类模型中的置信度校准与基于归因的分析来证明这一点。然而,尚不清楚这种可靠性悖论是否也出现在生成式仅解码器语言模型中,尤其是在机器遗忘场景下,因为在该场景中模型参数被明确修改以移除特定知识。在这种情况下,遗忘可能会改变模型的内部决策规则,而不一定影响概率校准,这使得仅靠校准不足以评估可靠性。在这项工作中,我们通过联合分析校准和生成式语言模型中基于捷径的归因来研究遗忘后的可靠性。由于空间限制,我们在附录A (https://arxiv.org/html/2605.20915#A1)中提供了详细的相关工作。

## 3 背景

在本节中,我们讨论使用校准和可解释决策规则来衡量语言模型可靠性的背景。决策规则的可解释性进一步细分为:提取单词与预测标签之间的局部互信息,以及使用归因方法识别有影响的输入特征。

### 3.1 标记归因

我们遵循Bihani and Rayz (2024) (https://arxiv.org/html/2605.20915#bib.bib2) 提出的基于归因的捷径识别框架。为了分析模型的决策规则,我们使用积分梯度(IG)计算标记级别的归因分数Sundararajan et al. (2017) (https://arxiv.org/html/2605.20915#bib.bib25)。积分梯度(IG)是一种基于梯度的归因方法,它通过沿着从基线输入到实际输入的路径对梯度进行积分,来衡量每个输入标记对模型预测的贡献。给定输入序列x和基线x',标记i的归因使用公式1 (https://arxiv.org/html/2605.20915#S3.E1)计算,其中M_y表示对应于预测答案选择的模型输出,x'用一个d维的随机向量表示(d是嵌入矩阵的维度)。得到的归因分数表示每个标记影响预测logits的程度。归因值较高的标记被认为对模型决策影响更大。对于每个示例,我们选择归因分数最高的前k个标记作为模型的决策标记。

IG(x_i) =
(x_i - x'_i) ·
∫_{α=0}^{1} ∂M_y(x' + α(x - x')) / ∂x_i dα   (1)

在离散的标记空间中,我们在嵌入上计算IG,通过黎曼和进行近似(如公式2 (https://arxiv.org/html/2605.20915#S3.E2)所示)。每个标记的归因值表示该标记对所选答案的预测logits的影响程度。正值表示支持性证据,负值表示反对性证据。为了在序列级别分析决策规则,标记归因会跨子词标记进行聚合,以识别输入的哪些部分作为预测的相关性线索。

IG(x_i) ≈
(x_i - x'_i) ·
1/m ∑_{k=1}^{m} ∂M_y(x' + k/m (x - x')) / ∂x_i   (2)

### 3.2 局部互信息(LMI)

仅凭归因分数并不能判断一个具有影响力的标记对应的是有意义的语义特征还是数据集特定的相关性线索。根据Bihani and Rayz (2024) (https://arxiv.org/html/2605.20915#bib.bib2),我们通过将归因分数与局部互信息(LMI)相结合来识别捷径标记,LMI衡量的是数据集级别上标记与标签之间的关联。

对于每个标记w和标签y,我们可以计算w出现在标签为y的示例中的联合概率p(w,y)、条件概率p(y|w)以及标签y的边缘概率p(y)。然后可以像公式3 (https://arxiv.org/html/2605.20915#S3.E3)所示那样计算LMI。

LMI(w,y) = p(w,y) log p(y|w) / p(y)   (3)

具有高LMI分数的标记与特定标签强相关,可能代表数据集特定的线索,而不是可泛化的语义特征。

在我们的设定中,我们使用RELU中提出的MCQA格式评估模型,其中每个示例由一个提示和四个答案选项组成。标签y对应正确的答案选项。我们在整个数据集上计算输入标记与预测答案标签之间的LMI。

#### 选择捷径

对于每个标签,我们根据LMI分数对标记进行排序。

相似文章

概率校准是大语言模型中的一项可训练能力

arXiv cs.CL

本文研究了语言模型的概率校准能力是否可以通过微调得到提升,并在12种模型上比较了软目标和硬目标两种方法。结果表明,校准能力是可以训练的,但有时会导致下游算术推理能力的下降。