概率校准是大语言模型中的一项可训练能力
摘要
本文研究了语言模型的概率校准能力是否可以通过微调得到提升,并在12种模型上比较了软目标和硬目标两种方法。结果表明,校准能力是可以训练的,但有时会导致下游算术推理能力的下降。
arXiv:2605.11845v1 公告类型:新论文
摘要:语言模型越来越多地应用于需要根据用户指定的随机性约束生成输出的场景中,然而它们的生成概率往往与目标分布校准不佳。我们研究了这种能力是否可以通过微调直接得到提升。具体而言,我们在要求从数学分布中进行采样的合成提示上对语言模型进行微调,并比较了两种校准微调变体:一种软目标方法,将期望的输出分布转换为基于trie的下一token目标;另一种硬目标方法,在从同一目标分布中采样的完成上进行训练。在跨越四个系列的12种模型上,两种方法都在未见过的分布系列和未见过的参数设置上显著提高了结构化采样的保真度,表明概率校准是一项可训练的能力。在我们选择的训练配置下,这两种方法表现出不同的实证特征:硬目标微调通常在结构化数值采样上表现最强,而软目标微调则在更广泛的随机生成基准上表现更好,包括开放式随机生成、多项选择题答案位置平衡以及NoveltyBench。这种提升有时会降低下游能力,尤其是算术推理能力,且不同模型的代价各不相同。总体而言,我们的结果表明,概率校准可以通过微调得到改善,其中我们的硬目标配置有利于精确的数值保真度,而软目标配置有利于更广泛的随机迁移。代码可在 https://github.com/chandar-lab/calibration-finetuning 获取。
查看缓存全文
缓存时间: 2026/05/13 06:19
# 概率校准是大语言模型的一项可训练能力
来源: https://arxiv.org/html/2605.11845
Davide Baldelli$^{1,2,3,4}$, Sruthi Kuriakose$^6$, Maryam Hashemzadeh$^{1,2,5}$, Amal Zouaq$^{2,3,4}$, Sarath Chandar$^{1,2,4}$
$^1$ Chandar Research Lab
$^2$ Mila – Quebec AI Institute
$^3$ LAMA-WeST Lab
$^4$ Polytechnique Montréal
$^5$ Université de Montréal
$^6$ 独立研究人员
###### 摘要
语言模型越来越多地用于需要输出满足用户指定随机性约束的场景,但其生成概率往往与这些目标 poorly 校准(即校准不佳)。我们研究了这种能力是否可以通过微调直接得到改善。具体而言,我们在要求从数学分布中采样的合成提示上微调语言模型,并比较了两种校准微调(Calibration Fine-Tuning)变体:一种是将期望的输出分布转换为基于前缀树(trie)的下一个 token 目标的软目标方法,另一种是在来自同一目标分布的采样补全上进行训练的硬目标方法。在涵盖四个家族的 12 个模型中,这两种方法在保留的分布家族和未见过的参数设置下,都显著提高了结构化采样的保真度,表明概率校准是一项可训练的能力。在我们选择的训练配置下,这两种方法表现出不同的实证特征:硬目标微调通常在结构化数值采样上表现最强,而软目标微调在更广泛的随机生成基准上表现更好,包括开放式随机生成、多选题答案位置平衡以及 NoveltyBench。这些增益有时会降低下游能力,尤其是算术推理能力,且成本因模型而异。总体而言,我们的结果表明,通过微调可以改善概率校准,其中硬目标配置有利于精确的数值保真度,而软目标配置有利于更广泛的随机性迁移。代码可在 https://github.com/chandar-lab/calibration-finetuning 获取。
## 1 引言
语言模型越来越多地被用作生成和决策的通用接口(Chatterji et al., 2025 (https://arxiv.org/html/2605.11845#bib.bib2))。在许多此类应用中,仅仅产生一个有效答案是不够的:当请求涉及随机性、多样性或平衡选择时,模型应根据预期的随机行为分配概率质量。在这些设置中,可达输出集合以及概率质量在这些输出上的分配都很重要。
在形式化空间中,校准采样是一个标准原语:人们调用类似 `np.random.normal(...)` 的例程来获取来自指定分布的样本。而在语言空间中,没有同样可靠的等效原语。在实践中,语言模型是处理诸如“告诉我一个随机城市”或“告诉我 1 到 10 之间的一个随机数”等请求的自然候选接口,但它们诱导的输出分布控制 poorly 不佳。当前的预训练和后训练目标并不激励校准后的输出概率:前者优化观察文本上的下一个 token 预测,后者奖励任务成功、合规性或偏好响应。毫不奇怪的是,语言模型往往会坍缩到狭窄的输出子集上,违反简单的支持约束,并诱导出的分布远离请求的目标(Renda et al., 2023 (https://arxiv.org/html/2605.11845#bib.bib23); Zhao et al., 2026 (https://arxiv.org/html/2605.11845#bib.bib32); Gu et al., 2026 (https://arxiv.org/html/2605.11845#bib.bib6))。基于提示的变通方法有所帮助,但会增加推理时的成本和提示敏感性(Misaki and Akiba, 2025 (https://arxiv.org/html/2605.11845#bib.bib18); Xiao et al., 2025b (https://arxiv.org/html/2605.11845#bib.bib28))。
这就引出了一个更具体的问题:微调能否使语言模型成为更好的校准概率采样器,使其样本反映请求的预期随机性?
在这项工作中,我们研究了一种简单的设置,其中预期的随机性由已知的目标分布精确指定。我们在要求从数学分布中采样的合成提示上训练语言模型,并比较两种用于教授这种行为的校准微调策略。第一种是**软目标**微调:我们为提示枚举有效的数值输出,为每个输出分配其目标概率,并将这种针对完整答案的分布转换为每个前缀上下一个 token 的监督概率。第二种是**硬目标**微调:我们从目标分布中绘制大量数值答案,并使用标准的下一个 token 交叉熵对其训练。
我们的主要发现是,概率校准是一项可训练的能力。在 12 个模型中,软目标微调和硬目标微调都显著提高了在保留的分布家族和未见过的参数设置下的结构化采样保真度。然而,这两种方法表现出不同的实证特征。在我们通过消融实验选择的最终配置下,硬目标微调通常在结构化数值采样本身方面表现最强,而软目标微调在更广泛的随机生成设置中表现更好,并且更常产生有利的困惑度诊断结果。
总之,我们做出以下贡献:
- 我们将概率校准研究为语言模型的一项可训练能力,将问题框架化为学习有效输出空间以及分配在其上的概率质量。
- 我们为这种设置引入并比较了两种微调策略:一种基于前缀树诱导的下一个 token 监督的软目标方法,另一种基于从同一目标分布重复采样补全的硬目标方法。
- 在 12 个模型中,我们表明这两种方法都显著提高了在保留家族和未见参数设置下的结构化采样保真度,其中硬目标微调通常在域内数值基准上表现最强。
- 我们表明,这些增益迁移到了合成训练域之外,我们的软目标配置通常在更广泛的随机生成基准(如开放式随机生成、MCQ 答案位置平衡(Zhao et al., 2026 (https://arxiv.org/html/2605.11845#bib.bib32))和 NoveltyBench(Zhang et al., 2025 (https://arxiv.org/html/2605.11845#bib.bib31)))上表现更好,而保留性和困惑度结果揭示了在选定训练预算下依赖模型的权衡。
参见图注
**图 1:校准微调管道。** 提示定义目标定律 $P$,离散化为规范输出空间 $Y$,带有质量 $P_Y$。软目标微调构建 token 前缀树,并使用 $\mathcal{L}_{\mathrm{soft}}$ 匹配诱导的下一个 token 分布。硬目标微调采样 $y \sim P_Y$,对其进行分词,并应用掩码补全交叉熵 $\mathcal{L}_{\mathrm{hard}}$。在两种变体中,仅更新 LoRA 适配器。
## 2 相关工作
#### 语言模型作为较差的原生采样器,以及提示变通方法。
越来越多的工作表明,标准自回归语言模型是较弱的随机发生器。早期的控制性评估发现,即使在简单的合成设置中,与目标分布也存在巨大偏差(Renda et al., 2023 (https://arxiv.org/html/2605.11845#bib.bib23)),后续工作表明,在更具挑战性的独立单样本提示协议下,这些失败持续存在且往往恶化(Zhao et al., 2026 (https://arxiv.org/html/2605.11845#bib.bib32))。前沿模型通常可以将提供的随机种子转换为目标分布,但在要求直接从这些分布中采样时仍然失败(Gu et al., 2026 (https://arxiv.org/html/2605.11845#bib.bib6))。类似的失败也出现在教科书式数值设置之外,包括密码生成(Karanjai et al., 2025 (https://arxiv.org/html/2605.11845#bib.bib10))和博弈论决策制定(Guo et al., 2025 (https://arxiv.org/html/2605.11845#bib.bib7))。基于提示的干预措施可以通过注入额外的推理或合成熵来部分改善随机行为(Misaki and Akiba, 2025 (https://arxiv.org/html/2605.11845#bib.bib18); Xiao et al., 2025b (https://arxiv.org/html/2605.11845#bib.bib28)),但这发生在推理时,并引入了额外的提示敏感性和计算开销,而我们的重点在于训练模型本身以更好地匹配已知的目标分布。
#### 校准、软目标和概率塑造目标。
我们在分布意义上使用“校准”,这意味着输出概率与目标统计分布的对齐,而不是认知不确定性校准(Kapoor et al., 2024 (https://arxiv.org/html/2605.11845#bib.bib9))。更广泛地说,我们的方法属于通过软监督、蒸馏或校准感知训练来塑造预测分布的目标家族(Lee et al., 2022 (https://arxiv.org/html/2605.11845#bib.bib13); Kim et al., 2025 (https://arxiv.org/html/2605.11845#bib.bib11); Liang and Wang, 2026 (https://arxiv.org/html/2605.11845#bib.bib14); Pereira et al., 2026 (https://arxiv.org/html/2605.11845#bib.bib21); Kirk et al., 2023 (https://arxiv.org/html/2605.11845#bib.bib12); Xiao et al., 2025a (https://arxiv.org/html/2605.11845#bib.bib27); Parikh et al., 2026 (https://arxiv.org/html/2605.11845#bib.bib20); Luo et al., 2025 (https://arxiv.org/html/2605.11845#bib.bib15))。相关思想也出现在 LLM-as-a-judge 设置中的分布对齐中(Chen et al., 2025 (https://arxiv.org/html/2605.11845#bib.bib3)),最接近我们设置的是 Zhang et al. (2024 (https://arxiv.org/html/2605.11845#bib.bib30)) 使用序列级目标微调语言模型以在有效输出上产生扩散分布。我们在这一方向上进行了扩展,将分布微调扩展到更广泛的概率分布家族,比较了采样补全和前缀树衍生的 token 级监督,并评估了向自然语言随机行为的迁移以及能力保留。
#### 多样性、创造性和认识论广度。
我们的迁移评估与生成模型中关于多样性、创造性和认识论广度的文献有关(Mohammadi, 2024 (https://arxiv.org/html/2605.11845#bib.bib19); Doshi and Hauser, 2024 (https://arxiv.org/html/2605.11845#bib.bib4); Holzner et al., 2025 (https://arxiv.org/html/2605.11845#bib.bib8); Luo et al., 2026 (https://arxiv.org/html/2605.11845#bib.bib16); Wright et al., 2025 (https://arxiv.org/html/2605.11845#bib.bib26); Zhang et al., 2025 (https://arxiv.org/html/2605.11845#bib.bib31))。我们并不旨在直接解决这些更广泛的问题。相反,我们将它们用作下游压力测试:如果校准微调教会了更忠实的随机能力,那么这种行为应该部分迁移到数学分布提示之外,进入更自然的随机生成设置。
## 3 校准微调
**图 1** (https://arxiv.org/html/2605.11845#S1.F1) 总结了校准微调。两种变体都始于相同的合成采样提示和相同的规范输出空间上的诱导离散目标,但在监督上有所不同:软目标微调匹配前缀树诱导的下一个 token 分布,而硬目标微调模仿来自同一离散目标的采样规范补全。
#### 任务设置。
我们在如下形式的提示上进行训练:
> 从具有参数 \[params\] 的 \[分布\] 分布中生成**恰好一个**随机数。**仅**输出该数字。
当适用时,此请求包裹在模型的原生聊天模板中;对于具有推理能力的模型(如 Qwen3 和 GPT-OSS),我们也禁用推理轨迹,以便训练仅针对采样的数值输出。
每个提示指定一个分布家族和参数,在实数或整数上诱导目标概率定律 $P$。为了使监督可行,我们将该定律离散化为有限规范输出空间 $Y=\{y_1, \dots, y_M\}$ 的有效数值字符串,以及由此在 $Y$ 上诱导的离散分布 $P_Y$。对于整数值家族,$Y$ 是有限支撑集(如果可用),否则是量化截断的支撑集。对于连续家族,我们在固定小数精度下对量化有界区间进行量化;当结果的小数网格超过输出空间上限时,我们保留均匀间隔的网格点,计算相邻中点之间 CDF 差异的二项质量,并将区间外的尾部质量分配给边缘二项式。
在最终训练运行中,两种方法都使用五位小数的规范输出;软目标微调将 $Y$ 限制在 1001 个二项式,而硬目标微调使用 16384 个二项式,遵循附录 E (https://arxiv.org/html/2605.11845#A5) 中的消融实验。
#### 软目标微调。
对于每个规范输出 $y_i \in Y$,我们取其诱导质量 $P_Y(y_i)$,对其进行分词,附加 EOS,并将生成的 token 序列插入前缀树中。对于给定的前缀树前缀 $p$(部分 token 序列),我们在所有与 $p$ 一致的延续上归一化剩余质量,以获得有效下一个 token 的目标分布:
$$
q(v \mid p) = \frac{\sum_{i: \, t_i \text{ extends }(p,v)} P_Y(y_i)}{\sum_{j: \, t_j \text{ extends }p} P_Y(y_j)}. \quad (1)
$$
令 $\pi_\theta(v \mid p) := \mathrm{softmax}(\mathbf{z}_p/\tau)_v$ 表示模型在前缀 $p$ 处的下一个 token 分布。我们通过最小化以下损失,训练模型在每个访问的前缀处匹配前缀树衍生的目标 $q(\cdot \mid p)$:
$$
\ell(p) = \mathrm{KL}\!\bigl(q(\cdot \mid p) \; \big\| \; \pi_\theta(\cdot \mid p) \bigr) = \sum_{v \in \mathcal{V}(p)} q(v \mid p) \, \log \frac{q(v \mid p)}{\pi_\theta(v \mid p)}, \quad (2)
$$
其中 $\mathcal{V}(p)$ 是 $p$ 处的前缀树子节点集合。为了形成训练损失,我们采样规范输出 $y \sim P_Y$,将其分词为 $\mathbf{t}=\mathrm{Tok}(y) \circ \mathrm{eos}=(t_1, \dots, t_L, \mathrm{eos})$,并沿此采样路径平均前缀损失:
$$
\mathcal{L}_{\mathrm{soft}} = \frac{1}{L+1} \sum_{k=0}^L \ell\bigl((t_1, \dots, t_k)\bigr). \quad (3)
$$
#### 硬目标微调。
软目标提供了密集的分布监督,但它需要为每个前缀树前缀构建下一个 token 目标。因此,我们还研究了第二种更接近标准监督微调的策略:模型能否从目标分布采样的补全中学习相同的采样行为?硬目标变体用来自采样补全的监督替换前缀级软监督。对于每个实例,我们绘制 $y \sim P_Y$,形成 $\mathbf{t}=\mathrm{Tok}(y) \circ \mathrm{eos}$,并在连接的提示-补全序列上优化掩码自回归交叉熵:
$$
\mathcal{L}_{\mathrm{hard}} = \frac{1}{\|\mathbf{t}\|} \sum_{k=1}^{\|\mathbf{t}\|} -\log \pi_\theta(t_k \mid x, t_{<k})
$$
提示格式为:
> 从具有参数 \[params\] 的 \[Distribution\] 分布中生成**恰好一个**随机数。**仅**输出该数字。
`\[Distribution\]` 字段来自表 5 (https://arxiv.org/html/2605.11845#A2.T5) 中的显示名称,`\[params\]` 以对应分布家族使用的规范参数化中的逗号分隔键值对呈现。当适用时,提示包裹在模型的原生聊天模板中;对于具有推理能力的模...相似文章
CALIBER:语言模型中推理前后的置信度校准
本文介绍了CALIBER,一种通过获取推理前后的置信度估计并匹配信息状态的监督目标来校准推理语言模型置信度的方法。它在多个基准测试上显著降低了期望校准误差(最多52.5%),并取得了强劲的Brier分数和AUROC。
大型语言模型中的稳定校准错误:高置信度错误的实用视角
本文探讨大型语言模型中的稳定校准错误现象,即高置信度错误在微小扰动下局部保持稳定。通过审计分数和探测等诊断方法评估校准程度和内部敏感性。
校准与决策:重新审视未学习语言模型中的可靠性悖论
本文重新审视了语言模型机器遗忘背景下的可靠性悖论,证明模型在依赖基于捷径的决策规则的同时能够实现较低的校准误差,从而将该悖论扩展至未学习模型。
大语言模型不确定性中的人类对齐、校准与激活模式
本文研究大语言模型的不确定性与人类不确定性的相似程度,探讨LLMs在多个数据集上的对齐、校准和激活模式,以及指令微调的影响。
大型语言模型中的置信度校准
本文分析了11个主流大型语言模型的置信度校准情况,发现它们普遍过于自信,尤其在困难任务上,而在简单任务上则信心不足。文章引入了LifeEval,这是一个用于评估不同难度级别下校准效果的测试。