基于标签偏移调整贝叶斯分数的分裂保形预测
摘要
本文提出用于标签偏移下保形预测的标签偏移调整贝叶斯分数,在分子性质预测中展示了更短的预测区间同时保持覆盖率。
arXiv:2609.12386v1 Announce Type: new
摘要:保形预测在可交换性下提供无分布的不确定性量化。然而,这一假设被标签偏移所违反,其中标签的边缘分布发生变化,而给定标签的输入条件分布保持稳定。在这种偏移下,标准保形程序不再保持其预期的覆盖率行为。现有方法通过重要性加权来解决这个问题。它们将重新加权与基于残差的非一致性分数配对,忽略了预测不确定性。生成的区间具有均匀宽度。贝叶斯保形方法通过利用预测分布产生自适应区间。它们在源预测下评估一致性,而在标签偏移下,源预测与目标域不匹配。我们提出\emph{标签偏移调整贝叶斯分数}(LSA分数),一种从后验预测倾斜恒等式导出的非一致性分数。该恒等式表明目标预测是源预测的重要性加权变换。我们用它来推导对贝叶斯分数的直接修正。我们在受控标签偏移下对分子性质预测评估该方法。LSA分数始终产生比基于残差和基于源的贝叶斯分数更短的区间。目标域中的覆盖率保持可比。在更强的偏移下,所有方法由于基于伪标签的密度比估计而遭受一些覆盖率损失。LSA分数定义为任何具有可处理对数密度的源预测。我们用贝叶斯岭回归实例化它,其中修正具有闭合形式。
查看缓存全文
缓存时间: 2026/09/14 08:43
# 1 引言
来源:https://arxiv.org/html/2609.12386
已更改 marginparsep。已更改 topmargin。已更改 marginparpush。页面布局违反了 ICML 样式。请勿更改页面布局,或包含会为您更改布局的软件包,如 geometry、savetrees 或 fullpage。我们无法可靠地撤销对样式的任意更改。请移除违规的软件包或更改布局的命令,然后重试。
**基于标签偏移调整的贝叶斯得分的分裂保形预测**
Hyeonsu Lee\*1 Juyeon Kim\*1 Erkhembayar Jadamba\*1 Seungjin Choi2 Hyunjin Shin1
††脚注文本:\*同等贡献
1 MOGAM 生物医学研究所,韩国
2 CROID 研究与 aSSIST 大学,韩国。通讯作者:Hyunjin Shin。
第二届机器学习中的认知智能研讨会(EIML@ICML 2026),韩国首尔。
版权所有 2026,归作者所有。
###### 摘要
保形预测在可交换性假设下提供了免分布的不确定性量化。然而,这种假设在标签偏移下被违反,即标签的边缘分布发生变化,而给定标签的输入条件分布保持稳定。在此类偏移下,标准的保形过程不再保持其预期的覆盖行为。现有方法通过重要性加权来解决这一问题。它们将重新加权与忽略预测不确定性的基于残基的非相似性得分配对。由此产生的区间具有均匀宽度。贝叶斯保形方法通过利用预测分布产生自适应区间。它们在源预测下评估相似性,这在标签偏移下与目标域不匹配。我们提出了*标签偏移调整贝叶斯得分*(LSA得分),这是一种从后验预测倾斜恒等式推导出的非相似性得分。该恒等式表明目标预测是源预测的重要性加权变换。我们用它来直接推导对贝叶斯得分的修正。我们在受控标签偏移下的分子性质预测中评估了该方法。LSA得分持续产生比基于残基和基于源的贝叶斯得分更短的区间。目标域中的覆盖范围仍然相当。在更强的偏移下,所有方法由于基于伪标签的密度比率估计而遭受一些覆盖损失。LSA得分定义为任何具有可处理对数密度的源预测。我们使用贝叶斯岭回归实例化它,其中修正允许闭式形式。
## 1 引言
保形预测(CP)在可交换性假设下构建具有有限样本覆盖保证的预测区间(Vovk 等人,2005 (https://arxiv.org/html/2609.12386#bib.bib28);Shafer 和 Vovk,2008 (https://arxiv.org/html/2609.12386#bib.bib20);Angelopoulos 和 Bates,2023 (https://arxiv.org/html/2609.12386#bib.bib1))。这一特性使其在分子性质预测等应用中具有吸引力(Laghuvarapu 等人,2023 (https://arxiv.org/html/2609.12386#bib.bib13))。然而在实践中,可交换性假设经常被*标签偏移*违反(Saerens 等人,2002 (https://arxiv.org/html/2609.12386#bib.bib19))。在标签偏移下,边缘标签分布发生变化,而给定标签的输入条件分布保持相同。这在科学环境中很自然地发生,当注意力转向罕见或极端的属性值时。它导致标准保形方法失去其覆盖保证。
在标签偏移下,一个好的预测区间必须同时满足两个性质。首先,非相似性得分必须与目标分布*对齐*,以便加权分位数产生有效的覆盖。其次,该得分必须对预测不确定性具有*自适应性*,以便区间宽度反映局部难度。先前的工作分别处理这两个性质。
重要性加权方法针对第一个性质。Tibshirani 等人(Tibshirani 等人,2019 (https://arxiv.org/html/2609.12386#bib.bib26))引入了加权分位数以在协变量偏移下恢复覆盖。Barber 等人(Barber 等人,2023 (https://arxiv.org/html/2609.12386#bib.bib2))将此想法推广到一个更广泛的框架,以处理任意违反可交换性的情况。Podkopaev 和 Ramdas(Podkopaev 和 Ramdas,2021 (https://arxiv.org/html/2609.12386#bib.bib16))以及 Si 等人(Si 等人,2024 (https://arxiv.org/html/2609.12386#bib.bib22))将加权方法扩展到专门的标签偏移。Lee 等人(Lee 等人,2025 (https://arxiv.org/html/2609.12386#bib.bib14))将其应用于分子性质预测。Gibbs 和 Candès(Gibbs 和 Candes,2021 (https://arxiv.org/html/2609.12386#bib.bib8))提出了在线阈值调整以随时间跟踪分布漂移。这些方法重新加权校准样本以匹配目标边缘分布。它们恢复了覆盖。然而,与重新加权配对的非相似性得分是基于残差的。它们仅依赖于点预测。由此产生的区间具有均匀的宽度,无论局部难度如何。第二个性质未得到解决。
自适应得分方法针对第二个性质。Romano 等人(Romano 等人,2019 (https://arxiv.org/html/2609.12386#bib.bib17))提出了保形化分位数回归(CQR),它在可交换性下产生宽度随输入难度变化的区间。Fong 和 Holmes(Fong 和 Holmes,2021 (https://arxiv.org/html/2609.12386#bib.bib7))使用贝叶斯后验预测作为非相似性得分。由此产生的区间反映了模型不确定性。Bhagwat 等人(Bhagwat 等人,2025 (https://arxiv.org/html/2609.12386#bib.bib3))通过贝叶斯模型平均扩展了这一想法。Datta 等人(Datta 等人,2025 (https://arxiv.org/html/2609.12386#bib.bib5))和 Deliu 与 Liseo(Deliu 和 Liseo,2025 (https://arxiv.org/html/2609.12386#bib.bib6))最近的理论工作进一步阐明了保形预测与贝叶斯推断之间的关系。这些方法产生不同宽度的区间。然而,它们在源预测分布下评估相似性。在标签偏移下,源预测与目标域不匹配。这种不匹配扭曲了加权得分分布。校准分位数被夸大,区间变得不必要地宽,正如我们在第 3.3 节 (https://arxiv.org/html/2609.12386#S3.SS3) 中经验验证的那样。第一个性质被违反。
目前没有非相似性得分能同时满足这两个性质。我们通过引入标签偏移调整贝叶斯(LSA)得分来解决这一差距。我们的出发点是一个后验预测倾斜恒等式(命题 2.1 (https://arxiv.org/html/2609.12386#S2.Thmproposition1))。在标签偏移下,目标预测是源预测的重要性加权变换。该恒等式的负对数密度产生了一个得分分解,直接启发了对源贝叶斯得分的修正。我们使用贝叶斯岭回归(BRR)实例化该得分。修正允许闭式预测区间,无需额外的计算成本。我们在受控标签偏移下的分子性质预测中评估该方法。LSA得分产生比残差和源得分基线更短的预测区间。目标域覆盖范围仍然相当。该方法依赖于基于伪标签的密度比率估计,因此我们不声称在偏移下具有精确的有限样本有效性。我们转而分析第 3.3 节 (https://arxiv.org/html/2609.12386#S3.SS3) 中的实际加权分位数作为对神谕程序的近似。
## 2 方法
### 2.1 问题设定
令 $\bm{h} \in \mathbb{R}^d$ 表示输入的特征表示,令 $y \in \mathbb{R}$ 为标量目标变量。在我们的实验中,$\bm{h}$ 是由预训练编码器提取的分子表示(其权重是固定的),而 $y$ 是分子性质,例如水溶性($\log S$,单位为 $\log \mathrm{mol/L}$)。
数据被划分为四个不相交的集合。*训练集* $\mathcal{D}_{\mathrm{train}} = \{(\bm{h}_i, y_i)\}_{i=1}^{n_{\mathrm{tr}}}$、*权重估计集* $\mathcal{D}_{\mathrm{weight}} = \{(\bm{h}_i, y_i)\}_{i=1}^{n_{\mathrm{w}}}$ 和 *校准集* $\mathcal{D}_{\mathrm{cal}} = \{(\bm{h}_i, y_i)\}_{i=1}^{n}$ 来自源分布 $p_{\mathrm{s}}$。*目标集* $\mathcal{D}_{\mathrm{test}} = \{\bm{h}_j\}_{j=1}^{m}$ 在测试时观察但没有标签,来自一个偏移的分布 $p_{\mathrm{t}}$。
我们通过单参数指数倾斜建模标签偏移:
$p_{\mathrm{t}}(y) \propto p_{\mathrm{s}}(y) \exp(\beta y)$,
$r(y) := \frac{p_{\mathrm{t}}(y)}{p_{\mathrm{s}}(y)} = \frac{\exp(\beta y)}{Z_r}$,
$Z_r := \int p_{\mathrm{s}}(y) \exp(\beta y) \mathrm{d}y$,
(1)
其中 $\beta \in \mathbb{R}$ 控制偏移的方向和大小。$Z_r$ 是归一化常数。一般的标签偏移仅要求 $p_{\mathrm{t}}(y) \neq p_{\mathrm{s}}(y)$。我们采用指数倾斜作为可处理的参数模型,因为它产生对数线性的密度比率,这在 Gaussian 预测下允许闭式修正(第 2.3 节 (https://arxiv.org/html/2609.12386#S2.SS3))。由于特征提取器是确定性的,标签偏移假设也传递到表示层面。即 $p_{\mathrm{s}}(\bm{h} \mid y) = p_{\mathrm{t}}(\bm{h} \mid y)$。
我们的目标是构建预测区间 $C(\bm{h}) = [L(\bm{h}), \, U(\bm{h})]$,使其目标域边缘覆盖 $\mathbb{P}_{(\bm{h},y) \sim p_{\mathrm{t}}}(y \in C(\bm{h}))$ 接近 $1 - \alpha_{\mathrm{cp}}$。因为我们的实现依赖于从伪标签获得的估计密度比率,所以我们不声称在偏移下具有精确的有限样本有效性。
### 2.2 后验预测倾斜
在标签偏移下,源预测 $p_{\mathrm{s}}(y \mid \bm{h}, \mathcal{D}_{\mathrm{train}})$ 不再与目标域对齐。一个自然的问题是目标后验预测是否可以在不重新训练的情况下从源预测中恢复。我们证明这是可以的,通过一个简单的重要性加权恒等式。以下假设形式化了所需条件。
###### 假设 2.1(表示后的条件标签偏移)。
对于所有 $\bm{h} \in \mathcal{H}$ 和 $y \in \mathcal{Y}$,
$p_{\mathrm{s}}(\bm{h} \mid y) = p_{\mathrm{t}}(\bm{h} \mid y)$。
我们进一步假设在源模型拟合后相应的预测级不变性:
$p_{\mathrm{s}}(\bm{h} \mid y, \mathcal{D}_{\mathrm{train}}) = p_{\mathrm{t}}(\bm{h} \mid y, \mathcal{D}_{\mathrm{train}})$。
###### 假设 2.2(绝对连续性)。
在 $p_{\mathrm{t}}(y) > 0$ 处 $p_{\mathrm{s}}(y) > 0$,使得 $r(y) = p_{\mathrm{t}}(y) / p_{\mathrm{s}}(y)$ 定义良好。
###### 假设 2.3(源代表性)。
源预测模型被正确指定且后验集中,使得 $p_{\mathrm{s}}(y \mid \mathcal{D}_{\mathrm{train}}) = p_{\mathrm{s}}(y)$。
这是一个温和的条件,只要训练样本足够大就能满足。
###### 命题 2.1(后验预测倾斜)。
在假设 2.1 (https://arxiv.org/html/2609.12386#S2.Thmassumption1)、假设 2.2 (https://arxiv.org/html/2609.12386#S2.Thmassumption2) 和假设 2.3 (https://arxiv.org/html/2609.12386#S2.Thmassumption3) 下,并且以拟合的源数据 $\mathcal{D}_{\mathrm{train}}$ 为条件,目标后验预测允许表示为
$p_{\mathrm{t}}(y \mid \bm{h}, \mathcal{D}_{\mathrm{train}}) = \frac{p_{\mathrm{s}}(y \mid \bm{h}, \mathcal{D}_{\mathrm{train}}) \, r(y)}{Z(\bm{h}, \mathcal{D}_{\mathrm{train}})}$,
(2)
其中 $Z(\bm{h}, \mathcal{D}_{\mathrm{train}}) := \int p_{\mathrm{s}}(y^{\prime} \mid \bm{h}, \mathcal{D}_{\mathrm{train}}) \, r(y^{\prime}) \, dy^{\prime} = \mathbb{E}_{Y \sim p_{\mathrm{s}}(\cdot \mid \bm{h}, \mathcal{D}_{\mathrm{train}})}[r(Y)]$。
(3)
推导在附录 B (https://arxiv.org/html/2609.12386#A2) 中给出。它在以 $\mathcal{D}_{\mathrm{train}}$ 为条件的预测分布下应用贝叶斯规则。它使用假设 2.1 (https://arxiv.org/html/2609.12386#S2.Thmassumption1) 将目标条件机制替换为其源对应物。然后通过假设 2.3 (https://arxiv.org/html/2609.12386#S2.Thmassumption3) 识别边缘比率。由于 $\mathcal{D}_{\mathrm{train}}$ 完全来自源域,它不携带关于目标标签边缘分布的信息,因此 $p_{\mathrm{t}}(y \mid \mathcal{D}_{\mathrm{train}}) = p_{\mathrm{t}}(y)$。结合假设 2.3 (https://arxiv.org/html/2609.12386#S2.Thmassumption3),条件边缘比率简化为总体密度比率 $r(y) = p_{\mathrm{t}}(y) / p_{\mathrm{s}}(y)$。
该恒等式对非相似性评分有直接的影响。在源预测下使用 $s(\bm{h}, y) = -\log p(y \mid \bm{h}, \mathcal{D}_{\mathrm{train}})$ 产生与目标域不匹配的得分。命题 2.1 (https://arxiv.org/html/2609.12386#S2.Thmproposition1) 表明正确对齐的得分使用 $p_{\mathrm{t}}$ 而不是 $p_{\mathrm{s}}$。对公式 (2) (https://arxiv.org/html/2609.12386#S2.E2) 取负对数得到
$-\log p_{\mathrm{t}}(y \mid \bm{h}, \mathcal{D}_{\mathrm{train}}) = \underbrace{-\log p_{\mathrm{s}}(y \mid \bm{h}, \mathcal{D}_{\mathrm{train}})}_{\text{源得分}} + \underbrace{(-\log r(y))}_{\text{偏移修正}} + \underbrace{\log Z(\bm{h}, \mathcal{D}_{\mathrm{train}})}_{\text{归一化}}$.
(4)
定义神谕非相似性得分为 $s_{\mathrm{t}}(\bm{h}, y) := -\log p_{\mathrm{t}}(y \mid \bm{h}, \mathcal{D}_{\mathrm{train}})$。水平集 $\{y: s_{\mathrm{t}}(\bm{h}, y) \leq q\}$ 恰好与目标预测在水平 $e^{-q}$ 处的最高密度区域一致。这个分解启发了我们的实际得分构建。
### 2.3 标签偏移调整贝叶斯得分
在公式 (4) (https://arxiv.org/html/2609.12386#S2.E4) 的指导下,我们首先估计密度比率 $r(y)$。标签偏移估计已被广泛研究(Lipton 等人,2相似文章
面向视觉与语言模型的经验贝叶斯共形预测
本文介绍了一种经验贝叶斯共形预测框架,该框架使用 r 值将评分变异性纳入非一致性得分中,从而提升排序稳定性并缩减集合大小,同时保持对视觉与语言模型的覆盖。
基于排序概率分数的有序分类可靠共形预测
介绍了一种有序分类的共形预测方法,该方法使用排序概率分数作为非一致性函数,生成以中位数为中心的连续预测集,并在预测集宽度与有序错误覆盖之间实现了有利平衡。
超越表面统计:通过内部表示实现LLM鲁棒共形预测
本论文提出了一个利用内部表示而非输出层统计的LLM共形预测框架,引入层级信息(LI)评分作为非一致性度量,在分布偏移下改进有效性-效率权衡。该方法在QA基准上相比文本级基线展现出更强的对校准-部署不匹配的鲁棒性。
SHIFT:基于不完整和异质性基因组数据的生存预测
SHIFT是一种缺失感知的生存模型,利用掩码自注意力机制在不进行测试时插补的情况下从不完整基因组输入进行预测,在胶质母细胞瘤和肺鳞状细胞癌的多个队列中表现出强大的泛化能力。
校准虚拟筛选中的无声失败:边际共形预测对少数类覆盖不足,类条件修复方案恢复覆盖
本文揭示了标准边际共形预测在不平衡虚拟筛选数据集中无法覆盖少数类,并展示了类条件(Mondrian)共形预测如何恢复每类覆盖。