Conf-Gen: 面向生成模型的共形不确定性量化

arXiv cs.LG 论文

摘要

介绍Conf-Gen,一个将共形风险控制适配到生成模型的框架,为大语言模型、图像生成器和AI智能体提供形式化的不确定性保证。

arXiv:2605.28920v1 公告类型:新 摘要:共形预测(CP)及其扩展——共形风险控制(CRC)是通过形式化保证在监督机器学习中量化不确定性的成熟框架。然而,近期人工智能(AI)的突破主要由无监督生成模型驱动,例如大语言模型(LLMs)和图像生成器,这些模型与CP或CRC并不直接兼容。在这项工作中,我们引入了共形生成(Conf-Gen),一个将CRC适配到生成任务并放宽其理论假设的通用框架。Conf-Gen统一并泛化了先前将CP应用于LLMs的尝试,并将共形方法论扩展到全新的领域。我们通过一些新颖的应用展示了Conf-Gen的灵活性,包括在以下方面获得共形保证:生成非记忆化图像的图像生成器、提出足够澄清问题的对话式AI系统,以及AI智能体输出正确的结果。
查看原文
查看缓存全文

缓存时间: 2026/05/29 09:13

# Conf-Gen:生成式模型的共形不确定性量化 来源:https://arxiv.org/html/2605.28920 ###### 摘要 共形预测(CP)及其扩展——共形风险控制(CRC),是通过形式化保证量化监督式机器学习中不确定性的成熟框架。然而,近年来人工智能(AI)的重大突破主要由无监督生成式模型驱动,例如大型语言模型(LLM)和图像生成器,这些模型无法直接与CP或CRC兼容。在这项工作中,我们引入了*共形生成*(Conf-Gen),一个将CRC适配到生成式任务同时放宽其理论假设的通用框架。Conf-Gen统一并泛化了先前将CP应用于LLM的尝试,并将共形方法论扩展到全新的领域。我们通过一些新颖的应用展示了Conf-Gen的灵活性,包括在以下方面获得共形保证:生成非记忆化图像的图像生成器、提出足够澄清问题的对话式AI系统,以及AI代理输出的正确性。 生成式模型,不确定性量化,共形方法 ## 第1节 引言 近年来,人工智能(AI)取得了显著的经验突破,从大型语言模型(LLMs;Brown et al., 2020 (https://arxiv.org/html/2605.28920#bib.bib8); OpenAI, 2024 (https://arxiv.org/html/2605.28920#bib.bib33))的出现,到逼真的图像生成器(Ramesh et al., 2022 (https://arxiv.org/html/2605.28920#bib.bib41); Rombach et al., 2022 (https://arxiv.org/html/2605.28920#bib.bib43))、代理系统(Park et al., 2023 (https://arxiv.org/html/2605.28920#bib.bib36))等(Silver et al., 2016 (https://arxiv.org/html/2605.28920#bib.bib47); Potapenko et al., 2021 (https://arxiv.org/html/2605.28920#bib.bib38))。这些发展大多已远离监督式学习,转而利用生成式模型。尽管取得了这些进展,不确定性量化(UQ)仍然是AI中的关键挑战,特别是对于生成式模型,从而阻碍了它们在医疗保健(Begoli et al., 2019 (https://arxiv.org/html/2605.28920#bib.bib6))和科学发现(Wang et al., 2023a (https://arxiv.org/html/2605.28920#bib.bib55))等高风险应用中的部署。 共形预测(CP;Gammerman et al., 1998 (https://arxiv.org/html/2605.28920#bib.bib12); Vovk et al., 1999 (https://arxiv.org/html/2605.28920#bib.bib53); Saunders et al., 1999 (https://arxiv.org/html/2605.28920#bib.bib46); Gammerman & Vovk, 2007 (https://arxiv.org/html/2605.28920#bib.bib11))是监督式学习中UQ的一种原则性方法。CP通过使用特征 \(X\) 构建一个预测集 \(\mathcal{C}(X)\) 来量化不确定性,该集合保证以用户指定的概率包含真实值 \(Y_{\text{GT}}\)。共形风险控制(CRC;Angelopoulos et al., 2024b (https://arxiv.org/html/2605.28920#bib.bib4))通过下界约束一个更一般的效用函数 \(U(\mathcal{C}(X), Y_{\text{GT}})\) 的期望来扩展CP,其中CP是一个特例。由于共形保证是无分布的,它们作为能够处理生成式模型所表示的复杂分布的UQ方法尤其有吸引力。然而,尽管其通用性,CRC并不能直接适用于生成式任务。因此,在生成式模型背景下利用共形思想的工作往往高度特定于任务。 参考图注 图1:我们方法的简化说明。选择函数 \(\mathbf{C}_\lambda(x, \mathbf{y})\) 处理输入 \(x\) 和生成序列 \(\mathbf{y}\),并产生一个输出,该输出随着 \(\lambda\) 的增加而变得越来越保守。Conf-Gen 确定一个值 \(\hat{\lambda}\),该值形式上保证 \(\mathbf{C}_{\hat{\lambda}}\) 的输出在期望上满足目标*可接受性*要求。顶部:当 \(\mathbf{y}\) 由对查询 \(x\) 的*i.i.d.*响应组成时,可接受性确保输出包含至少一个正确答案。底部:当 \(\mathbf{y}\) 中的图像是通过逐步修改提示 \(x\) 生成时,可接受性确保输出的图像没有被记忆。 在这项工作中,我们做出以下贡献: 1. \(a\) 框架。我们提出*共形生成*(Conf-Gen,如图1 (https://arxiv.org/html/2605.28920#S1.F1) 所示),这是一个扩展CRC以用于生成式建模中严格UQ的框架。Conf-Gen 可以应用于集合之外的结构,例如序列,并形式上约束所选结构的期望可接受性(生成式任务中 \(U\) 的类似物)。我们表明,现有的任务特定共形方法可以作为Conf-Gen的特例被恢复。 2. \(b\) 理论。Conf-Gen 放宽了CRC的理论假设。最重要的是,我们弱化了一个单调性假设,并推导出一个更一般的反向(上界)约束,适用于期望效用/可接受性。 3. \(c\) Python 包。天真地执行Conf-Gen所需的计算有时是棘手的。我们识别出Conf-Gen组件设计空间中的模式,这些模式支持高效计算,并提供了一个灵活的Python包 (https://github.com/layer6ai-labs/conf-gen),支持Conf-Gen应用的完整范围。 4. \(d\) 实证验证。我们证明Conf-Gen在LLM问答中优于最先进的共形基线,并在各种新颖任务中展示其多功能性。具体来说,我们展示了以下方面的共形保证:生成非记忆化图像;确保对话型LLM提出了足够多的澄清问题;产生一个包含正确解决方案的代理AI输出序列;以及从随机森林(Breiman, 2001 (https://arxiv.org/html/2605.28920#bib.bib7))中选择一个包含足够多做出正确预测的树的子集。 ## 第2节 共形预测与风险控制 分裂共形预测。我们简要总结与Conf-Gen相关的CP关键概念;如需更全面的介绍,我们请读者参考Vovk et al. (2005 (https://arxiv.org/html/2605.28920#bib.bib54))、Angelopoulos & Bates (2021 (https://arxiv.org/html/2605.28920#bib.bib2)) 和 Angelopoulos et al. (2024a (https://arxiv.org/html/2605.28920#bib.bib3))。我们专注于分裂共形预测(Papadopoulos et al., 2002 (https://arxiv.org/html/2605.28920#bib.bib35)),这是CP的一个特定实例;此后,我们将使用缩写CP指代分裂共形预测。 在CP中,我们假设可以访问一个校准数据集,其中包含特征 \(X^{(i)} \in \mathcal{X}\) 及其对应的真实目标 \(Y_{\text{GT}}^{(i)} \in \mathcal{Y}_{\text{GT}}\),对于 \(i=1,\dots,n\)。然后,给定一个新的 \(X^{(n+1)}\),CP的目标是使用校准数据集产生一个集合 \(\mathcal{C}(X^{(n+1)}) \subseteq \mathcal{Y}_{\text{GT}}\),该集合以至少 \(\gamma\) 的概率包含 \(Y_{\text{GT}}^{(n+1)}\),其中 \(\gamma\) 是用户指定的量。为了实现这一目标,CP使用一个评分函数 \(S^\downarrow: \mathcal{X} \times \mathcal{Y}_{\text{GT}} \rightarrow \mathbb{R}\),\(S^\downarrow(x,y)\) 的大值表示对 \(y\) 与 \(x\) 兼容的信心低。例如,在分类设置中,我们可以有 \(S^\downarrow(x,y) = 1 - S^\uparrow(x,y)\),其中 \(S^\uparrow(x,y)\) 是预训练分类器在给定 \(x\) 作为输入时分配给 \(y\) 的概率。对于给定的 \(\lambda \in \mathbb{R}\),CP考虑的集合形式为: \[ \mathcal{C}_\lambda(x) \coloneqq \{ y \in \mathcal{Y}_{\text{GT}} : S^\downarrow(x,y) \leq \lambda \}. \tag{1} \] CP 通过将 \(\hat{\lambda}\) 设置为 \(S^\downarrow(X^{(1)}, Y_{\text{GT}}^{(1)}), \dots, S^\downarrow(X^{(n)}, Y_{\text{GT}}^{(n)})\) 的 \(\frac{\lceil (n+1)\gamma \rceil}{n}\) 分位数来执行*校准*。那么,\(\mathcal{C}_{\hat{\lambda}}(X^{(n+1)})\) 满足CP期望条件: ###### 定理1 (Vovk et al. (1999 (https://arxiv.org/html/2605.28920#bib.bib53)))。假设 \((X^{(1)}, Y_{\text{GT}}^{(1)}), \dots, (X^{(n+1)}, Y_{\text{GT}}^{(n+1)})\) 是可交换的。那么,对于如上定义的 \(\mathcal{C}_\lambda\) 和 \(\hat{\lambda}\): \[ \mathbb{P}\left(Y_{\text{GT}}^{(n+1)} \in \mathcal{C}_{\hat{\lambda}}\left(X^{(n+1)}\right)\right) \geq \gamma. \tag{2} \] 回忆随机变量 \(Z^{(1)}, \dots, Z^{(n+1)}\) 是*可交换*的,如果它们的联合分布在任何索引排列下保持不变。可交换性是一个非常灵活的假设,因为它严格弱于*i.i.d.*要求。关于定理1 (https://arxiv.org/html/2605.28920#Thmtheorem1) 有两点值得说明。首先,注意方程2 (https://arxiv.org/html/2605.28920#S2.E2) 中的概率是针对其内部的所有随机量取的,包括校准数据集本身(\(\hat{\lambda}\) 依赖于它)。其次,尽管方程2 (https://arxiv.org/html/2605.28920#S2.E2) 中的共形保证无论底层数据生成分布和 \(S^\downarrow\) 的选择如何都成立,但CP的实际有用性确实依赖于 \(S^\downarrow\);例如,\(S^\downarrow\) 的选择不佳可能导致 \(\mathcal{C}_{\hat{\lambda}}(X^{(n+1)}) = \mathcal{Y}_{\text{GT}}\),这将使得共形保证变为空洞正确。 共形风险控制 (CRC)。Angelopoulos et al. (2024b (https://arxiv.org/html/2605.28920#bib.bib4)) 将CP扩展到一个更一般的设置,即不控制覆盖度,而是控制一个任意效用函数的期望值。222CRC通常被表述为约束损失函数的上界。下界约束效用函数是等价的,并将有助于与我们的方法进行比较。令 \(\mathcal{C}_\lambda: \mathcal{X} \rightarrow 2^{\mathcal{Y}_{\text{GT}}}\) 是一个由 \(\lambda \in \Lambda \coloneqq [\lambda_{\text{min}}, \lambda_{\text{max}}]\) 索引的函数族,产生预测集,并令 \(U: 2^{\mathcal{Y}_{\text{GT}}} \times \mathcal{Y}_{\text{GT}} \rightarrow [0, \infty]\) 是预测集上的效用函数。直观上,\(\lambda\) 值越大应导致更保守的预测集,即实现更高效用的集合。CRC通过找到最小的 \(\lambda\) 使得校准集上的平均效用超过 \(\frac{n+1}{n}\gamma\) 来执行校准。形式上, \[ \hat{\lambda} = \inf \left\{ \lambda \in \Lambda : \bar{U}_n(\lambda) \geq \dfrac{n+1}{n}\gamma \right\} \wedge \lambda_{\text{max}}, \tag{3} \] 其中 \(\bar{U}_n(\lambda) \coloneqq \frac{1}{n} \sum_{i=1}^n U^{(i)}(\lambda)\) 且 \(U^{(i)}(\lambda) \coloneqq U(\mathcal{C}_\lambda(X^{(i)}), Y_{\text{GT}}^{(i)})\)。222回忆 \(\wedge\) 和 \(\vee\) 分别表示两个数中的最小值和最大值,并且 \(\inf \emptyset = \infty\);方程3 (https://arxiv.org/html/2605.28920#S2.E3) 中的最小值处理这种情况。 在一些正则条件下,可以得出一个共形保证: ###### 定理2 (Angelopoulos et al. (2024b (https://arxiv.org/html/2605.28920#bib.bib4)))。假设函数 \(U^{(1)}, \dots, U^{(n+1)}\) 是可交换的,并且它们在 \(\Lambda\) 上几乎必然右连续且非递减。还假设 \(U^{(i)}(\lambda_{\max}) \geq \gamma\) 几乎必然成立。那么,对于方程3 (https://arxiv.org/html/2605.28920#S2.E3) 中定义的 \(\hat{\lambda}\),以下不等式成立: \[ \mathbb{E}\left[U^{(n+1)}(\hat{\lambda})\right] \geq \gamma. \tag{4} \] 注意,只要 \((X^{(1)}, Y_{\text{GT}}^{(1)}), \dots, (X^{(n+1)}, Y_{\text{GT}}^{(n+1)})\) 是可交换的,并且 \(U\) 和 \(\mathcal{C}_\lambda\) 要么是确定性的,要么独立于特征和真实变量,那么函数 \(U^{(1)}, \dots, U^{(n+1)}\) 就是可交换的。再次强调,方程4 (https://arxiv.org/html/2605.28920#S2.E4) 中的期望是对其内部所有随机量取的。 定理1 (https://arxiv.org/html/2605.28920#Thmtheorem1) 和定理2 (https://arxiv.org/html/2605.28920#Thmtheorem2) 中的下界分别代表了CP和CRC的基础保证。相应的量化结果集中过度覆盖程度的上界也存在;我们在附录A (https://arxiv.org/html/2605.28920#A1) 中总结了它们。注意,CRC 泛化了 CP;事实上,当 \(U(\mathcal{C}, y) = \mathbb{1}(y \in \mathcal{C})\) 时,方程4 (https://arxiv.org/html/2605.28920#S2.E4) 恢复了方程2 (https://arxiv.org/html/2605.28920#S2.E2)。 ## 第3节 共形生成 动机。本节的目标是以一种高度通用的方式将共形方法论扩展到生成式任务。我们首先指出现有CRC应用中的几个实际限制。首先,虽然定理2 (https://arxiv.org/html/2605.28920#Thmtheorem2) 没有明确地将 \(\mathcal{X}\) 限制为监督式学习问题的特征空间,但 Angelopoulos et al. (2024b (https://arxiv.org/html/2605.28920#bib.bib4)) 只关注这种设置。其次,\(\mathcal{C}_\lambda\) 总是输出集合,尽管这并不是保持可交换性的先决条件。第三,当前的实现假设 \(U\) 是一个可调用的函数,这排除了由例如人工评估等程序定义的效用。最后,要求 \(U^{(i)}\) 非递减对于某些生成式任务来说限制性过强。我们将看到 Conf-Gen 解决了所有这些限制。 符号。我们使用书法字体表示集合(例如 \(\mathcal{X}\) 和 \(\mathcal{Y}\)),并将有限 \(\mathcal{Y}\) 值序列的空间写为 \(\mathcal{Y}^*\),即 \(\mathcal{Y}^* \coloneqq \cup_{t=0}^\infty \mathcal{Y}^t\)。我们使用小写字母表示这些集合中的固定元素(例如 \(x \in \mathcal{X}\) 和 \(y \in \mathcal{Y}\)),大写字母表示随机变量(例如 \(X \in \mathcal{X}\) 和 \(Y \in \mathcal{Y}\)),并使用粗体表示元组和序列(例如,随机序列 \(\mathbf{Y} = (Y_1, \dots, Y_T) \in \mathcal{Y}^*\))。我们将序列 \(\mathbf{y}\) 的长度表示为 \(|\mathbf{y}|\),并将其由 \((y_1, \dots, y_t)\) 给出的子序列表示为 \(\mathbf{y}_{:t}\)。 设定。在 Conf-Gen 中,我们从某个分布 \(\mathbb{P}_{\mathbf{G}}\) 在 \(\mathcal{X} \times \mathcal{Y}^* \times \mathcal{Y}_{\text{GT}}\) 上观察样本 \(\mathbf{G} = (X, \mathbf{Y}, Y_{\text{GT}})\)。这里,\(X\) 对应一个条件变量或“输入”。

相似文章

GENERIC动力学的保结构不确定性量化

arXiv cs.LG

本文提出了结构保持认知神经网络(S-PENNs),这是一个针对具有硬架构约束的科学机器学习模型进行不确定性量化的框架,并实例化于GENERIC动力学,以确保热力学一致的轨迹输出和经过校准的预测区间,同时降低计算成本。

一致性模型

OpenAI Blog

OpenAI 推出一致性模型,这是一类新的生成模型,通过直接将噪声映射到数据,支持快速单步图像生成,同时支持多步采样和零次学习编辑任务(如图像修复和超分辨率)。该方法在 CIFAR-10 和 ImageNet 64x64 上的单步生成中实现了最先进的 FID 分数。

几何感知的神经算子事后不确定性量化

arXiv cs.LG

提出REEF-GP,一种事后不确定性量化框架,通过将高斯过程拟合到冻结神经算子的残差上并利用其内部嵌入,以低成本实现几何感知且校准的不确定性。