ELVAE:基于证据学习的变分自编码器用于不确定性感知生成

arXiv cs.LG 论文

摘要

介绍了ELVAE,一种采用证据学习的VAE,通过正态-逆伽马后验对潜在坐标进行建模,以获得显式的不确定性估计。在MNIST上的实验表明,类内不确定性排序可以对合成样本的可靠性和压力测试进行分层,但结果需要按类别归一化,且在不同随机种子间存在差异。

arXiv:2608.10398v1 公告类型:新 摘要:变分自编码器从概率潜在表示中生成样本,但不区分关于潜在位置的不确定性与围绕它的变异性。我们提出了ELVAE,一种基于证据学习的VAE,其中每个潜在坐标由一个依赖于输入的正态-逆伽马后验控制。这种层级结构产生了显式的潜在位置不确定性,可在生成过程中使用,而不仅仅是在推理后报告:低不确定性的锚点支持更可靠的合成样本,而高不确定性的锚点可被有意用于压力测试。目标是一个精确的证据下界,并且我们表明需要对整个层级结构进行直接正则化,因为仅靠边缘化的潜在分布无法识别不确定性分解。在一个使用冻结外部分类器的MNIST生成试点中,这种不确定性清晰地分层了生成数字的语义可靠性。一个零位移对照实验表明,大部分效果反映了锚点被重新生成的可靠性,而一个较小但明显的成分可归因于不确定性缩放的扰动本身。该效应仅在类内不确定性排序下成立,且其幅度因随机种子而异。这些发现支持将学习到的潜在位置不确定性作为不确定性感知生成的实际控制变量,将锚点可靠性与扰动引起的失败区分开来。
查看原文
查看缓存全文

缓存时间: 2026/08/12 08:29

# 1 引言

来源:https://arxiv.org/html/2608.10398
ELVAE:基于证据学习的变分自编码器用于不确定性感知生成

Ge Wang

生物医学成像中心,伦斯勒理工学院,纽约州特洛伊,美国

摘要:变分自编码器(VAE)从概率潜在表示中生成样本,但并未明确区分潜在位置的不确定性与围绕该位置的可变性。我们提出了 ELVAE,一种基于证据学习的 VAE,其中每个潜在坐标由一个依赖于输入的正态-逆伽马(NIG)后验控制。该层次结构产生了一个显式的潜在位置不确定性 u_epi=β/[ν(α−1)],可用于对后验锚点进行分层,并调节生成过程。在一个包含 10,000 张图像的 MNIST 试点实验中,样本按类内 u_epi 排序,并由一个仅在真实 MNIST 上训练的分类器进行评估。分类器错误率从不确定性最低的 20% 组中的 26.30% 上升到不确定性最高的 20% 组中的 37.80%(1.437 倍,95% 自助法置信区间 1.33–1.58)。零位移对照 z=γ 保留了绝大部分对比度(1.395 倍),表明主要效应反映的是锚点重新生成的可靠性。在 z=γ 下正确重新生成的锚点中,不确定性缩放的扰动在低 u_epi 组中诱导了 1.97% 的语义失败,而在高 u_epi 组中则为 5.92%(3.01 倍,95% 置信区间 2.03–4.75)。与主要结果同时报告了两个注意事项:在未归一化的全局 u_epi 排序下,对比度基本为零(1.015 倍),因此类内归一化并非装饰性操作;在三个随机种子下,主要比率在 1.126 到 1.437 之间变化。该公式在数学上也是良定的:ELVAE 目标是对应层次生成模型的精确 ELBO,而直接的 NIG 到 NIG 正则化识别出了仅靠边缘化 Student-t 潜在分布无法获得的不确定性分解。这些结果支持将 u_epi 作为后验锚定的不确定性感知生成中的有用变量,同时将锚点可靠性与可归因于扰动的失败区分开来。

关键词:证据学习;变分自编码器;不确定性感知生成;合成数据;压力测试;正态-逆伽马;认知不确定性;生成式人工智能。

生成式人工智能通常通过真实性、保真度、多样性或下游有用性来评估。然而,对于训练数据生成和鲁棒性测试而言,第二个问题同样重要:模型对生成某个特定合成图像所依据的潜在状态有多不确定?两张生成的图像可能看起来都合理,但其中一张位于约束良好的潜在区域,而另一张则是从一个模型证据较弱的潜在位置生成的。

传统 VAE 建模为

q_φ(z∣y)=N(μ_φ(y), diag σ_φ²(y)), (1)其中 μ_φ 和 σ_φ² 是确定性网络输出[2]。这提供了随机生成能力,但模型只有一个层次的潜在不确定性。证据学习提出了一种更丰富的构造:将分布置于潜在均值和方差本身之上[4]。我们将由此产生的模型称为 ELVAE。

> ELVAE 将不确定性转化为生成控制变量:低不确定性可以识别更可靠的合成样本,而高不确定性可以被有意保留,以创造困难的压力测试样本。

这对于科学和医学生成尤其有吸引力,因为在这些领域,合成图像可能被用于扩充稀缺的训练集,或用于探明下游网络的失败模式。

#### 与先前证据学习和自编码器工作的关系。

自编码器自 [1] 起就被用于表示学习,而 [2] 的变分公式使潜在编码成为一个显式的概率对象。证据学习将点预测替换为高阶分布的参数,首先通过 Dirichlet 输出用于分类[3],然后通过 NIG 族用于回归[4];后者提供了本文所使用的层次结构。Itkina 等人[7] 将证据处理应用于条件 VAE 的离散潜在分布,以剪除不可信的模式;Baykal 等人[8] 使用基于 Dirichlet 证据的分布覆盖离散 VQ-VAE 码本分配,以缓解码本坍缩。Catoni 等人[9] 研究了连续 VAE 中的不确定性表示,并引入了一种带有额外全局缩放潜在变量的 Explaining-Away VAE;他们在自然图像、MNIST 和医学图像域上评估了潜在不确定性。ELVAE 解决的是另一个问题:它直接将逐坐标的 NIG 层次结构置于连续潜在位置和方差之上,通过 NIG 到 NIG 正则化识别高阶不确定性分解,并将潜在位置方差 u_epi 作为后验锚定生成的变量。证据回归目标已知的病理问题[5,6] 仍然相关,并促使我们直接正则化完整的 NIG 层次结构。

图 1 总结了训练和生成流程。本研究做出四项贡献。首先,我们为 VAE 潜在变量构建了一个连续的 NIG 层次结构,并定义了显式的潜在位置不确定性 u_epi。其次,我们证明需要直接的 NIG 正则化来识别不确定性分解,并且由此产生的训练目标是精确的 ELBO。第三,我们进行了一个直接的生成试点:ELVAE 从后验锚点生成带标签的 MNIST 变体,展示低 u_epi 和高 u_epi 图像,并由一个冻结分类器量化高 u_epi 生成样本是否更有可能丢失其预期语义类别。第四,我们通过 z=γ 对照将该效应分离为锚点质量成分和可归因于生成的成分,并同时报告两者。

## 2 方法

### 2.1 证据潜在层次结构

对于每个潜在坐标 k=1,...,K,编码器预测四个 NIG 参数

(γ_k, ν_k, α_k, β_k), 其中 ν_k>0, α_k>1, β_k>0, (2)它们定义了

σ_k²∣y ∼ InvGamma(α_k, β_k), μ_k∣σ_k²,y ∼ N(γ_k, σ_k²/ν_k), z_k∣μ_k,σ_k² ∼ N(μ_k, σ_k²)。 (3)
(a) 训练
y
编码器
q_φ(μ,σ²∣y)=NIG(γ,ν,α,β)
z
采样
解码器
ŷ
NIG 先验
p_0:
L_NIG=1/K ∑_k D_KL(q_φ‖p_0)
L_recon
(b) 生成
锚点 (y_i,c_i)
编码器
γ_i, u_epi,i
不确定性缩放扰动
z=γ_i+τ_epi √u_epi,i ⊙ ε
解码器
冻结分类器
c_i→ĉ_i?
x_i^gen
对照:τ_epi=0 ⇒ z=γ_i
u_epi 保留用于排序
图 1:ELVAE 训练与后验锚定生成试点。(a) 训练:编码器预测潜在位置和方差上的 NIG 后验,并向固定 NIG 先验进行正则化。(b) 生成:试点使用由 NIG 导出的 u_epi 既对锚点排序,又缩放受控高斯扰动,并由冻结分类器测试预期类别是否保留。虚线对照分支设置 τ_epi=0,得到 z=γ_i,同时保留 u_epi 用于排序。

因此

q_φ(μ_k, σ_k²∣y)=NIG(γ_k, ν_k, α_k, β_k)。 (4)我们通过 softplus 变换强制正性,并在 α 上使用标准 +1 偏移,以保证 E[σ²] 存在[4]。

该层次结构区分了潜在扩展的两个统计上不同的来源:

u_var,k ≡ E[σ_k²∣y] = β_k/(α_k−1), (5)
u_epi,k ≡ Var(μ_k∣y) = β_k/(ν_k(α_k−1)), (6)
Var(z_k∣y) = u_var,k + u_epi,k。 (7)
在本文中,我们将式 (6) 称为认知潜在不确定性,因为它量化了潜在位置本身的不确定性,而式 (5) 量化了围绕该位置的可变性。对于单张图像,我们汇总为

u_epi(y)=1/K ∑_{k=1}^{K} u_epi,k(y)。 (8)

### 2.2 训练目标

设 P 为输入像素数,K 为潜在坐标数,我们使用

L_ELVAE(y)=L_recon(y)+λ_NIG L_NIG(y), (9)其中

L_recon=1/P E‖y−g_θ(z)‖₂², (10)且

L_NIG=1/K ∑_{k=1}^{K} D_KL[NIG(γ_k,ν_k,α_k,β_k)‖NIG(γ_0,ν_0,α_0,β_0)]。 (11)
NIG KL 直接正则化那些被赋予不确定性意义的高阶量。由于 L_NIG 是坐标平均值,因此总高阶 KL 为 KL_NIG。对于 q=NIG(γ,ν,α,β) 和 p_0=NIG(γ_0,ν_0,α_0,β_0),在式 (3) 的逆伽马参数化下,逐坐标散度为

D_KL(q‖p_0) = α_0 log(β/β_0) − log Γ(α) + log Γ(α_0) + (α−α_0)ψ(α) − α + (α β_0)/β + 1/2[log(ν/ν_0) + ν_0/ν − 1 + (ν_0 α (γ−γ_0)²)/β], (12)
其中 ψ 是 digamma 函数。这是逆伽马因子之间的 KL 加上 μ 的条件正态分布之间的期望 KL。

### 2.3 ELBO 解释与 NIG 权重的确定

直接从式 (9) 出发,表面上看唯一的自由平衡项是 λ_NIG,它控制 NIG 正则化相对于重建项的权重。该权重具有似然解释,而非任意调参参数。考虑层次生成模型

p(μ,σ²)=p_0, p(z∣μ,σ²)=N(μ,σ²), p(y∣z)=N(g_θ(z), s² I_P), (13)
其推理模型为 q(μ,σ²,z∣y)=q_φ(μ,σ²∣y)p(z∣μ,σ²)。标量 s² 是图像空间中的同方差观测方差。

对于该模型,负 ELBO 为

−ELBO(y)=P/2 log(2πs²) + P/(2s²) L_recon(y) + KL_NIG(y)。 (14)
链式法则 KL 化简为 D_KL[q_φ(μ,σ²∣y)‖p_0],因为 q(z∣μ,σ²) 被选择为等于 p(z∣μ,σ²)。高斯观测模型提供了式 (14) 中的前两项。

将式 (9) 乘以 P/(2s²) 得到

P/(2s²) L_ELVAE = P/(2s²) L_recon + (P λ_NIG)/(2s²) L_NIG。 (15)
将式 (14) 和式 (15) 中 L_NIG 的系数匹配,得到

λ_NIG=2s²K/P, 或等价地 s²=Pλ_NIG/(2K)。 (16)
因此,λ_NIG 与假定的图像空间残差方差是同一相对权重的两种参数化方式。固定其中一个即可确定另一个。

观测方差本身可以从重建残差中估计。如果将 s² 视为未知标量,并在编码器和解码器保持固定的情况下关于 s² 最小化式 (14),则

ŝ²=1/P E_{y,z}‖y−g_θ(z)‖₂²=L_recon, (17)
其中 L_recon 表示在数据分布和潜在采样上平均的重建 MSE。将式 (17) 代入式 (16) 得到实际校准公式

λ̂_NIG=2K/P L_recon。 (18)
因此,一旦测得重建 MSE,λ_NIG 就可以由似然模型确定,而不是独立选择。相关量是数据集平均的、近似收敛的重建 MSE,而不是单张图像或单个小批量的误差。由于 λ_NIG 是

相似文章

变分有损自编码器

OpenAI Blog

# 变分有损自编码器 来源: [https://openai.com/index/variational-lossy-autoencoder/](https://openai.com/index/variational-lossy-autoencoder/) ## 摘要 表示学习旨在将观测数据的某些方面暴露在学习表示中,这种表示便于分类等下游任务。例如,对于二维图像,一个好的表示可能是只描述全局结构并丢弃有关详细纹理信息的表示。在本文中,我们提出

证据深度学习的变分推断

arXiv cs.LG

提出了一种数学上严格的框架——变分推断的深度证据学习(VI-EDL),通过变分推断重新表述传统深度证据学习,推导出证据下界,建立泛化界,并在视觉和医学数据集上实现了最先进的性能,以解决传统深度证据学习的局限性。

变分选项发现算法

OpenAI Blog

OpenAI研究人员提出了VALOR,这是一种用于选项发现的变分推断方法,它将选项学习与变分自编码器联系起来,并提出了一种课程学习方法,通过动态增加上下文复杂性来稳定训练。

$\mathbf{\lambda}$-VAE:后验坍塌的方差均衡

arXiv cs.LG

识别了VAEs中后验坍塌的两个耦合原因,并引入了λ-VAE,这是一种对重新参数化步骤的修改,通过均衡各潜变量维度的方差来减少坍塌并提高信息容量。