Drift Variation Autoencoder:通过条件后验流匹配统一生成与表示学习
摘要
本文介绍了Drift Variation自动编码器,它使用条件后验流匹配来统一生成和表示学习,在受控多模态基准测试中实现了高性能。
查看缓存全文
缓存时间: 2026/08/27 09:34
# 漂移变异自编码器:通过条件后验流匹配统一生成与表示学习
来源:https://arxiv.org/html/2608.25138
###### 摘要
随机掩码、裁剪或模态移除使得确定性重建成为一个不完整的目标:一个观测可能对应多种干净补全。本文将相应的后验 \(P(X \mid C)\) 视为条件生成和生成充分表示学习的公共统计对象。漂移变异自编码器训练一个掩码编码器 \(Z=E(C)\) 和一个条件流解码器,使用单一的清洁预测流匹配损失。分析首先将理想的条件 KL 散度分解为生成器近似和表示缺陷 \(I(X;C \mid Z)\)。随后为条件流匹配推导了正交风险分解。对于仿射高斯路径,清洁预测表示差距为零当且仅当 \(P(X \mid Z)=P(X \mid C)\)。因此,由流匹配引起的编码器依赖的超额清洁预测风险与剖析后的理想条件 KL 散度具有相同的后验充分零点集,尽管数值上目标函数并不相等。一个精确的条件场配合零噪声端点可以在联合理想最优点处生成 \(P(X \mid Z)\) 从而生成 \(P(X \mid C)\)。该结果可扩展至连续多模态乘积空间,前提是完整模态元组对每个观测掩码都保持作为流目标。在 CrossGeom-4 这个包含 18 次运行的受控基准测试中,可观测因子的线性探针 \(R^2\) 达到 0.9990–0.9992;打乱联合模型的编码器条件会使条件误差增加 13.5×–15.7×;而联合目标注意力相比独立目标解码器,可将两个输出共享的未观测因子上的不一致性降低 90.1%–92.8%。可见模态也得到生成和重建,直接验证了完整元组目标。无条件模式平衡仍不完善,将实证主张限定在受控的多模态概念验证层面。
## 1 引言
当数据增强移除信息时,重建并非一对一的问题。裁剪可能隐藏多种合理背景;掩码信号可能有多种延续方式;而观测模态可能留下两个缺失模态必须共享的残差变量。因此,统计上正确的目标不是单一的重建,而是给定随机观测 \(C=A(X,\Xi_A)\) 下干净样本 \(X\) 的后验 \(P(X \mid C)\)。该后验为通常分开训练的两个任务提供了一个精确的公共目标:生成器应对其进行采样,而编码器表示应精确保留 \(C\) 中指定它所需的信息。当前流程通常使用不同的目标优化这两种能力。自监督编码器使用视图一致性、掩码重建或潜在预测 [1, 2, 3, 4],而扩散和流模型则估计去噪分数或传输场 [5, 6, 7]。下游系统随后可能对齐、冻结、蒸馏或重新连接这些组件。这种分离可能有用,但它并未使表示正确性成为生成器建模的同一不确定性的结果。相反,条件生成器可以通过其噪声状态减少去噪损失,而不暴露可复用的表示。本文探讨是否可以有一个普通的生成目标来*表征和训练*它所消费的表示。
设 \(Z=E_\theta(C)\) 为确定性表示,\(Q(X \mid Z)\) 为条件生成器。理想的后验匹配风险为 \(\mathcal{K}(E,Q)=\mathbb{E}_C \operatorname{KL}\left(P(X \mid C) \,\|\, Q(X \mid E(C))\right)\)。(1) 由于 \(Z\) 是 \(C\) 的函数,该风险可精确分解为:
\(\mathcal{K}(E,Q)=I(X;C \mid Z) + \mathbb{E}_Z \operatorname{KL}\left(P(X \mid Z) \,\|\, Q(X \mid Z)\right)\)。(2)
生成器必须对压缩后的后验建模,而表示正确当且仅当 \(P(X \mid Z)=P(X \mid C)\)。这一条件称为*后验充分性*。它是一种表示质量的生成概念,并非语义最小性、解耦或不变性的保证。恒等编码器可以是充分的;观测过程和瓶颈决定了哪些充分表示是有用的。公式 (1) 定义了所需的统计对象,但其未知的条件密度阻碍了直接优化。漂移变异自编码器利用条件流匹配 (CFM) [7, 8] 将此后验原理转化为基于样本的目标。训练过程抽取一个条件独立的高斯源 \(X_0\),构造仿射路径 \(X_t = \alpha_t X + \sigma_t X_0\),并联合训练编码器和一个仅接收 \((X_t, t, Z)\) 的清洁预测解码器。样本目标是解析的,并由观测数据对和概率路径固定;总体目标不需要教师、对比目标或生成的参考集。关键难点在于证明 CFM 约束的是编码器而不仅仅是解码器。分析将风险正交分解为不可约路径方差、表示缺陷和模型近似。对于清洁预测,编码器相关项为 \(\Delta_{\rm rep}^x(E) = \mathbb{E}\left[w(t) \left\lVert \mathbb{E}[X \mid X_t, t, C] - \mathbb{E}[X \mid X_t, t, Z] \right\rVert^2 \right]\)。(3) 对于在中间噪声水平具有正有效质量的仿射高斯路径,分析证明 \(\Delta_{\rm rep}^x(E)=0 \Longleftrightarrow P(X \mid Z)=P(X \mid C) \Longleftrightarrow I(X;C \mid Z)=0\)。(4) 该证明从高斯后验均值中恢复含噪条件分数,然后是平滑密度,最后通过高斯卷积的单射性得到干净后验。这是理想编码器零点集的等价性,而非数值上 CFM 和 KL 目标或其编码器梯度的相等性。借助精确的表示条件场,条件 ODE 生成 \(P(X \mid Z)\);公式 (4) 闭合了到 \(P(X \mid C)\) 的循环。该公式扩展到多模态元组 \(\mathbf{X}=(X^{(1)}, \ldots, X^{(M)})\)。观测掩码控制哪些干净模态进入编码器,但流目标对每个掩码都保持为完整元组。每个模态接收源噪声,贡献正的损失权重,并在联合解码器中演化。乘积空间定理随后识别完整的联合后验,包括同时生成的模态之间的残差依赖。评估在 CrossGeom-4(一个具有已知共享因子和欧几里得、球面及双曲视图的受控三模态分布)上测试这一预测。联合和独立解码器具有相似的确定性条件准确性,但只有联合目标注意力可以在两个输出之间协调相同的未观测后验抽样。最接近的理论比较是 Zero-Flow Encoders [9],它在独立耦合下从一个中点零流准则构建单独的充分表示损失。相反,漂移变异自编码器研究用于生成的普通条件解码器:其清洁预测风险本身就诱导了编码器准则,而高斯去噪器可辨识性将该准则与后验充分性联系起来。主要贡献包括:
- • 后验原理。生成表示正确性由 \(P(X \mid Z)=P(X \mid C)\) 定义,理想条件 KL 散度分解为表示缺陷和生成器近似。
- • 流风险与充分性。推导了精确速度和清洁预测风险分解,并证明了由仿射高斯 CFM 诱导的编码器依赖的清洁预测表示差距与剖析后的条件 KL 散度共享相同的后验充分零点集。
- • 端点和多模态保证。将精确场与后验生成联系起来,并将结果扩展到任何观测子集下的完整连续多模态元组。
- • 受控验证。CrossGeom-4 在三种几何结构和三种种子下测量表示使用、可见流重建、条件补全、残差联合耦合和无条件覆盖。
## 2 相关工作
#### 自监督表示学习。对比和自蒸馏方法对齐增强视图,而掩码和预测方法恢复像素、词元或目标嵌入 [1, 10, 2, 3, 4]。MAE 表明高比率掩码可以学习可扩展的视觉特征,而 I-JEPA 则有意在表示空间中进行预测以强调语义结构 [2, 3]。这些方法选择不变性或预测目标。相反,漂移变异自编码器通过观测诱导的干净数据后验定义生成充分表示。它不要求一个样本的所有视图具有相同的特征,也不声称最小或语义充分性。
#### 生成与表示。去噪自编码器将重建场与数据分数联系起来 [11, 12]。扩散自编码器 [13]、使用扩散的表示学习 [14, 15] 以及 DDAE [16] 研究使用生成模型学习或从生成模型中提取的表示;后续分析追踪扩散表示如何随噪声和训练而变化 [17]。另一方面,REPA 将生成隐藏状态与预训练编码器对齐 [18]。表示自编码器和 RepTok 为高效生成导入或调整自监督潜在空间 [19, 20]。这些方法展示了语义几何的价值,但保留了外部表示源、辅助对齐目标或单独的潜在空间构建。漂移变异自编码器探讨条件生成损失本身在何种情况下能识别所需的表示。
#### 流匹配与条件充分性。流匹配回归固定概率路径的向量场,条件流匹配用易于处理的条件目标替代不可达的边际场,这些条件目标对于场模型具有相同的总体最小化器 [7, 8]。Rectified Flow 研究直线耦合和高效传输 [21]。FlowFM 在可穿戴信号上联合训练编码器和条件流 [22];Self-Flow 添加双时间步信息不对称和用于可扩展多模态合成的自监督特征目标 [23];Symmetrical Flow Matching 结合对向流与监督任务 [24]。与本文开发的理论最接近的是 Zero-Flow Encoders,它将中点零流准则与条件独立性联系起来,并构建单独的表示损失 [9]。相反,漂移变异自编码器证明,在剖析解码器后,用于生成的同一条件解码器的编码器依赖的超额清洁预测风险以充分表示编码器为其理想零点集。其证明使用高斯去噪器可辨识性,而非中点零流准则。从流场误差到终端 KL 的有限误差边界需要额外的正则性 [25];当前结果涉及精确零点集和端点。
#### 多模态学习。MultiMAE 和 4M 随机化跨模态的掩码输入和目标,其中 4M 支持灵活的词元化条件生成 [26, 27]。Chameleon、Transfusion 和 Janus 通过早期融合、自回归-扩散目标或解耦视觉编码器结合多模态理解和生成 [28, 29, 30]。漂移变异自编码器为连续潜在变量提供了一种分布级抽象:任何观测子集定义条件,而所有模态流保持为一个联合流目标。这一区别使得跨输出残差依赖,而不仅仅是每个模态的保真度,成为明确的实证要求。
## 3 用于表示学习的后验流匹配
### 3.1 增强后验是公共目标
设 \(X \in \mathbb{R}^d\) 遵循数据分布,\(\Xi_A\) 表示增强随机性,并定义观测上下文和确定性表示为 \(C=A(X,\Xi_A), \qquad Z=E_\theta(C)\)。(5) 增强可以掩码图块、裁剪空间支持、改变光度统计、移除模态或组合多种操作。如果它不可逆,则 \(P(X \mid C=c)\) 不必是点质量。因此,建模目标是完整的条件分布,而非单一重建。
###### 定义 3.1 (后验充分表示)。
编码器 \(E\) 相对于观测 \(C\) 对于干净目标 \(X\) 是充分的,当对于 \(Z=E(C)\),有
\(P(X \mid Z)=P(X \mid C) \qquad \text{几乎必然}。\) (6)
等价地,\(X \perp\!\!\!\perp C \mid Z\) 或 \(I(X;C \mid Z)=0\),只要条件互信息定义良好。充分性有意弱于最小充分性。恒等编码器 \(Z=C\) 可以是充分的,并且定义 3.1 本身并不强制语义压缩、解耦或对每个增强的不变性。这些属性必须来自观测过程、一种架构约束,或两者兼有。相似文章
面向自回归视频生成的在线策略对抗流蒸馏
提出对抗流蒸馏(AFD),用于将异质黑盒视频生成模型蒸馏为自回归学生模型,采用在线策略反馈和前向过程流匹配更新。
DRIFT: 视觉语言模型中用于连续输出解码的残差流适配器
DRIFT 是一种框架,通过将粗预测与迭代流匹配精化相结合,使预训练的视觉语言模型能够进行连续输出解码,从而提升感知和规划任务的性能。
Unifying Generative Models with Path Integrals
This paper proposes a unified path-integral framework for generative modeling, showing that flow-based, diffusion-based, variational, and adversarial models arise from different evaluation principles of a single master action. It derives a one-loop correction that reduces tree-level error dramatically and introduces a response-weighted score-matching objective.
连续对抗性MeanFlow迁移
本文提出MeanFlow-Transfer(MF-T)和连续对抗性MeanFlow(CAMF),以统一预训练扩散和流动模型的适配和加速,实现数据有限新领域的高质量少步生成。
扩散、基于分数和流匹配生成模型的统一测度论视角
本预印本提出了一个统一的测度论框架,用于理解扩散、基于分数和流匹配生成模型。它通过连续性/福克-普朗克方程建立了这些方法之间的联系,并分析了它们的采样方案及其理论保证。