为什么少步文本隐变量在图像隐变量有效时失败?尖锐类别读出中的非承诺性

arXiv cs.LG 论文

摘要

论文指出了为何确定性少步生成在文本上失败而在图像上成功:文本解码器中尖锐的类别读出放大了微小误差,导致词元翻转,而连续图像解码器是平滑的。论文提出了诊断指标(DABI, CCI)以及逃逸机制,如类别承诺和随机重注入。

arXiv:2606.30705v1 Announce Type: new 摘要:确定性少步生成在连续图像隐变量上成功,但在连续文本隐变量上崩溃为不连贯的文本,我们证明原因在于几何特性而非训练或规模缺陷:平滑、受正则性限制的确定性映射无法在尖锐的类别读出之前解决离散分支选择,因此少步失败由解码器尖锐度决定,而非传输精度。在真实文本自编码器的重叠区域中,我们证明(定理3)后验均值终端步骤以决策边界周围 $O(s(t))$ 管道中的隐变量质量速率翻转词元。两个诊断指标,DABI(读出尖锐度)和CCI(类别承诺),在已发表的检查点上测量显示,四个独立构建的连续文本解码器将边界对齐的扰动放大远超范数匹配的各向同性扰动(DABI从 $5\times10^{2}$ 到 $>10^{5}$),而图像解码器的DABI ≈ 1。两种机制逃逸了连续界限:类别承诺(自回归解码器尽管读出更尖锐仍成功)和随机重注入(在 $K=4$ 时确定性ODE给出PPL 294,而同一模型上的SDE为50)。在理想化的分离区域中,我们证明匹配的尖锐传输定律,包括维度相图:分离 $M$ 模式所需的确定性刚度在隐变量维度为 $\Omega(\log M)$ 时按 $\Theta(\sqrt{\log M})$ 增长(在固定维度下为 $M^{1/n}$),深度为 $B$ 的层级结构给出每步峰值小 $\sqrt{B}$(定理5-7);余面积恒等式将这些与重叠管道联系起来(定理17)。结果是一个精度-深度-刚度的权衡:在确定性-连续类别内,成本是不可减少的,而两种逃逸机制都跨出了该类别。
查看原文
查看缓存全文

缓存时间: 2026/07/01 05:31

# 为什么少步文本潜在表示会失败而图像潜在表示却成功?锐利分类读出中的非承诺问题

来源:https://arxiv.org/html/2606.30705

###### 摘要

确定性少步生成在连续的图像潜在表示上取得成功,但在连续的文本潜在表示上却崩溃为不连贯的文本。我们证明其原因在于几何结构,而非训练或缩放缺陷:一个光滑、正则性有限的确定性映射无法在锐利的分类读出之前解决离散的分支选择,因此少步失败由解码器的锐度主导,而非传输精度。在真实文本自编码器的*重叠* 机制中,我们证明(定理3 (https://arxiv.org/html/2606.30705#Thmtheorem3))后验均值终端步长会在决策边界周围的\(O(s(t))\)管中以潜在质量的比例翻转令牌;该比率由解码器锐度决定,而非传输精度。在已发布的检查点上测量的两个诊断指标——DABI(读出锐度)和CCI(分类承诺)表明,四个独立构建的连续文本解码器将边界对齐的扰动放大到远超范数匹配的各向同性扰动(DABI从\(5 \times 10^{2}\)到\(>10^{5}\)),而图像解码器的DABI≈1。两种机制可以避开连续界的限制:分类承诺(自回归解码器尽管读出更*锐利* 却成功;移除承诺会导致生成崩溃)和随机重注入(同一模型上,确定性ODE在K=4时PPL为294,而SDE为50)。在理想化的*分离* 机制中,我们证明了匹配的锐利传输定律,包括一个维度相图:一旦潜在维度为\(\Omega(\log M)\),分离\(M\)个模式所需的确定性刚度增长为\(\Theta(\sqrt{\log M})\)(在固定维度中增长为\(M^{1/n}\)),并且深度-\(B\)层级结构给出了每步峰值缩小\(\sqrt{B}\)倍(定理5 (https://arxiv.org/html/2606.30705#Thmtheorem5)–7 (https://arxiv.org/html/2606.30705#Thmtheorem7));一个余面积恒等式将这些与重叠管联系起来(定理17 (https://arxiv.org/html/2606.30705#Thmtheorem17))。结果是精度–深度–刚度的权衡:在确定性连续类内部,代价是不可约的,而两种逃避方式都跳出了该类。

| 图像潜在表示 | 文本潜在表示 |
|-------------|-------------|
| 解码器DABI≈1 | 解码器DABI≫1 |
| 有效 | 无效 |
| 好的文本 | 坏的文本 |
| 同一个光滑少步映射:锐利读出会翻转文本,而非图像 | 同一个光滑少步映射:锐利读出会翻转文本,而非图像 |

**图1:** 为什么确定性少步生成对图像有效而对文本无效。一个光滑的少步映射将每个潜在表示仅递送到一个\(O(s(t))\)后验均值模糊(模糊圆盘)内。(左)图像解码器是光滑的且没有分类读出,因此模糊被吸收(解码器放大倍数DABI≈1),输出保持正确。(右)文本解码器通过\(\operatorname{arg\,max}_{y} w_y^\top z\)读出,将潜在表示分割成锐利的argmax单元格;*相同的* 模糊落在决策边界上会翻转令牌(DABI≫1),文本变得不连贯。失败由读出的锐度决定,而非传输精度(定理3 (https://arxiv.org/html/2606.30705#Thmtheorem3))。两种机制离开确定性连续类并避开该界:分类承诺(自回归/掩码解码器)和随机重注入(SDE);DABI×CCI分类法(第5.3节 (https://arxiv.org/html/2606.30705#S5.SS3))预测哪些系统会失败。

## 1 引言

确定性少步生成图像已取得快速进展。一致性模型(Song等人,2023 (https://arxiv.org/html/2606.30705#bib.bib16))、整流流(Liu等人,2023 (https://arxiv.org/html/2606.30705#bib.bib19))和渐进式蒸馏(Salimans and Ho,2022 (https://arxiv.org/html/2606.30705#bib.bib17))通过从噪声到数据学习光滑传输映射,在1–4次网络评估中产生高质量的图像。同样的方法应用于连续文本潜在表示却失败(图1 (https://arxiv.org/html/2606.30705#S0.F1))。文本自编码器(如ELF (Hu等人,2026b (https://arxiv.org/html/2606.30705#bib.bib1)))潜在空间的确定性少步生成器在K≤16步时产生不连贯的文本,包含重复令牌和多语言片段,只有在K≥32–64步时才变得可用。我们的证据表明,这种失败主要不是由训练、架构或调度解释的,而是结构性的:当解码器的读出边界相对于传输残差锐利时,光滑的确定性映射无法在少数几步内解决离散的分支选择。我们针对后验均值终端步长形式化了这一点,并在已发布的检查点上验证了预测;该界适用于确定性传输,随机和分类生成器可以避开它。

#### 失败模式。

文本自编码器将离散令牌编码为连续潜在表示\(z=E(x)\),并通过\(D_W(z)=\operatorname{arg\,max}_{y} w_y^\top z\)解码。确定性少步生成器是具有有界Lipschitz常数的光滑映射的组合;读出操作会放大决策边界附近小的结构化位移,导致令牌错误。这种失败模式出现在两种机制中。在*重叠* 机制(真实文本自编码器)中,我们证明(定理3 (https://arxiv.org/html/2606.30705#Thmtheorem3))后验均值终端步长以读出校准的非承诺率翻转令牌:即决策边界周围\(O(s(t))\)管中的潜在质量。因此失败由解码器锐度决定,而非传输精度。在理想化的*分离* 机制中,向\(M\)个良好分离模式传输的代价是界面能量刚度(定理5 (https://arxiv.org/html/2606.30705#Thmtheorem5)–7 (https://arxiv.org/html/2606.30705#Thmtheorem7))。分离模式的\(\mathfrak{J}\)*不* 能预测真实的ELF残差,但余面积恒等式(定理17 (https://arxiv.org/html/2606.30705#Thmtheorem17))将两者联系起来,视为一个复合界面几何的收缩。

#### 主要结果。

*(1)非承诺定理。* 翻转率等于读出校准的非承诺 ≥ 贝叶斯非承诺;渐近地,\(\mathbb{P}(\hat{Y}_t \neq Y) \asymp \mathbb{P}[\delta^*(X,Y) \lesssim s(t)]\)。在ELF上的oracle回滚(我们对干净潜在表示加噪声,并从每一步将确定性ODE积分回t=1;图3 (https://arxiv.org/html/2606.30705#S4.F3))证实了这一点:12–41%的终端翻转复合为≈90%,所有K都塌缩到一条\(s(t)\)曲线上,并且残差是结构化的(比各向同性大10–33倍),其中约1%为边界法向分量。

*(2)图像/文本二分法。* 我们定义了DABI(边界对齐输入的解码器放大):\(\mathrm{DABI} = \Delta\mathrm{CE}_{\mathrm{struct}} / \Delta\mathrm{CE}_{\mathrm{rand}}\),在匹配的扰动范数下。在相同的边缘法向探测下,对所有四个文本编解码器一致应用,边界对齐扰动翻转了47–77%的令牌,而范数匹配的各向同性扰动翻转了≈0%(ELF的DABI=508× [446,580];LangFlow (Chen等人,2026 (https://arxiv.org/html/2606.30705#bib.bib4))、CoLa-DLM (Guo等人,2026 (https://arxiv.org/html/2606.30705#bib.bib3))、Cosmos (Meshchaninov等人,2025 (https://arxiv.org/html/2606.30705#bib.bib5)) 的各向同性响应处于基底水平,因此DABI≫10^4;表1 (https://arxiv.org/html/2606.30705#S4.T1),95%自举置信区间)。对于具有确定性生成器的两个流模型,实际实现的终端残差已经触发了这种锐度:它比相同范数的各向同性残差多翻转了21倍(ELF)和≈2,600倍(LangFlow)的令牌。相比之下,4个已发布的图像VAE × 4个NFE的DABI∈[0.85,1.94]:图像/文本差距达数个数量级且无重叠。

*(3)逃避机制。* **随机性:** 在同一ELF-B教师 (Hu等人,2026b (https://arxiv.org/html/2606.30705#bib.bib1))上,ODE的K=4 PPL=294 vs SDE的PPL=50;即使蒸馏后的PD学生 (Hu等人,2026a (https://arxiv.org/html/2606.30705#bib.bib29)) 也显示出持续的ODE到SDE差距(K≥2时15–38%)。**分类性:** AR解码器的DABI=915–19,805×(比ELF更锐利)但因其分类承诺使生成器不连续而成功(引理4 (https://arxiv.org/html/2606.30705#Thmtheorem4));移除承诺会导致生成崩溃(Dream:5× PPL跳跃)。

*(4)锐利传输定律。* \(\lim_{\Lambda\to\infty} \Lambda \inf W_p^p = \mathfrak{J}_{p,\sigma}\)(定理5 (https://arxiv.org/html/2606.30705#Thmtheorem5),硬梯度Γ-极限);当\(n \geq C\log M\)时,\(\mathcal{P}_{n,M} \asymp \sqrt{\log M}\)(定理6 (https://arxiv.org/html/2606.30705#Thmtheorem6));深度-\(B\)层级结构达到峰值比\(\sqrt{B}\)(定理7 (https://arxiv.org/html/2606.30705#Thmtheorem7))。

#### 范围。

所有下界都适用于*确定性* 传输。这是一个精度–深度–刚度的权衡,而非不可能:两种逃避(分类承诺、随机重注入)离开了连续确定性类。

#### 相关工作。

定理5 (https://arxiv.org/html/2606.30705#Thmtheorem5) 是Baldo/Fonseca–Tartar多阱Γ-极限 (Baldo, 1990 (https://arxiv.org/html/2606.30705#bib.bib20); Fonseca and Tartar, 1989 (https://arxiv.org/html/2606.30705#bib.bib21)) 的硬Lipschitz对应物。高斯宽度恒等式与一般选集 (Talagrand, 2005 (https://arxiv.org/html/2606.30705#bib.bib24)) 和Milman–Neeman (Milman and Neeman, 2022 (https://arxiv.org/html/2606.30705#bib.bib22)) 相关联。Salmona等人 (2022 (https://arxiv.org/html/2606.30705#bib.bib25)) 表明Lipschitz推前在多模态目标上受到限制;我们的贡献是维度敏感的界面定律和分类逃避的识别。FMLM (Lee等人, 2026 (https://arxiv.org/html/2606.30705#bib.bib2)) 是分类逃避的一个实例(第5.4节 (https://arxiv.org/html/2606.30705#S5.SS4))。ELF+PD (Hu等人, 2026a (https://arxiv.org/html/2606.30705#bib.bib29)) 在我们研究的模型上确认了ODE与SDE的差距。扩展的相关工作见附录L (https://arxiv.org/html/2606.30705#A12)。

## 2 设置与定义

#### 源和目标。

源是\(\mathbb{R}^n\)上的概率测度\(\sigma = \rho \, dx\),具有严格正\(C^1\)密度(标准高斯\(\gamma_n\)是主要例子)。目标集中在\(\mathbb{R}^d\)中的\(M\)个码本点\(\mathcal{C} = \{c_1, \ldots, c_M\} \subset \mathbb{R}^d\)附近,权重\(\pi_i > 0\);我们记\(\mu = \sum_i \pi_i \delta_{c_i}\)。在分离机制中,\(\min_{i \neq j} \|c_i - c_j\| \geq \Delta > 0\)。在重叠机制(真实文本自编码器)中,逐令牌后验重叠,\(\Delta\)不是有意义的参数。

#### 线性读出和归一化间隔。

线性读出将\(z \in \mathbb{R}^d\)解码为令牌:\(D_W(z) = \operatorname{arg\,max}_{y} w_y^\top z\),其中\(W = [w_1, \ldots, w_V]\)是读出矩阵,词汇表大小为\(V\)。正确令牌\(y\)对竞争者\(j\)的归一化间隔为
\[
\delta^*_{yj}(z) = \frac{(w_y - w_j)^\top z}{\|w_y - w_j\|}, \qquad
\delta^*(z, y) = \min_{j \neq y} \delta^*_{yj}(z).
\]
决策边界是超平面\(\Sigma_{ij} = \{z : w_i^\top z = w_j^\top z\}\)。

#### 流插值和后验均值。

记\(X\)为干净潜在表示,\(U_t = tX + (1-t) s_0 \varepsilon\),\(\varepsilon \sim \gamma_n\),为在时间\(t\)处具有噪声尺度\(s_0\)的流插值。群体最优\(x\)预测(终端Euler步长)是后验均值\(m_t(u) = \mathbb{E}[X \mid U_t = u]\)。时间\(t\)处的有效噪声尺度为\(s(t) = s_0 (1-t)/t\);小的\(t\)意味着大噪声,大的\(t\)意味着小噪声。

#### 障碍度量与界面能量。

对于阱\(\mathcal{C}\),设\(V(y) = \operatorname{dist}(y, \mathcal{C})^p\),并定义障碍度量
\[
\kappa_p(i, j) = \inf_{\xi: c_i \to c_j} \int_0^1 V(\xi(s)) \|\dot{\xi}(s)\| \, ds,
\]
是两个阱之间最小\(V\)加权路径长度。加权界面能量及其指定质量分布为
\[
E_{p,\sigma}(B; \mathcal{C}) = \sum_i \pi_i > 0,\ \sum_i \pi_i = 1,
\]
定义
\[
\mathfrak{J}_{p,\sigma}(\pi; \mathcal{C}) := \inf_{\sigma(B_i) = \pi_i} E_{p,\sigma}(B; \mathcal{C}),
\]
其中下确界取遍具有这些质量的Caccioppoli划分。

最后,
\[
\mathcal{F}_\varepsilon(T) := 
\begin{cases}
\displaystyle \varepsilon^{-1} \int_{\mathbb{R}^n} V(T(x)) \, d\sigma(x), & \operatorname{Lip}(T) \leq \varepsilon^{-1},\\
+\infty, & \text{否则}.
\end{cases}
\]
我们使用\(L^1(\sigma; \mathbb{R}^d)\)拓扑。记\(Q_i\)为\(c_i\)的欧几里得Voronoi胞元,并采用固定的字典序破平规则,且令\(q(y) = i \iff y \in Q_i\)。对于划分\(B\),记\(u_B := \sum_{i=1}^M c_i \mathbf{1}_{B_i}\)。我们使用关于BV、减边界、Caccioppoli界面上BV函数的迹以及有限划分的结构定理的标准事实;见Ambrosio–Fusco–Pallara (Ambrosio等人, 2000 (https://arxiv.org/html/2606.30705#bib.bib10))。对于具有体积约束的正则多面体划分的密度,我们使用Braides–Conti–Garroni多面体密度定理 (Braides等人, 2017 (https://arxiv.org/html/2606.30705#bib.bib11))。其软梯度类似物是Baldo/Fonseca–Tartar多阱Modica–Mortola理论 (Baldo, 1990 (https://arxiv.org/html/2606.30705#bib.bib20); Fonseca and Tartar, 1989 (https://arxiv.org/html/2606.30705#bib.bib21))。

###### 定理 8(定理5 (https://arxiv.org/html/2606.30705#Thmtheorem5)的展开形式)。

假设\(\rho \in C^1(\mathbb{R}^n; (0,\infty))\),\(\mathcal{C} = \{c_1, \ldots, c_M\} \subset \mathbb{R}^d\)是有限且由不同点组成,\(p \in [1,\infty)\),且\(\pi_i > 0\)满足\(\sum_i \pi_i = 1\)。那么在\(L^1(\sigma; \mathbb{R}^d)\)中,
\[
\mathcal{F}_\varepsilon \xrightarrow{\Gamma} \mathcal{F}_0,
\]
其中
\[
\mathcal{F}_0(u) =
\begin{cases}
E_{p,\sigma}(B; \mathcal{C}), & u = u_B = \sum_i c_i \mathbf{1}_{B_i} \text{ 对应一个Caccioppoli划分 } B,\\
+\infty, & \text{否则}.
\end{cases}
\]
此外,如果\(B\)具有指定质量\(\sigma(B_i) = \pi_i\),则恢复序列可以选择为

相似文章

语言中的JEPA悖论:语言替代的几何学

arXiv cs.CL

本文分析了为什么确定性JEPA风格的潜在预测适用于图像但不适用于文本,将失败归因于语言中的高条件方差,其中被屏蔽的上下文允许多个有效补全,而这些补全的表征缺乏一致的质心。

使用CLIP潜在表示的分层文本条件图像生成

OpenAI Blog

OpenAI提出了一个使用CLIP潜在表示进行文本条件图像生成的分层两阶段模型:一个先验模型从文本标题生成CLIP图像嵌入,以及一个基于扩散的解码器从嵌入生成图像。该方法提高了图像多样性,并实现了零样本语言引导图像操作。