MIND:用于生成模型评估的 Monge 初始距离

arXiv cs.LG 论文

摘要

本文介绍了 MIND(Monge 初始距离),这是一种用于评估生成模型的新指标,比标准的 Fréchet 初始距离(FID)具有更高的样本效率、更快的速度以及更强的鲁棒性。

arXiv:2605.06797v1 宣布类型:新论文 摘要:我们提出了 Monge 初始距离(MIND),这是一种用于评估生成模型的指标,旨在解决广泛采用的 Fréchet 初始距离(FID)的关键局限性。MIND 指标利用切片 Wasserstein 距离来比较分布,通过平均一维最优传输距离来实现,并通过排序进行高效计算。这种方法规避了高维均值和协方差矩阵的估计问题,而这正是导致 FID 样本复杂度高且易受对抗攻击影响的原因。我们通过实证展示了三个主要优势:(i) 样本效率高出一个数量级,(ii) 计算速度快出两个数量级,(iii) 对矩匹配等对抗攻击具有更强的鲁棒性。我们表明,使用 5k 样本的 MIND 可以替代使用 50k 样本的 FID 评估性能,与该标准基准具有高度相关性,并展现出更优的判别性能。我们进一步证明,即使使用更小的样本量(例如 1k 或 2k),对于快速模型迭代仍然具有高度信息价值。
查看原文
查看缓存全文

缓存时间: 2026/05/11 06:51

# 用于生成式模型评估的 Monge Inception 距离 (MIND)

来源: https://arxiv.org/html/2605.06797
Quentin Berthet<sup>1</sup> Yu-Han Wu<sup>1,2</sup> Clément Crepy<sup>1</sup> Romuald Elie<sup>1</sup> Klaus Greff<sup>1</sup> Michaël E. Sander<sup>1</sup>
<sup>1</sup>Google DeepMind <sup>2</sup>LPSM, Sorbonne Université

###### 摘要

我们提出了 Monge Inception 距离(MIND),这是一种用于评估生成式模型的指标,旨在解决广泛采用的 Fréchet Inception 距离(FID)的关键局限性。MIND 指标利用切片 Wasserstein 距离(sliced Wasserstein distance)通过平均一维最优传输距离来比较分布,这些距离可以通过排序高效计算。这种方法规避了高维均值和协方差矩阵的估计,从而解决了 FID 样本复杂度高以及对对抗攻击脆弱的问题。我们通过实证展示了三个主要优势:(i) 样本效率提高了一个数量级;(ii) 计算速度快了两个数量级;(iii) 对诸如矩匹配(moment-matching)等对抗攻击具有更强的鲁棒性。我们证明,使用 5k 样本的 MIND 可以替代使用 50k 样本的 FID 的评估性能,并与该标准基准保持高度相关性,且具备更优的判别性能。我们进一步证明,即使更小的样本量(例如 1k 或 2k)对于快速模型迭代仍然具有很高的信息价值。

**图 1 说明**:(左) 在 ImageNet-64 上训练扩散模型期间的 MIND 指标(对数刻度),展示了如何使用 MIND<sub>5k</sub> 替代 FID<sub>50k</sub>,并具有更大的动态范围——见第 4.3 节。(右) 与训练步数的相关性 —— MIND<sub>1k</sub> 和 MIND<sub>5k</sub> 优于使用 50k 样本的 FID。

## 1 引言

生成式模型,特别是扩散模型(Ho et al., 2020),在高质量数据合成方面树立了新标准。这一进步推动了从创意艺术到科学模拟等多个领域的创新。然而,随着模型复杂度的增加,用于评估它们的指标却难以跟上步伐(Stein et al., 2023)。事实上的标准是 Fréchet Inception 距离(FID)(Heusel et al., 2017),它基于预训练网络嵌入(如 Inception-v3 模型(Salimans et al., 2016))的高斯近似。

该指标依赖于从 Inception 嵌入中估计高维均值和协方差矩阵。然而,这种依赖大量样本的方法通常需要 50k 样本(Chong and Forsyth, 2020),造成了巨大的开发瓶颈。此外,由于 FID 仅考虑分布的前两个矩,它不是真正的距离度量,并且容易受到对抗性“黑客攻击”,即在不改善视觉效果的情况下人为降低指标值(Sajjadi et al., 2018)。

在这项工作中,我们引入了 Monge Inception 距离(MIND)以解决这些局限性。该指标基于最优传输理论,并以引入最优传输问题的 Gaspard Monge 命名(Monge, 1781)。MIND 利用了切片 Wasserstein 距离(Rabin et al., 2011)。与 FID 依赖高斯简化不同,MIND 通过平均许多一维投影来降低高维最优传输比较的复杂度,其中传输问题通过简单且可并行化的排序操作精确求解。这在避免高维矩阵估计固有的统计不稳定性同时,捕捉到了更细微的分布细节——有关最优传输理论及其应用的现代观点,参见 Villani, 2008;Peyré and Cuturi, 2019。

我们要强调的是,这种方法仅使用 5k 样本即可提供稳定、高质量的评估——比 FID 少一个数量级——同时提供 100 倍更快的计算速度以及对对抗性矩匹配的更高鲁棒性。我们在不同样本量的各种假设检验问题中统计验证了 MIND 的性能。最后,虽然为了便于与当前的 FID 基准进行直接比较,我们使用 Inception-v3 嵌入展示了结果,但 MIND 指标在本质上是与嵌入无关的。它独立于模态,可以无缝应用于任何表示空间,包括 CLIP(Radford et al., 2021)、DINO(Oquab et al., 2024; Siméoni et al., 2025)或用于音频和视频合成的专用嵌入。

**主要贡献。** 在这项工作中,我们引入了 MIND,一种用于改进生成式模型评估的指标。我们展示了该指标的以下优势:

- **样本效率**:我们证明 MIND<sub>5k</sub> 提供了与 FID<sub>50k</sub> 高度相关的稳定评估,使得使用少 10 倍的样本进行可靠基准测试成为可能。
- **计算速度和内存效率**:由于依赖于一维排序而非高维矩阵运算,MIND 的计算速度快 100 倍以上,并且所需的内存减少 10 倍,从而支持训练期间的实时评估。
- **指标鲁棒性**:由于 MIND 衍生自严格的距离度量,我们证明它显著更抗通过矩匹配攻击进行的“指标黑客行为”,此类攻击可人为降低 FID。
- **判别能力**:我们的实验表明,MIND 能更可靠地区分模型检查点,并在低样本量下识别细微的图像扰动。

## 2 生成式模型评估

我们考虑评估生成式模型 $g_\theta$ 的问题,该模型通过映射噪声 $Z \sim \mathcal{N}(0, I)$ 到数据输出(例如图像)$a = g_\theta(Z)$ 来生成输出。在标准实践中,这些输出通过预训练的特征提取模型 $\psi_w$ 传递以获得嵌入。对于 Inception-v3 模型(Szegedy et al., 2016),这些嵌入通常位于维度 $d=2,048$ 的空间中。

模型的性能通过生成嵌入的分布 $X = \psi_w(g_\theta(Z)) \sim p_\theta$ 与真实数据集嵌入的分布 $Y = \psi_w(D) \sim p_{data}$ 之间的统计距离来衡量。在实践中,这种距离使用大小为 $n$ 的有限样本进行估计,记为经验分布 $\hat{p}_{n,\theta}$ 和 $\hat{p}_{n,data}$(参见附录 A)。任何衡量这些分布之间统计距离的措施都可以使用,我们在本工作中考虑了几种 inception 距离,定义如下,对于任意分布间的距离或散度 $\Delta$(参见,例如 Cover, 1999)。

###### 定义 2.1(通用 Inception 距离)。

令 $X = \psi_w(g_\theta(Z)) \sim p_\theta$,$Y = \psi_w(D) \sim p_{data}$。对于分布距离函数 $\Delta$,模型 $g_\theta$ 的性能由 $\Delta_{ID}(p_\theta, p_{data})$ 给出。对于大小为 $n$ 的样本,其经验估计是插件值 $\Delta_{ID}(\hat{p}_{n,\theta}, \hat{p}_{n,data})$。

**图 2 说明**:评估生成式模型采样与数据集距离的通用流程。

### 2.1 现有方法:Fréchet Inception 距离 (FID)

FID 是使用最广泛的 inception 距离实例。它基于前两个矩:均值($\mu$)和协方差($\Sigma$),使用平方 2-Wasserstein 距离 $W_2^2$ 来衡量两个分布之间的距离(参见附录 A.2)。

###### 定义 2.2(Fréchet Inception 距离 - FID)。

令 $X = \psi_w(g_\theta(Z)) \sim p_\theta$ 和 $Y = \psi_w(D) \sim p_{data}$,且 $\mu_X, \Sigma_X$ 和 $\mu_Y, \Sigma_Y$ 分别为 $p_\theta$ 和 $p_{data}$ 的均值和协方差。FID 定义为两个拟合高斯分布之间的平方 2-Wasserstein 距离:

$$
\text{FID}(p_\theta, p_{data}) = \|\mu_X - \mu_Y\|^2 + \text{tr}(\Sigma_X + \Sigma_Y - 2(\Sigma_Y \Sigma_X)^{1/2}).
$$

在实践中,这使用经验样本均值和协方差 $\hat{\mu}_n$ 和 $\hat{\Sigma}_n$ 计算。

这种方法的初衷是通过使用高斯近似来规避直接基于样本的 Wasserstein 距离的高计算和统计复杂度。

##### 缺点

尽管被广泛使用并作为事实上的标准指标,但如多项研究所述(参见,例如 Karras et al., 2017; Stein et al., 2023; Jayasumana et al., 2024; Bischoff et al., 2024; Yang et al., 2026),使用这种距离存在几个缺点:

- 计算此距离基于 $d \times d$ 协方差矩阵 $\hat{\Sigma}_n$ 的估计。当 $n \leq d$ 时,它是秩亏的,这在估计第二项时会造成数值和统计问题,除非样本量至少为 $d$ 量级,对于 inception 网络而言,$d$ 为 2048。对于图像,这意味着通常使用的样本量为 10k 或 50k(Bińkowski et al., 2018; Chong and Forsyth, 2020),这对评估时间和成本产生巨大影响。
- FID 也不是严格的距离(Jayasumana et al., 2024):两个分布可以具有相同的均值和协方差但差异很大(参见,例如 Billingsley, 2017,第 30 节)。我们表明,结果是它并不鲁棒,这一事实可以被利用来在不改变图像视觉效果的情况下人为降低 FID(见第 4.5 节)。

我们还评估了其他作为指标提出的基于 inception 的距离,如最大均值差异(MMD)或 Sinkhorn 散度,作为比较手段。我们在附录中提供了完整定义和讨论(第 A.3 节),并将它们包含在比较中。

## 3 提出的方法:Monge Inception 距离 (MIND)

我们提出以下指标以克服这些挑战,该指标基于切片 Wasserstein 距离,在统计和计算复杂度方面具有多个已知优势。它是分布投影的 Wasserstein 距离在所有单位方向上的平均值(详情参见 Rabin et al., 2011; Nadjahi, 2021 以及本文附录 A.2)。

切片 Wasserstein 距离是一个严格的距离——当且仅当两个分布相等时,它等于 0(Bonnotte, 2013, Proposition 5.1.2)。我们对 MIND 指标使用这种方法,取沿有限多个单位方向投影的 Wasserstein 距离的平均值作为估计。

###### 定义 3.1(Monge Inception 距离)。

令 $X = \psi_w(g_\theta(Z)) \sim p_\theta$ 和 $Y = \psi_w(D) \sim p_{data}$,且 $\mathcal{U}(S)$ 为单位球面上的均匀分布。MIND 通过对沿单位方向的分布投影的 $W_2^2$ 距离进行平均给出,并带有乘法缩放因子 $\alpha = 3d$:

$$
\text{MIND}(p_\theta, p_{data}) = \alpha \mathbb{E}_{u \sim \mathcal{U}(S)}[W_2^2(u^\intercal p_\theta, u^\intercal p_{data})],
$$

其中 $u^\intercal p_\theta$(分别地 $u^\intercal p_{data}$)是当 $X \sim p_\theta$(分别地 $Y \sim p_{data}$)时 $u^\intercal X$(分别地 $u^\intercal Y$)的分布,且 $d$ 是数据维度。

对于有限样本 $(X_j)_{j \in [n]}$,$(Y_j)_{j \in [n]}$,随机单位方向 $(u_i)_{i \in [M]}$ 以及 $\alpha = 3d$,它由下式给出:

$$
\text{MIND}(\hat{p}_{n,\theta}, \hat{p}_{n,data}) = \frac{\alpha}{M} \sum_{i=1}^{M} W_2^2(u_i^\intercal \hat{p}_{n,\theta}, u_i^\intercal \hat{p}_{n,data}) = \frac{\alpha}{nM} \sum_{i=1}^{M} \sum_{j=1}^{n} \|\text{sort}(u_i^\intercal X)_j - \text{sort}(u_i^\intercal Y)_j\|^2.
$$

##### 备注

**图 3 说明**:基于切片 Wasserstein 思想计算的 MIND,以 2D 和单次投影为例。(左) 两个合成嵌入样本(橙色和蓝色),以及单位球面和随机单位方向 $u$。(右下) 沿 $u$ 投影的两个分布直方图。(右上) 相关的累积分布函数(cdf),阴影区域与沿 $u$ 的 1D Wasserstein 距离相关:它是 $W_1$ 距离,并用于所有具有成对排序距离的凸成本。

- MIND 依赖于两个有限样本估计:大小为 $n$ 的样本 $X_j$ 和 $Y_j$ 上的 1D Wasserstein 距离,以及对 $M$ 个随机单位方向 $u_i$ 的期望 $\mathbb{E}_{u \sim \mathcal{U}(S)}$。
- 虽然为了与现有文献保持一致,我们采用了 Inception Distance 的名称,但 MIND 的公式不依赖于 Inception 架构。映射函数 $\psi_w$ 可以表示任何特征提取器;因此,MIND 作为评估不同数据模态和嵌入模型中分布相似性的通用工具。
- 这种 1D 公式允许使用少一个数量级的样本进行更稳定的评估——$n$ 为 5k 量级而不是 50k(见第 4.3 节和 4.4 节)。此外,由于切片 Wasserstein 距离是...

相似文章

FID 彩票:量化生成模型评估中的隐藏随机性

Hugging Face Daily Papers

本文分析了不同训练种子和采样种子下FID分数的方差,揭示了图像生成评估中显著的可重复性问题。它提出了一种新的评估协议,包括误差带和每单元最优引导调整。

MGI: Member vs Generated Inference

arXiv cs.LG

介绍了 Member vs Generated Inference (MGI) 任务,用于区分生成模型中的训练成员与生成输出,并提出了 Data Circuit Breaker (DCB),一种结合自编码器和潜在生成器信号的三阶段方法,在自回归和扩散模型中均优于现有方法。

从生成视角探索空间智能

Hugging Face Daily Papers

研究者推出首个量化多模态模型生成式空间智能的基准 GSI-Bench,通过在图像生成过程中评估 3D 空间约束遵守情况来衡量能力。在合成数据集上微调可显著提升空间编辑保真度与下游空间理解,证明生成式训练能增强空间推理。

用于视觉生成的表示 Fréchet 损失

Papers with Code Trending

本文介绍了 FD-loss,一种通过将总体规模与批次规模解耦,从而将 Fréchet 距离作为视觉生成的训练目标进行优化的方法。研究证明该方法能提高生成器的质量,并指出 FID 可能无法始终准确反映视觉质量。