@GoogleResearch:什么驱动了扩散模型的创造力(即其生成新数据而非记忆的能力)?今天我们…

X AI KOLs Timeline 论文

摘要

Google Research 表明,扩散模型的创造力是神经网络正则化导致得分平滑和插值的数学结果,揭开了它们能够生成新数据而不仅仅是记忆的能力的神秘面纱。

什么驱动了扩散模型的创造力(即其生成新数据而非记忆的能力)?今天我们表明这是神经网络正则化导致得分平滑和插值的数学结果。阅读博客了解更多:https://t.co/JlcZyOy0ey
查看原文
查看缓存全文

缓存时间: 2026/07/17 00:25

扩散模型的创造力(即生成新颖数据而非记忆的能力)源自何处?今天我们将证明,这是神经网络正则化导致评分平滑与插值的数学必然结果。阅读博客了解更多:https://t.co/JlcZyOy0ey


揭开扩散模型创造力的神秘面纱

来源:https://research.google/blog/towards-demystifying-the-creativity-of-diffusion-models/?utm_source=twitter&utm_medium=social&utm_campaign=social_post&utm_content=gr-acct 扩散模型(https://en.wikipedia.org/wiki/Diffusion_model)是当前处理需要复杂局部结构的生成任务(如图像生成和分子发现)最强大的工具之一。它们展现出超越训练数据进行泛化的惊人能力,从某种意义上说,这体现了一种“创造力“。例如,在使用真实图像数据集训练后,它们能将随机噪声样本转化为新颖的高质量图像。

这种创造能力固然令人印象深刻,却引出一个耐人寻味的问题:这种能力从何而来?理解这个问题,是揭开基于扩散的生成式AI“黑箱“本质的重要一步。

为此,在即将发表于ICLR 2026(https://iclr.cc/virtual/2026/poster/10009816)的论文《论扩散模型中评分平滑的插值效应》(https://arxiv.org/pdf/2502.19499v3)中,我们基于现有研究文献,深入扩散模型的数学原理来回答这一问题。我们证明,模型的创造力并非偶然。相反,它是神经网络(https://en.wikipedia.org/wiki/Neural_network_(machine_learning))训练过程中自然而然地“平滑“了从噪声到数据的转换过程所导致的结果。

理解去噪

训练扩散模型首先需要获取一组真实训练数据样本(比如猫照片),并故意用噪声污染这些样本,直到它们变得完全无法识别。然后训练模型逐步逆转这一污染过程,使其能从纯噪声中重建出逼真的图像,这一过程称为去噪(https://arxiv.org/pdf/1503.03585)。

如果模型基于训练样本完美地学会了执行这一去噪过程,那么在部署时它应该生成这些样本的精确副本(这种行为被称为记忆化(https://arxiv.org/pdf/2301.13188))。在这种情况下,模型扮演的是检索工具的角色,而非能够生成新颖输出的创造性引擎。

然而在实践中,扩散模型通常不只是记忆,它们会泛化并生成新的数据样本。

为了理解扩散模型实际如何对数据进行去噪,可以想象随机噪声如同散布在房间中的气体粒子云,而一个“力场“将每个粒子拉向特定方向,直到它们形成有意义的形状。在扩散模型中,移动的粒子是正在经历去噪的各个数据点。这个“力场“就是评分函数(https://en.wikipedia.org/wiki/Informant_(statistics))(SF),它从训练数据中学习而来,并决定粒子在任何给定时刻应该流向何处。

如果模型依赖于从训练数据中完美学习到的评分函数,那么力场将驱使粒子到达恰好复制训练数据点的位置(即记忆化)。

扩散模型的创造力:一维示例

我们发现,扩散模型的创造力实际上源于神经网络通常学习方式的近似性:由于正则化(https://en.wikipedia.org/wiki/Regularization_(mathematics))导致不完美的训练,自然会使得学习到的评分函数产生轻微模糊,这一过程称为“评分平滑“(Scarvelis等人,TMLR 2025(https://arxiv.org/pdf/2310.12395))。这进而导致去噪过程生成的数据插值(https://en.wikipedia.org/wiki/Interpolation)(即落在训练点之间的空间),从而创造出新的合理数据样本。

想象一个只有两个训练数据点(+1和-1)的一维世界。在去噪过程的后期,“完美“的评分函数如下图中弯曲的灰色线条所示,它在两个点之间的中点处有一个陡峭的符号变化,意味着在0附近拉力方向快速切换。换句话说,整个空间几乎被清晰地分成两半,左侧的粒子被拉向-1,右侧的粒子被拉向+1。最终,每个粒子都收敛到两个训练数据点之一,从而发生记忆化。

然而在实践中,扩散模型并不能访问“完美“的评分函数,而是使用神经网络学习到的近似版本。由于训练过程中权重衰减(https://arxiv.org/abs/1711.05101)的正则化效应,神经网络很难学习具有这种陡峭悬崖的函数。相反,它们倾向于学习“完美“评分函数的更平滑版本,将陡峭的下降缓和成更平缓的坡度。为了说明这一点,我们设计了一个实验,训练两层ReLU(https://en.wikipedia.org/wiki/Rectified_linear_unit)神经网络来拟合一维示例中的评分函数,使用流行的AdamW算法(https://optax.readthedocs.io/en/latest/api/optimizers.html#optax.adamw)优化神经网络参数,并应用不同程度的权重衰减(WD)。

权重衰减越强,学习到的评分函数在中间区域就越平滑,这意味着该区域的粒子流动速度比以前更慢,最终将停留在两个训练数据点之间的“插值区“内。

在论文中,我们通过将神经网络正则化的函数空间理论(Savarese等人,COLT 2019(https://proceedings.mlr.press/v99/savarese19a.html))与去噪的数学原理相结合,量化了这种联系。此外,我们的实验(https://github.com/google-research/diffusion-score-smoothing)还表明,即使没有权重衰减等显式正则化策略,评分平滑也可能源于基于梯度的算法训练的神经网络中存在的隐式正则化(https://chinmayhegde.github.io/fodl/generalization01/)效应,其他研究如Vastola(ICLR 2025)(https://arxiv.org/pdf/2504.12532)、Wang和Pehlevan(NeurIPS 2025)(https://arxiv.org/pdf/2503.03206)以及Bonnaire等人(NeurIPS 2025)(https://arxiv.org/pdf/2505.17638)也使用不同技术对此进行了研究。

评分平滑促进流形恢复

在现实世界中,高分辨率图像等复杂数据存在于高维像素空间中,而非简单的一维世界。然而,该空间的绝大部分只是对人眼无意义的随机噪声。只有一小部分数据点对应于可识别的图像,它们存在于所谓的数据流形(https://en.wikipedia.org/wiki/Manifold_hypothesis)中(就像嵌入更大空间中的一张薄片)。模型事先不知道数据流形的形状和位置。因此,图像生成可以被视为一项流形恢复(https://arxiv.org/pdf/2206.01018)任务,模型需要根据从中采样的有限训练数据来推断隐藏数据流形的样子,然后提出流形上的新点,这些新点将对应新颖且有意义的图像。事实证明,评分平滑对于扩散模型实现这一目标至关重要。

值得注意的是,在多维环境中,评分平滑的效果以方向相关的方式显现。沿着与隐藏数据流形平行(或“切向(https://en.wikipedia.org/wiki/Tangent)“)的方向,它会产生类似一维场景中的减速效应。然而,沿着指向流形的方向,“完美“评分函数已经相对平滑(实际上,如果流形是平坦的,它只是一条直线),进一步平滑并不会带来太大差异。

因此,评分平滑并非在所有方向上对粒子流施加刹车(那样会使粒子停滞在嘈杂的空旷空间中,导致最终图像模糊),而是不会减慢它们向流形收敛(https://arxiv.org/pdf/2208.05314)的速度,只会降低它们沿切向方向向训练数据坍缩的趋势。通过这种方式,模型在质量和新颖性之间取得了平衡:生成的图像既逼真(因为它们成功到达了有意义的数据流形),又新颖(因为它们落入了原始训练数据点之间的空白区域)。

结论

我们的发现表明,我们称之为扩散模型的“创造力“可能实际上是一种可预测的数学结果。由于神经网络从来都不是“完美“尖锐的,它们会在已知数据之间建立插值桥梁。在图像生成或药物发现中,这可能意味着扩散模型不仅仅是记住了它所看到的两种不同猫的图像或药物分子;它还会探索它们周围的空间,提出第三种全新的图像或分子构型,融合了二者的痕迹。

我们的工作只是阐明这一机制的初步尝试,其他研究者已经研究了当数据分布(https://arxiv.org/pdf/2510.02305)或神经网络架构(https://arxiv.org/pdf/2412.20292)变得更复杂以及处理条件生成(https://arxiv.org/pdf/2512.18736)任务时会发生什么。通过证明这种行为根本上源于神经网络的学习方式,我们可以开始有意识地构建更好的“插值器“模型,以确保它们保持创造引擎的特性,同时避免盲目记忆的陷阱。我们还发布了论文中用于生成图示的数值实验代码(https://github.com/google-research/diffusion-score-smoothing)以及论文(https://arxiv.org/pdf/2502.19499v3)。

致谢

我们感谢Sreenivas Gollapudi和Ravi Kumar对项目的支持,以及Mark Simborg和Kimberly Schwede协助准备这篇博文。我们请读者参阅我们的论文,以了解本文所依托的丰富研究文献。

相似文章

DiffusionGemma:开发者指南 - Google Developers Blog

Reddit r/LocalLLaMA

DiffusionGemma 是 Google DeepMind 推出的全新实验模型,可在 256 令牌画布上实现并行生成,在 GPU 上令牌生成速度提升高达 4 倍。本开发者指南阐述了其架构、双向上下文,并提供了用于解决数独的微调配方。

循环去噪揭示扩散模型中的超稳定记忆

arXiv cs.LG

循环去噪作为一种新颖的提取攻击方法,通过反复对样本进行加噪和去噪,揭示了扩散模型中超稳定的记忆训练图像。该技术无需梯度或权重检查,对隐私审计具有重要意义。