Abra:扩散图像训练的缩放研究

Hugging Face Daily Papers 论文

摘要

本文介绍了针对文本到图像扩散模型的系统性缩放律研究,表明它们可以可预测地缩放,但为了达到最佳训练,每个参数所需的数据远多于语言模型。

计算最优缩放律指导前沿语言模型的训练,但在视觉生成领域基本上尚未被探索。我们使用 Abra 进行了一项针对文本到图像扩散模型的系统性缩放律研究,Abra 是一个可控的流匹配变换器系列,训练涵盖了三个数量级的计算量(10^{19} 到 10^{22} FLOPs),达到了比以往工作大得多的计算预算。我们证明扩散模型的缩放可预测性与语言模型相当,但为了达到最佳训练需要多得多的数据:计算最优性大约在每个参数 200 个图像 token 时出现,这是 Chinchilla 计算最优方案的十倍,适用于 LLMs。我们表明,与语言模型不同,扩散模型对过训练具有鲁棒性,并且实践者应该倾向于使用更多数据而不是更大的模型。最后,我们表明这种可预测性不仅限于训练损失,还扩展到生成质量指标、最佳 CFG 设置、表示质量,甚至训练曲线的形状,这些曲线都塌缩成一种通用形式。
查看原文
查看缓存全文

缓存时间: 2026/08/19 03:58

论文详情页 - Abra:扩展扩散图像训练

来源:https://huggingface.co/papers/2608.17286

摘要

文本到图像扩散模型的缩放定律揭示了可预测的计算最优训练模式,其每个参数所需的数据量远超语言模型,且表现出稳健的过训练行为和普遍的曲线形态。

计算最优(https://huggingface.co/papers?q=Compute-optimal)缩放定律(https://huggingface.co/papers?q=scaling%20laws)已指导前沿语言模型的训练,但在视觉生成领域仍未得到充分探索。我们利用Abra——一个受控的流匹配Transformer(https://huggingface.co/papers?q=flow-matching%20transformers)模型系列,在跨越三个数量级((10^{{19}}) 到 (10^{{22}}) FLOPs)的计算规模下进行了系统性缩放定律研究,达到了远超以往工作的计算预算。我们证明,扩散模型的扩展可预测性与语言模型相当,但为实现最优训练需要更庞大的数据量:计算最优状态大约出现在每个参数对应200个图像标记时,这是Chinchilla(https://huggingface.co/papers?q=Chinchilla)为大语言模型提出的计算最优(https://huggingface.co/papers?q=compute-optimal)处方所需数据量的十倍。研究表明,与语言模型不同,扩散模型对过训练具有稳健性,从业者应优先保证数据量而非盲目增大模型规模。最后,我们展示这种可预测性不仅体现在训练损失上,还延伸至生成质量指标(https://huggingface.co/papers?q=generative%20quality%20metrics)、最优CFG(https://huggingface.co/papers?q=CFG)设置、表示质量(https://huggingface.co/papers?q=representation%20quality),甚至训练曲线的形态也会收敛为统一形式。

查看arXiv页面 (https://arxiv.org/abs/2608.17286) 查看PDF (https://arxiv.org/pdf/2608.17286) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.17286)

引用本文的模型 0

暂无模型关联本文 在模型README.md中引用 arxiv.org/abs/2608.17286 即可从本页面关联。

引用本文的数据集 0

暂无数据集关联本文 在数据集README.md中引用 arxiv.org/abs/2608.17286 即可从本页面关联。

引用本文的Spaces 0

暂无Space关联本文 在Space README.md中引用 arxiv.org/abs/2608.17286 即可从本页面关联。

包含本文的收藏夹 0

暂无收藏夹包含本文 将本论文添加到收藏夹 (https://huggingface.co/new-collection) 即可从本页面关联。

相似文章

视觉生成中文本条件化的缩放特性

Hugging Face Daily Papers

本文研究了视觉生成中文本条件化的经验缩放特性,表明收敛的扩散损失随提示中的结构化语言而变化,并引入了改进可扩散性和可提示性的方法。

神经语言模型的缩放规律

OpenAI Blog

基础性实证研究,展示了语言模型性能与模型规模、数据集大小和计算预算之间的幂律缩放关系,对最优训练资源分配和样本效率有重要启示。

i1:一个简单且完全开放的强文本到图像模型配方

Hugging Face Daily Papers

本文介绍了i1,一个3B参数的文本到图像扩散模型,在性能上与领先的闭源模型竞争,同时完全开放(权重、数据、代码)。它提供了来自300多项控制实验的见解,并为开放研究提供了实用配方。