Abra:扩散图像训练的缩放研究
摘要
本文介绍了针对文本到图像扩散模型的系统性缩放律研究,表明它们可以可预测地缩放,但为了达到最佳训练,每个参数所需的数据远多于语言模型。
查看缓存全文
缓存时间: 2026/08/19 03:58
论文详情页 - Abra:扩展扩散图像训练
来源:https://huggingface.co/papers/2608.17286
摘要
文本到图像扩散模型的缩放定律揭示了可预测的计算最优训练模式,其每个参数所需的数据量远超语言模型,且表现出稳健的过训练行为和普遍的曲线形态。
计算最优(https://huggingface.co/papers?q=Compute-optimal)缩放定律(https://huggingface.co/papers?q=scaling%20laws)已指导前沿语言模型的训练,但在视觉生成领域仍未得到充分探索。我们利用Abra——一个受控的流匹配Transformer(https://huggingface.co/papers?q=flow-matching%20transformers)模型系列,在跨越三个数量级((10^{{19}}) 到 (10^{{22}}) FLOPs)的计算规模下进行了系统性缩放定律研究,达到了远超以往工作的计算预算。我们证明,扩散模型的扩展可预测性与语言模型相当,但为实现最优训练需要更庞大的数据量:计算最优状态大约出现在每个参数对应200个图像标记时,这是Chinchilla(https://huggingface.co/papers?q=Chinchilla)为大语言模型提出的计算最优(https://huggingface.co/papers?q=compute-optimal)处方所需数据量的十倍。研究表明,与语言模型不同,扩散模型对过训练具有稳健性,从业者应优先保证数据量而非盲目增大模型规模。最后,我们展示这种可预测性不仅体现在训练损失上,还延伸至生成质量指标(https://huggingface.co/papers?q=generative%20quality%20metrics)、最优CFG(https://huggingface.co/papers?q=CFG)设置、表示质量(https://huggingface.co/papers?q=representation%20quality),甚至训练曲线的形态也会收敛为统一形式。
查看arXiv页面 (https://arxiv.org/abs/2608.17286) 查看PDF (https://arxiv.org/pdf/2608.17286) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.17286)
引用本文的模型 0
暂无模型关联本文 在模型README.md中引用 arxiv.org/abs/2608.17286 即可从本页面关联。
引用本文的数据集 0
暂无数据集关联本文 在数据集README.md中引用 arxiv.org/abs/2608.17286 即可从本页面关联。
引用本文的Spaces 0
暂无Space关联本文 在Space README.md中引用 arxiv.org/abs/2608.17286 即可从本页面关联。
包含本文的收藏夹 0
暂无收藏夹包含本文 将本论文添加到收藏夹 (https://huggingface.co/new-collection) 即可从本页面关联。
相似文章
像素空间文本到图像扩散模型的训练实证研究
本文针对像素空间文本到图像扩散模型提出了一种从潜在空间到像素空间的训练策略,加速了收敛并提高了推理速度,同时性能与潜在空间模型相当或更优。
视觉生成中文本条件化的缩放特性
本文研究了视觉生成中文本条件化的经验缩放特性,表明收敛的扩散损失随提示中的结构化语言而变化,并引入了改进可扩散性和可提示性的方法。
Nemotron-Labs-Diffusion-Image:推进掩蔽离散扩散实现高分辨率图像合成
本文提出 Nemotron-Labs-Diffusion-Image,一种用于高分辨率文生图的掩蔽离散扩散模型,引入令牌编辑机制和分组交叉熵目标,以改进令牌精炼和训练效率。
神经语言模型的缩放规律
基础性实证研究,展示了语言模型性能与模型规模、数据集大小和计算预算之间的幂律缩放关系,对最优训练资源分配和样本效率有重要启示。
i1:一个简单且完全开放的强文本到图像模型配方
本文介绍了i1,一个3B参数的文本到图像扩散模型,在性能上与领先的闭源模型竞争,同时完全开放(权重、数据、代码)。它提供了来自300多项控制实验的见解,并为开放研究提供了实用配方。