视觉生成中文本条件化的缩放特性
摘要
本文研究了视觉生成中文本条件化的经验缩放特性,表明收敛的扩散损失随提示中的结构化语言而变化,并引入了改进可扩散性和可提示性的方法。
查看缓存全文
缓存时间: 2026/08/03 05:30
论文页面 - 视觉生成中文本条件化的缩放性质
来源:https://huggingface.co/papers/2607.29679
摘要
我们研究了视觉生成中文本条件化的经验缩放性质。由于扩散损失不会随自然语言提示中的标记数量而缩放,这类性质很少被测量。令人惊讶的是,我们发现收敛后的扩散损失会随提示中结构化语言的数量而缩放。为了量化结构化语言,我们采用了两种互补的度量方式:一种白盒似然度量(GPG)和一种黑盒属性度量(ED)。在受控训练过程中,收敛后的扩散损失大致随GPG线性下降,并随ED呈幂律关系。在这些缩放性质的指导下,我们通过构建带有从图像中提取的语义和几何注释的结构化提示来提升可扩散性,并通过监督微调、冷启动和验证器门控的在线策略蒸馏来训练提示器,从而提升可提示性。最终系统在几乎所有组合、推理和世界知识基准测试上均优于所有已评估的开源权重模型,并在大多数评估上达到或超过最强的闭源权重模型。
查看 arXiv 页面 (https://arxiv.org/abs/2607.29679) 查看 PDF (https://arxiv.org/pdf/2607.29679) 项目页面 (https://heheyas.github.io/context-scaling/) GitHub2 (https://github.com/heheyas/context-scaling) 添加至收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.29679)
引用此论文的模型 0
暂无模型关联此论文
在模型的 README.md 中引用 arxiv.org/abs/2607.29679 以从本页链接它。
引用此论文的数据集 0
暂无数据集关联此论文
在数据集的 README.md 中引用 arxiv.org/abs/2607.29679 以从本页链接它。
引用此论文的 Spaces 0
暂无 Space 关联此论文
在 Space 的 README.md 中引用 arxiv.org/abs/2607.29679 以从本页链接它。
包含此论文的收藏集 0
暂无收藏集包含此论文
将此论文添加至收藏集 (https://huggingface.co/new-collection) 以从本页链接它。
相似文章
扩展与蒸馏文本嵌入以提升扩散性
该论文指出,扩展文本嵌入(例如将 T5-small 换成 T5Gemma-2-270M)能大幅改进连续扩散语言模型,而将扩展后的嵌入蒸馏到一个连通性更强的潜在空间,可使其更易生成——最终在 Gen. PPL 上达到 17.8,优于 GPT-2-M。
Abra:扩散图像训练的缩放研究
本文介绍了针对文本到图像扩散模型的系统性缩放律研究,表明它们可以可预测地缩放,但为了达到最佳训练,每个参数所需的数据远多于语言模型。
在推理时将图像指导注入文本条件扩散模型
视觉概念融合(VCF)使得扩散模型在推理时能够同时以图像和文本提示作为条件,无需重新训练,通过轻量级对齐器和融合策略实现。
像素空间文本到图像扩散模型的训练实证研究
本文针对像素空间文本到图像扩散模型提出了一种从潜在空间到像素空间的训练策略,加速了收敛并提高了推理速度,同时性能与潜在空间模型相当或更优。
面向主体驱动生成的多模态大语言模型能力挖掘
本文提出了一种新颖的方法,将扩散模型以多模态大语言模型(MLLMs)为条件,用于主体驱动图像生成,使用基于VAE的身份条件化和双层聚合模块,提高语义理解和身份保持,同时减轻复制粘贴伪影。