视觉生成中文本条件化的缩放特性

Hugging Face Daily Papers 论文

摘要

本文研究了视觉生成中文本条件化的经验缩放特性,表明收敛的扩散损失随提示中的结构化语言而变化,并引入了改进可扩散性和可提示性的方法。

我们研究了视觉生成中文本条件化的经验缩放特性。由于扩散损失不随自然语言提示中的标记数量缩放,这些特性很少被测量。令人惊讶的是,我们发现收敛的扩散损失随提示中结构化语言的数量缩放。为了量化结构化语言,我们采用了两种互补的度量:白盒似然度量(GPG)和黑盒属性度量(ED)。在受控训练过程中,收敛的扩散损失随GPG近似线性下降,并随ED呈幂律关系。在这些缩放特性的指导下,我们通过构建包含从图像中提取的语义和几何注释的结构化提示来提高可扩散性,并通过监督微调、冷启动和验证器门控的在线策略蒸馏来训练提示器以提高可提示性。在几乎所有组合、推理和世界知识基准测试中,所得到的系统优于所有评估过的开放权重模型,同时在大多数评估中达到或超过最强的闭源权重模型。
查看原文
查看缓存全文

缓存时间: 2026/08/03 05:30

论文页面 - 视觉生成中文本条件化的缩放性质

来源:https://huggingface.co/papers/2607.29679

摘要

我们研究了视觉生成中文本条件化的经验缩放性质。由于扩散损失不会随自然语言提示中的标记数量而缩放,这类性质很少被测量。令人惊讶的是,我们发现收敛后的扩散损失会随提示中结构化语言的数量而缩放。为了量化结构化语言,我们采用了两种互补的度量方式:一种白盒似然度量(GPG)和一种黑盒属性度量(ED)。在受控训练过程中,收敛后的扩散损失大致随GPG线性下降,并随ED呈幂律关系。在这些缩放性质的指导下,我们通过构建带有从图像中提取的语义和几何注释的结构化提示来提升可扩散性,并通过监督微调、冷启动和验证器门控的在线策略蒸馏来训练提示器,从而提升可提示性。最终系统在几乎所有组合、推理和世界知识基准测试上均优于所有已评估的开源权重模型,并在大多数评估上达到或超过最强的闭源权重模型。

查看 arXiv 页面 (https://arxiv.org/abs/2607.29679) 查看 PDF (https://arxiv.org/pdf/2607.29679) 项目页面 (https://heheyas.github.io/context-scaling/) GitHub2 (https://github.com/heheyas/context-scaling) 添加至收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.29679)

引用此论文的模型 0

暂无模型关联此论文

在模型的 README.md 中引用 arxiv.org/abs/2607.29679 以从本页链接它。

引用此论文的数据集 0

暂无数据集关联此论文

在数据集的 README.md 中引用 arxiv.org/abs/2607.29679 以从本页链接它。

引用此论文的 Spaces 0

暂无 Space 关联此论文

在 Space 的 README.md 中引用 arxiv.org/abs/2607.29679 以从本页链接它。

包含此论文的收藏集 0

暂无收藏集包含此论文

将此论文添加至收藏集 (https://huggingface.co/new-collection) 以从本页链接它。

相似文章

扩展与蒸馏文本嵌入以提升扩散性

Hugging Face Daily Papers

该论文指出,扩展文本嵌入(例如将 T5-small 换成 T5Gemma-2-270M)能大幅改进连续扩散语言模型,而将扩展后的嵌入蒸馏到一个连通性更强的潜在空间,可使其更易生成——最终在 Gen. PPL 上达到 17.8,优于 GPT-2-M。

Abra:扩散图像训练的缩放研究

Hugging Face Daily Papers

本文介绍了针对文本到图像扩散模型的系统性缩放律研究,表明它们可以可预测地缩放,但为了达到最佳训练,每个参数所需的数据远多于语言模型。

面向主体驱动生成的多模态大语言模型能力挖掘

Hugging Face Daily Papers

本文提出了一种新颖的方法,将扩散模型以多模态大语言模型(MLLMs)为条件,用于主体驱动图像生成,使用基于VAE的身份条件化和双层聚合模块,提高语义理解和身份保持,同时减轻复制粘贴伪影。