视觉生成中文本条件化的缩放特性
摘要
本文研究了视觉生成中文本条件化的经验缩放特性,表明收敛的扩散损失随提示中的结构化语言而变化,并引入了改进可扩散性和可提示性的方法。
查看缓存全文
缓存时间: 2026/08/03 05:30
论文页面 - 视觉生成中文本条件化的缩放性质
来源:https://huggingface.co/papers/2607.29679
摘要
我们研究了视觉生成中文本条件化的经验缩放性质。由于扩散损失不会随自然语言提示中的标记数量而缩放,这类性质很少被测量。令人惊讶的是,我们发现收敛后的扩散损失会随提示中结构化语言的数量而缩放。为了量化结构化语言,我们采用了两种互补的度量方式:一种白盒似然度量(GPG)和一种黑盒属性度量(ED)。在受控训练过程中,收敛后的扩散损失大致随GPG线性下降,并随ED呈幂律关系。在这些缩放性质的指导下,我们通过构建带有从图像中提取的语义和几何注释的结构化提示来提升可扩散性,并通过监督微调、冷启动和验证器门控的在线策略蒸馏来训练提示器,从而提升可提示性。最终系统在几乎所有组合、推理和世界知识基准测试上均优于所有已评估的开源权重模型,并在大多数评估上达到或超过最强的闭源权重模型。
查看 arXiv 页面 (https://arxiv.org/abs/2607.29679) 查看 PDF (https://arxiv.org/pdf/2607.29679) 项目页面 (https://heheyas.github.io/context-scaling/) GitHub2 (https://github.com/heheyas/context-scaling) 添加至收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.29679)
引用此论文的模型 0
暂无模型关联此论文
在模型的 README.md 中引用 arxiv.org/abs/2607.29679 以从本页链接它。
引用此论文的数据集 0
暂无数据集关联此论文
在数据集的 README.md 中引用 arxiv.org/abs/2607.29679 以从本页链接它。
引用此论文的 Spaces 0
暂无 Space 关联此论文
在 Space 的 README.md 中引用 arxiv.org/abs/2607.29679 以从本页链接它。
包含此论文的收藏集 0
暂无收藏集包含此论文
将此论文添加至收藏集 (https://huggingface.co/new-collection) 以从本页链接它。
相似文章
在推理时将图像指导注入文本条件扩散模型
视觉概念融合(VCF)使得扩散模型在推理时能够同时以图像和文本提示作为条件,无需重新训练,通过轻量级对齐器和融合策略实现。
面向主体驱动生成的多模态大语言模型能力挖掘
本文提出了一种新颖的方法,将扩散模型以多模态大语言模型(MLLMs)为条件,用于主体驱动图像生成,使用基于VAE的身份条件化和双层聚合模块,提高语义理解和身份保持,同时减轻复制粘贴伪影。
Kathleen写作:无注意力机制的自回归生成与数据规模扩展
Kathleen系列的这篇论文表明,一个约0.5M参数、无注意力机制的字节级模型在WikiText-103语言建模和生成上可以击败参数匹配的transformer;引入了一种非参数的“形式距离”(Form Distance)度量来评估文本真实感;并证明从模型自身训练语料库进行检索增强解码能提高生成质量。
超越提示:面向分布外形状的无条件三维反演
本文识别并解决了文本到三维生成模型中的“潜在汇陷阱”问题,即模型对文本提示变得不敏感。我们提出了一个框架,将几何表示与语言敏感性解耦,从而实现对分布外形状的稳健文本驱动三维形状编辑。
CRoCoDiL: 用于语言的连续且鲁棒的条件扩散
CRoCoDiL提出了一种用于语言的连续且鲁棒的条件扩散方法,将掩码扩散模型转移到连续语义空间中,相比LLaDA等离散方法,生成质量更优,采样速度快10倍。