TILT:利用模型内在奖励提升扩散模型中的组合生成

Hugging Face Daily Papers 论文

摘要

TILT是一种无需训练的框架,通过使用模型内在奖励在测试时对齐采样轨迹,从而改善扩散模型中的组合生成,无需外部监督即可增强对复杂提示的忠实度。

近期强大的文本到图像生成模型的进展,使得开发测试时方法以修改采样轨迹、生成更忠实于复杂组合提示的图像变得日益重要。我们提出了TILT,一种通过测试时奖励对齐实现组合文本到图像生成的免训练框架。我们将组合失败解释为联合分布与单一概念分布之间的重叠模式,并定义了一种奖励,该奖励倾向于所有概念共同出现的样本。此奖励是基础模型内在的,无需任何外部监督或奖励模型。这产生了一个KL约束目标,具有封闭形式的倾斜目标分布以及用于扩散采样的原则性引导步骤。概念分布与上述奖励的相互作用自然导致了两种不同的引导策略,而平衡各自优势的混合方法则产生了更强的性能。在T2ICompBench上的提示实验表明,与之前的基线相比,我们的方法在保持图像质量的同时提高了组合对齐度。
查看原文
查看缓存全文

缓存时间: 2026/07/28 18:26

论文页面 - TILT: 利用模型内在奖励改进扩散模型的组合生成

来源: https://huggingface.co/papers/2607.21606

摘要

近年来,强大的文生图生成模型取得了显著进展,这使得开发测试时方法(通过修改采样轨迹以生成更忠实于复杂组合提示的图像)变得愈发重要。本文提出 TILT,一种基于测试时奖励对齐的无训练组合文生图框架。我们将组合失败解释为联合概念分布与单一概念分布之间的重叠模式,并定义了一个奖励函数,该函数偏好所有概念共同出现的样本。该奖励内置于基础模型中,无需任何外部监督或奖励模型。由此得到一个 KL 约束的目标函数,具有闭式偏移目标分布和原则性的扩散采样引导步骤。概念分布的相互作用与上述奖励自然衍生出两种不同的引导策略,而一种平衡各自优势的混合方法则能产生更强的性能。在 T2ICompBench 提示上的实验表明,与先前基线相比,我们的方法在保持图像质量的同时提升了组合对齐效果。

查看 arXiv 页面 (https://arxiv.org/abs/2607.21606)查看 PDF (https://arxiv.org/pdf/2607.21606)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.21606)

将这篇论文加入您的 agent:

hf papers read 2607.21606

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用该论文的模型0

暂无模型关联此论文

请在模型 README.md 中引用 arxiv.org/abs/2607.21606,以从本页链接到该论文。

引用该论文的数据集0

暂无数据集关联此论文

请在数据集 README.md 中引用 arxiv.org/abs/2607.21606,以从本页链接到该论文。

引用该论文的 Spaces0

暂无 Space 关联此论文

请在 Space README.md 中引用 arxiv.org/abs/2607.21606,以从本页链接到该论文。

包含该论文的收藏集0

暂无收藏集包含此论文

将这篇论文添加到一个收藏集 (https://huggingface.co/new-collection) 以从本页链接到它。

相似文章

可学习性引导的扩散语言模型微调

arXiv cs.CL

我们提出LIFT,一种可学习性引导的扩散语言模型微调算法,该算法根据 token 难度和时间步对齐训练,在推理基准测试上取得了显著提升。

通过奖励倾斜分布匹配强化少步生成器

Hugging Face Daily Papers

RTDMD是一个两阶段框架,结合分布匹配蒸馏与奖励引导的强化学习,以改进少步图像生成与人类偏好的一致性。它在仅需4步推理的情况下,在多个模型上取得了最先进的结果。