TILT:利用模型内在奖励提升扩散模型中的组合生成
摘要
TILT是一种无需训练的框架,通过使用模型内在奖励在测试时对齐采样轨迹,从而改善扩散模型中的组合生成,无需外部监督即可增强对复杂提示的忠实度。
查看缓存全文
缓存时间: 2026/07/28 18:26
论文页面 - TILT: 利用模型内在奖励改进扩散模型的组合生成
来源: https://huggingface.co/papers/2607.21606
摘要
近年来,强大的文生图生成模型取得了显著进展,这使得开发测试时方法(通过修改采样轨迹以生成更忠实于复杂组合提示的图像)变得愈发重要。本文提出 TILT,一种基于测试时奖励对齐的无训练组合文生图框架。我们将组合失败解释为联合概念分布与单一概念分布之间的重叠模式,并定义了一个奖励函数,该函数偏好所有概念共同出现的样本。该奖励内置于基础模型中,无需任何外部监督或奖励模型。由此得到一个 KL 约束的目标函数,具有闭式偏移目标分布和原则性的扩散采样引导步骤。概念分布的相互作用与上述奖励自然衍生出两种不同的引导策略,而一种平衡各自优势的混合方法则能产生更强的性能。在 T2ICompBench 提示上的实验表明,与先前基线相比,我们的方法在保持图像质量的同时提升了组合对齐效果。
查看 arXiv 页面 (https://arxiv.org/abs/2607.21606)查看 PDF (https://arxiv.org/pdf/2607.21606)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.21606)
将这篇论文加入您的 agent:
hf papers read 2607.21606
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用该论文的模型0
暂无模型关联此论文
请在模型 README.md 中引用 arxiv.org/abs/2607.21606,以从本页链接到该论文。
引用该论文的数据集0
暂无数据集关联此论文
请在数据集 README.md 中引用 arxiv.org/abs/2607.21606,以从本页链接到该论文。
引用该论文的 Spaces0
暂无 Space 关联此论文
请在 Space README.md 中引用 arxiv.org/abs/2607.21606,以从本页链接到该论文。
包含该论文的收藏集0
暂无收藏集包含此论文
将这篇论文添加到一个收藏集 (https://huggingface.co/new-collection) 以从本页链接到它。
相似文章
可学习性引导的扩散语言模型微调
我们提出LIFT,一种可学习性引导的扩散语言模型微调算法,该算法根据 token 难度和时间步对齐训练,在推理基准测试上取得了显著提升。
通过指数倾斜的扩散引导搜索(DiffTilt):在安全关键系统反证中的应用
本文提出了DiffTilt,一种分布性框架,通过指数倾斜扩散模型在环境和执行上的联合分布,高效发现自主系统和信息物理系统中的罕见安全关键故障,在ARCH-COMP基准测试和一个新的拖挂卡车基准测试中优于条件采样策略。
我们真的在倾斜吗?流模型与扩散模型中奖励引导的机制
本文解释了奖励引导的流模型和扩散模型中奖励作弊的根本原因,将其归因于Doob h函数的有限粒子插件估计,并提出了一种奖励阻尼调度方案,在不增加计算成本的情况下校正模态内偏差。
通过奖励倾斜分布匹配强化少步生成器
RTDMD是一个两阶段框架,结合分布匹配蒸馏与奖励引导的强化学习,以改进少步图像生成与人类偏好的一致性。它在仅需4步推理的情况下,在多个模型上取得了最先进的结果。
DRIFT: 解耦轨迹展开与重要性加权微调以实现高效多轮优化
本文提出DRIFT框架,该框架结合离线轨迹与重要性加权监督微调,高效实现与强化学习相当的多轮交互学习性能。